Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Welche Art der Nachanpassungsanalyse von Residuen verwenden Sie?
Wenn ich eine multiple lineare OLS-Regression durchführe, anstatt die Residuen gegen angepasste Werte zu zeichnen, zeichne ich die (internen) studentisierten Residuen gegen angepasste Werte (ebenso für Kovariaten). Diese Residuen sind definiert als: e∗i=eis2(1−hii)−−−−−−−−−√ei∗=eis2(1−hii)\begin{equation} e^*_i = \frac{e_i}{\sqrt{s^2 (1-h_{ii})}} \end{equation} wobei der Rest ist und die diagonalen Elemente der sind. Um diese …


5
Welche anderen normalisierenden Transformationen werden üblicherweise über die üblichen hinaus verwendet, wie Quadratwurzel, Log usw.?
Bei der Analyse von Testergebnissen (z. B. in der Pädagogik oder Psychologie) gehen gängige Analysetechniken häufig davon aus, dass die Daten normal verteilt sind. Vielleicht meistens jedoch weichen die Punktzahlen manchmal stark vom Normalwert ab. Ich kenne einige grundlegende normalisierende Transformationen wie Quadratwurzeln, Logarithmen, reziproke Transformationen zum Reduzieren des positiven …



1
Schätzung der Variabilität über die Zeit
Ich habe einen Datensatz, der ~ 7.500 Blutuntersuchungen von ~ 2.500 Personen enthält. Ich versuche herauszufinden, ob die Variabilität der Blutuntersuchungen mit der Zeit zwischen zwei Tests zunimmt oder abnimmt. Zum Beispiel: Ich ziehe Ihr Blut für den Basistest und ziehe dann sofort eine zweite Probe. Sechs Monate später ziehe …

2
Was ist der Unterschied zwischen funktionaler Datenanalyse und hochdimensionaler Datenanalyse?
In der statistischen Literatur gibt es viele Verweise auf " Funktionsdaten " (dh Daten, die Kurven sind) und parallel auf " hochdimensionale Daten " (dh wenn Daten hochdimensionale Vektoren sind). Meine Frage betrifft den Unterschied zwischen den beiden Datentypen. Wenn von angewandten statistischen Methoden gesprochen wird, die in Fall 1 …


2
Die Dreiheit der Tests mit maximaler Wahrscheinlichkeit: Was tun, wenn widersprüchliche Schlussfolgerungen gezogen werden?
Die Tests Wald, Likelihood Ratio und Lagrange Multiplier im Rahmen der Maximum Likelihood Estimation sind asymptotisch äquivalent. Bei kleinen Stichproben weichen sie jedoch tendenziell stark voneinander ab und führen in einigen Fällen zu unterschiedlichen Schlussfolgerungen. Wie können sie danach eingestuft werden, wie wahrscheinlich es ist, dass sie die Null ablehnen? …




1
Der No-Free-Lunch-Satz und die K-NN-Konsistenz
Beim rechnerischen Lernen besagt das NFL-Theorem, dass es keinen universellen Lernenden gibt. Für jeden Lernalgorithmus gibt es eine Verteilung, die bewirkt, dass der Lernende mit hoher Wahrscheinlichkeit eine Hypotese mit einem großen Fehler ausgibt (obwohl es eine Hypotese mit geringem Fehler gibt). Die Schlussfolgerung ist, dass zum Lernen die Hypotese-Klasse …

1
Wie hoch ist die Wahrscheinlichkeit für diesen Prozess?
Ein Patient wird ins Krankenhaus eingeliefert. Ihre Aufenthaltsdauer hängt von zwei Dingen ab: der Schwere ihrer Verletzung und der Höhe ihrer Versicherungsbereitschaft, um sie im Krankenhaus zu halten. Einige Patienten werden vorzeitig abreisen, wenn ihre Versicherung beschließt, die Zahlung für ihren Aufenthalt einzustellen. Nehmen Sie Folgendes an: 1) Die Verweildauer …

1
t-SNE mit gemischten kontinuierlichen und binären Variablen
Ich untersuche derzeit die Visualisierung hochdimensionaler Daten mit t-SNE. Ich habe einige Daten mit gemischten binären und kontinuierlichen Variablen und die Daten scheinen die binären Daten viel zu leicht zu gruppieren. Dies wird natürlich für skalierte Daten (zwischen 0 und 1) erwartet: Der euklidische Abstand ist zwischen binären Variablen immer …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.