Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Was bedeutet die R-Faktan-Ausgabe?
Was bedeutet das alles? Ich bin ein 'Noob' der Faktorenanalyse und obwohl ich ein Buch gelesen habe, hat es mir anscheinend nicht alles erzählt. Da die Chi-Quadrat-Statistik so hoch und der p-Wert so niedrig ist, scheinen die Daten innerhalb des 6-dimensionalen Raums nahezu koplanar (2 Dimensionen) zu sein. Dies macht …

2
Grenzen der bedingten Erwartung mit normalen Rändern und spezifizierter (Pearson) Korrelation
Ich habe die folgende Frage in einem anderen Forum gesehen: "Angenommen, sowohl Größe als auch Gewicht erwachsener Männer können mit normalen Modellen beschrieben werden, und die Korrelation zwischen diesen Variablen beträgt 0,65. Wenn die Größe eines Mannes ihn auf das 60. Perzentil bringt, bei welchem ​​Perzentil würden Sie sein Gewicht …

4
Analyse von Auf- / Ab-Mustern in kurzen Zeitreihendaten
Ich habe nicht sehr häufig mit Zeitreihendaten gearbeitet, daher suche ich nach Hinweisen, wie ich mit dieser speziellen Frage am besten umgehen kann. Angenommen, ich habe die folgenden Daten - unten grafisch dargestellt: Hier gibt es ein Jahr auf der x-Achse. Die y-Achse ist ein Maß für die „Ungleichheit“, z. …

1
Die Anzahl jeder eindeutigen Zeile in einem Datenrahmen zählen? [geschlossen]
Geschlossen. Diese Frage ist nicht zum Thema . Derzeit werden keine Antworten akzeptiert. Möchten Sie diese Frage verbessern? Aktualisieren Sie die Frage so dass es beim Thema für Kreuz Validated. Geschlossen vor 5 Jahren . Angenommen, ich habe einen Datenrahmen wie: df<-data.frame(x1=c(0,1,1,1,2,3,3,3), x2=c(0,1,1,3,2,3,3,2), x3=c(0,1,1,1,2,3,3,2)) df x1 x2 x3 1 0 …
8 r 


1
Wie kann man den Theil-Sen-Schätzer effizient berechnen?
Der Theil-Sen-Schätzer ist für mich von Interesse, aber wenn ich ihn selbst implementiere, erhalte ich etwas, das als O (n ^ 2) skaliert. Laut Wikipedia kann es genau in O (n log (n)) berechnet werden. Kann mich jemand auf eine effiziente Implementierung hinweisen (Python oder Mathematica wären am besten, Matlab …

2
Umfang der Mehrfachtestkorrektur
Eine etwas seltsame Frage. In meinem heutigen Biostatistikkurs im vierten Jahr diskutierten wir, wann und wann keine Mehrfachtestkorrektur angewendet werden sollte, und der Professor machte einen spontanen Kommentar. Er fragte, warum wir nicht jeden Test korrigieren, den wir jemals durchgeführt haben, seit wir angefangen haben, Statistiken zu erstellen, da sie …

1
Was bedeutet und ?
Ich habe Mühe, eine Notation in einem Buch vollständig zu verstehen, in dem ein "Fadenkreuz" -Symbol verwendet wird - erstens wie wobei die Matrizen sind, und zweitens wie wo und sind beide Matrizen.Z j I n ⊗ Φ I n Φ⨁i=1nZj⨁i=1nZj\bigoplus\limits_{i=1}^n{} Z_j ZjZjZ_jIn⊗ΦIn⊗ΦI_n \otimes \PhiInInI_nΦΦ\Phi Das Buch befasst sich mit …

1
K bedeutet als Grenzfall des EM-Algorithmus für Gaußsche Gemische mit Kovarianzen bis
Mein Ziel ist es zu sehen, dass der K-Mittelwert-Algorithmus tatsächlich ein Erwartungsmaximierungsalgorithmus für Gaußsche Gemische ist, bei dem alle Komponenten eine Kovarianz im Grenzwert als .σ2Iσ2I\sigma^2 Ilimσ→0limσ→0\lim_{\sigma \to 0} Angenommen , wir haben einen Datensatz {x1,…,xN}{x1,…,xN}\{x_1, \dots ,x_N\} von Beobachtungen von Zufallsvariablen XXX . Die Zielfunktion für M-Mittel ist gegeben …

2
Propensity Score Matching mit zeitlich variierender Behandlung
Das grundlegende Verfahren zur Anpassung der Neigungsbewertung arbeitet mit Querschnittsdaten (dh zu einem bestimmten Zeitpunkt gesammelt). Der beliebte Befehl psmatch2 verwendet eine Dummy-Variable, die angibt, dass eine Beobachtung entweder zur Behandlungs- oder zur Kontrollgruppe gehört. In meinem Datensatz variiert diese Indikatorfunktion jedoch zeitlich. Die Daten sehen wie folgt aus: Ich …


1
Geringe Stichprobengröße: LR vs F - Test
Einige von Ihnen haben vielleicht dieses schöne Papier gelesen: O'Hara RB, Kotze DJ (2010) Zählen Sie keine Zähldaten. Methoden in Ökologie und Evolution 1: 118–122. klick . Derzeit vergleiche ich negative Binomialmodelle mit Gaußschen Modellen für transformierte Daten. Im Gegensatz zu O'Hara RB, Kotze DJ (2010) betrachte ich den Sonderfall …

2
Warum sollte
Beide Antworten in diesen Threads, eins und zwei, behaupten, dass transformiert werden sollte, bevor eine andere Transformation auf die Prädiktoren angewendet wird. In der Tat konzentriert sich das Weisberg- Kapitel über Transformationen mehr auf DV als auf Prädiktoren, ebenso wie die Handbuchseite des R-Car-Pakets powerTransform ().Y.YY Wir wissen jedoch, dass …

1
Warum ist normalerweise die akzeptable Wahrscheinlichkeit von Fehlern vom Typ 1 und Typ 2 unterschiedlich?
Diese Frage wird von meinem Vorgesetzten gestellt und ich weiß nicht, wie ich sie erklären soll. Normalerweise beträgt das akzeptierte Konfidenzniveau 0,95, was bedeutet, dass die Wahrscheinlichkeit eines Fehlers vom Typ 1 5% beträgt. Die normalerweise akzeptierte Leistung beträgt jedoch 0,8 (Cohen, 1988), was bedeutet, dass die Wahrscheinlichkeit eines Fehlers …

2
Beweis des LETZTEN Theorems von Angrist und Imbens 1994
Angenommen, wir haben ein binäres Instrument dem die Auswirkung der endogenen Variablen auf das Ergebnis . Angenommen, das Instrument hat eine signifikante erste Stufe, es wird zufällig zugewiesen, es erfüllt die Ausschlussbeschränkung und es erfüllt die Monotonie, wie in Angrist und Imbens (1994) dargelegt. http://www.jstor.org/discover/10.2307/2951620?uid=3738032&uid=2&uid=4&sid=21104754800073ZiZiZ_iDiDiD_iYiYiY_i Sie geben an, dass die …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.