Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Logistische Regressionsverzerrung bei seltenen Ereignissen: Wie kann man die unterschätzten p mit einem minimalen Beispiel simulieren?
CrossValidated hat verschiedene Fragen, wann und wie die Selten-Ereignis-Bias-Korrektur von King und Zeng (2001) angewendet werden soll. . Ich suche etwas anderes: eine minimale simulationsbasierte Demonstration, dass der Bias existiert. Insbesondere König und Zeng Zustand "... in Daten zu seltenen Ereignissen können die Wahrscheinlichkeiten bei Stichprobengrößen zu Tausenden erheblich sein …

1
Was ist aus dieser Lasso-Handlung (glmnet) zu schließen?
Es folgt die Darstellung von glmnet mit dem Standard-Alpha (1, daher Lasso) unter Verwendung des mtcarsDatensatzes in R mit mpgals DV und anderen als Prädiktorvariablen. glmnet(as.matrix(mtcars[-1]), mtcars[,1]) Was können wir aus dieser Handlung in Bezug auf verschiedene Variablen schließen, vor allem am, cylund wt(rot, schwarz und hellblaue Linien)? Wie würden …

1
Geometrisches Verständnis von PCA im Subjektraum
Ich versuche ein intuitives Verständnis dafür zu bekommen, wie die Hauptkomponentenanalyse (PCA) im Subjekt- (Doppel-) Raum funktioniert . Betrachten 2D - Datensatz mit zwei Variablen, x1x1x_1 und x2x2x_2 , und nnn Datenpunkte (Datenmatrix XX\mathbf X ist n×2n×2n\times 2 und wird angenommen, zentriert werden). Die übliche Darstellung von PCA ist, dass …




3
Verwechslung mit falscher Entdeckungsrate und mehrfachen Tests (auf Colquhoun 2014)
Ich habe diesen großartigen Artikel von David Colquhoun gelesen: Eine Untersuchung der Rate falscher Entdeckungen und der Fehlinterpretation von p-Werten (2014). Im Wesentlichen erklärt er, warum die Rate falscher Entdeckungen (FDR) bis zu betragen kann, obwohl wir den Fehler vom Typ I mit kontrollieren .α = 0,0530 %30%30\%α = 0,05α=0.05\alpha=0.05 …

5
Gibt es Versionen von t-SNE für das Streaming von Daten?
Mein Verständnis von t-SNE und der Barnes-Hut-Näherung ist, dass alle Datenpunkte erforderlich sind, damit alle Kraftwechselwirkungen gleichzeitig berechnet werden können und jeder Punkt in der 2d-Karte (oder der Karte mit der niedrigeren Dimension) angepasst werden kann. Gibt es Versionen von t-sne, die effizient mit Streaming-Daten umgehen können? Wenn also meine …




4
Gründe für die normale Datenverteilung
Was sind einige Theoreme, die erklären könnten (dh generativ), warum erwartet werden kann, dass reale Daten normal verteilt sind? Es gibt zwei, die ich kenne: Der zentrale Grenzwertsatz (natürlich), der besagt, dass die Summe mehrerer unabhängiger Zufallsvariablen mit Mittelwert und Varianz (auch wenn sie nicht identisch verteilt sind) dazu neigt, …



4
Was genau sind Momente? Wie werden sie abgeleitet?
Wir werden in der Regel mit der Methode der Momentschätzer vertraut gemacht, indem wir "Populationsmomente ihrem Beispielgegenstück zuordnen", bis wir alle Populationsparameter geschätzt haben. so dass wir im Falle einer Normalverteilung nur den ersten und den zweiten Moment benötigen würden, weil sie diese Verteilung vollständig beschreiben. E(X)=μ⟹∑ni=1Xi/n=X¯E(X)=μ⟹∑i=1nXi/n=X¯E(X) = \mu \implies …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.