Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


3
Unterstützung der Vektorregression bei Daten mit verzerrter / hoher Kurtosis
Ich verwende die Support-Vektor-Regression, um einige ziemlich verzerrte Daten (mit hoher Kurtosis) zu modellieren. Ich habe versucht, die Daten direkt zu modellieren, aber ich erhalte falsche Vorhersagen, die meiner Meinung nach hauptsächlich auf die Verteilung der Daten zurückzuführen sind, die mit sehr fetten Schwänzen verzerrt ist. Ich bin mir ziemlich …

2
Verwendung des Neigungsscores in einer Fall-Kontroll-Studie
Die Theorie des Propensity Score (PS) legt nahe, dass sie nur für die Kohortenstudie verwendet werden sollte, da PS die "behandelten / exponierten" mit den "unbehandelten / nicht exponierten" Gruppen vergleicht. Fälle und Kontrollen sind jedoch die Ergebnisse (nicht die Expositionen) in einer Fall-Kontroll-Studie. Was sind die Fallstricke, wenn PS …

1
Was sind die Hauptunterschiede zwischen taxometrischen Analysen (z. B. MAXCOV, MAXEIG) und Latent Class-Analysen?
Neuere Forschungen haben versucht festzustellen, ob bestimmte psychologische Konstrukte latent dimensional oder taxonisch sind (dh einschließlich Taxons oder Klassen). Beispielsweise könnten Forscher daran interessiert sein, herauszufinden, ob es eine bestimmte "Klasse" von Menschen gibt, bei denen es wahrscheinlicher ist, dass sie nach einer Verletzung chronische Schmerzen entwickeln, oder ob das …

2
Bootstrap vs numerische Integration
Mein Verständnis des Bootstrap-Ansatzes basiert auf Wassermans Framework (fast wörtlich): Sei eine Statistik ( ist die aus der Verteilung gezogene iid-Stichprobe ). Angenommen , wir schätzen möchten - die Varianz der gegeben .X i F V F ( T n ) T n FT.n= g( X.1, . . . , …

2
Empfohlene Lektüre, um zu verstehen, wann der Bootstrap fehlschlägt?
Es ist bekannt, dass der Bootstrap fehlschlagen kann. Ich habe in Abschnitt 6 von Bickel und Freedman (1981) gelesen, dass der Bootstrap fehlschlägt, wenn Sie ihn zur Bewertung des MLE zur Schätzung des Parameters einer kontinuierlichen Gleichverteilung verwenden möchten. Ich habe Abschnitt 7.4 des Buches von Efron und Tibshirani gelesen, …


2
Basisklassifikatoren zum Boosten
Boosting-Algorithmen wie AdaBoost kombinieren mehrere "schwache" Klassifikatoren zu einem einzigen stärkeren Klassifikator. Obwohl theoretisch ein Boosting mit jedem Basisklassifikator möglich sein sollte, scheinen in der Praxis baumbasierte Klassifikatoren am häufigsten zu sein. Warum ist das? Welche Eigenschaften von Baumklassifikatoren machen sie für diese Aufgabe am besten geeignet? Gibt es noch …

1
Wie wird der Wert in einen p-Wert umgewandelt?
Ich bin brandneu in der Statistik und studiere die Mathematik hinter Split-Tests (A / B und multivariate). Ich habe gelernt, wie man mit gegebenen Testdaten berechnet, und ich verstehe, wie man dies über eine Tabelle in eine Wahrscheinlichkeit übersetzt, aber ich möchte die Wahrscheinlichkeit selbst berechnen können. Ich habe ein …

1
A priori Auswahl der SVM-Klassengewichte
Ich erinnere mich, dass ich irgendwo gesehen / gelesen habe, dass es für SVMs mit mehreren Klassen und unausgeglichenen Daten eine Möglichkeit gab, die Klassengewichte aus den Trainingsdaten zu bestimmen (anstatt aus der X-Validierung). Weiß jemand, was die Methode ist oder aus welchem ​​Papier sie stammt? Vielen Dank


1
Interpretationskoeffizienten für die Poisson-Regression
Ich verstehe nicht, wie man den Koeffizienten aus einer Poisson-Regression relativ zum Koeffizienten aus einer OLS-Regression interpretiert. Angenommen, ich habe Zeitreihendaten, meine Variable auf der linken Seite ist die Anzahl der pro Jahr gewonnenen Spiele und meine Hauptvariable auf der rechten Seite ist der NASDAQ-Wert. Wenn meine bevorzugte Spezifikation darin …


2
Fehlende Raten und mehrfache Anrechnung
Gibt es eine Grenze, die bei Verwendung der Mehrfachimputation (MI) am wenigsten akzeptabel ist? Kann ich beispielsweise MI verwenden, wenn die fehlenden Werte in einer Variablen 20% der Fälle ausmachen, während andere Variablen fehlende Werte aufweisen, jedoch nicht auf einem so hohen Niveau?


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.