Ich versuche, meinen eigenen Python-Code zu schreiben, um t-Statistiken und p-Werte für einen und zwei unabhängige t-Tests zu berechnen. Ich kann die normale Näherung verwenden, aber im Moment versuche ich nur die t-Verteilung zu verwenden. Es ist mir nicht gelungen, die Ergebnisse der SciPy-Statistikbibliothek mit meinen Testdaten abzugleichen. Ich könnte …
Ich verwende die Support-Vektor-Regression, um einige ziemlich verzerrte Daten (mit hoher Kurtosis) zu modellieren. Ich habe versucht, die Daten direkt zu modellieren, aber ich erhalte falsche Vorhersagen, die meiner Meinung nach hauptsächlich auf die Verteilung der Daten zurückzuführen sind, die mit sehr fetten Schwänzen verzerrt ist. Ich bin mir ziemlich …
Die Theorie des Propensity Score (PS) legt nahe, dass sie nur für die Kohortenstudie verwendet werden sollte, da PS die "behandelten / exponierten" mit den "unbehandelten / nicht exponierten" Gruppen vergleicht. Fälle und Kontrollen sind jedoch die Ergebnisse (nicht die Expositionen) in einer Fall-Kontroll-Studie. Was sind die Fallstricke, wenn PS …
Neuere Forschungen haben versucht festzustellen, ob bestimmte psychologische Konstrukte latent dimensional oder taxonisch sind (dh einschließlich Taxons oder Klassen). Beispielsweise könnten Forscher daran interessiert sein, herauszufinden, ob es eine bestimmte "Klasse" von Menschen gibt, bei denen es wahrscheinlicher ist, dass sie nach einer Verletzung chronische Schmerzen entwickeln, oder ob das …
Mein Verständnis des Bootstrap-Ansatzes basiert auf Wassermans Framework (fast wörtlich): Sei eine Statistik ( ist die aus der Verteilung gezogene iid-Stichprobe ). Angenommen , wir schätzen möchten - die Varianz der gegeben .X i F V F ( T n ) T n FT.n= g( X.1, . . . , …
Es ist bekannt, dass der Bootstrap fehlschlagen kann. Ich habe in Abschnitt 6 von Bickel und Freedman (1981) gelesen, dass der Bootstrap fehlschlägt, wenn Sie ihn zur Bewertung des MLE zur Schätzung des Parameters einer kontinuierlichen Gleichverteilung verwenden möchten. Ich habe Abschnitt 7.4 des Buches von Efron und Tibshirani gelesen, …
Der G-Test ist eine Möglichkeit, schnelle Schätzungen einer Chi-Quadrat-Verteilung zu erhalten, und wird vom Autor dieses bekannten A / B-Test-Tutorials empfohlen . Dieses Tool nimmt eine Normalverteilung an und verwendet Mittelwerte, um das Vertrauen zu berechnen. Was ist der Unterschied zwischen einem G-Test und einem T-Test? Welche Vor- oder Nachteile …
Boosting-Algorithmen wie AdaBoost kombinieren mehrere "schwache" Klassifikatoren zu einem einzigen stärkeren Klassifikator. Obwohl theoretisch ein Boosting mit jedem Basisklassifikator möglich sein sollte, scheinen in der Praxis baumbasierte Klassifikatoren am häufigsten zu sein. Warum ist das? Welche Eigenschaften von Baumklassifikatoren machen sie für diese Aufgabe am besten geeignet? Gibt es noch …
Ich bin brandneu in der Statistik und studiere die Mathematik hinter Split-Tests (A / B und multivariate). Ich habe gelernt, wie man mit gegebenen Testdaten berechnet, und ich verstehe, wie man dies über eine Tabelle in eine Wahrscheinlichkeit übersetzt, aber ich möchte die Wahrscheinlichkeit selbst berechnen können. Ich habe ein …
Ich erinnere mich, dass ich irgendwo gesehen / gelesen habe, dass es für SVMs mit mehreren Klassen und unausgeglichenen Daten eine Möglichkeit gab, die Klassengewichte aus den Trainingsdaten zu bestimmen (anstatt aus der X-Validierung). Weiß jemand, was die Methode ist oder aus welchem Papier sie stammt? Vielen Dank
Ich verstehe nicht, wie man den Koeffizienten aus einer Poisson-Regression relativ zum Koeffizienten aus einer OLS-Regression interpretiert. Angenommen, ich habe Zeitreihendaten, meine Variable auf der linken Seite ist die Anzahl der pro Jahr gewonnenen Spiele und meine Hauptvariable auf der rechten Seite ist der NASDAQ-Wert. Wenn meine bevorzugte Spezifikation darin …
Angenommen, ich habe ein Empfehlungssystem erstellt, das (z. B. Filmrankings oder was auch immer von vielen Benutzern angegeben wird) eine Liste von 10 empfohlenen Filmen erstellt, die jeder Benutzer ansehen kann. Stellen Sie sich vor, ich habe auch einen großen Pool an Filmelementen sowie ein Protokoll mit Benutzerbewertungen und Filmen, …
Gibt es eine Grenze, die bei Verwendung der Mehrfachimputation (MI) am wenigsten akzeptabel ist? Kann ich beispielsweise MI verwenden, wenn die fehlenden Werte in einer Variablen 20% der Fälle ausmachen, während andere Variablen fehlende Werte aufweisen, jedoch nicht auf einem so hohen Niveau?
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.