Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

4
GEE: Auswahl der richtigen Korrelationsstruktur
Ich bin ein Epidemiologe, der versucht, GEEs zu verstehen, um eine Kohortenstudie richtig zu analysieren (unter Verwendung der Poisson-Regression mit einem Log-Link, um das relative Risiko abzuschätzen). Ich habe ein paar Fragen zur "funktionierenden Korrelation", die ich von einem Fachmann klären lassen möchte: (1) Ist es in der Regel am …
19 gee 

2
PCA und explorative Faktorenanalyse für denselben Datensatz: Unterschiede und Ähnlichkeiten; Faktormodell vs PCA
Ich würde gerne wissen, ob es logisch sinnvoll ist, eine Hauptkomponentenanalyse (PCA) und eine explorative Faktoranalyse (EFA) mit demselben Datensatz durchzuführen. Ich habe gehört, Profis empfehlen ausdrücklich: Verstehen Sie, was das Ziel der Analyse ist, und wählen Sie PCA oder EFA für die Datenanalyse. Nachdem Sie eine Analyse durchgeführt haben, …

2
Bootstrapping - Muss ich zuerst Ausreißer entfernen?
Wir haben einen Split-Test für eine neue Produktfunktion durchgeführt und möchten messen, ob die Umsatzsteigerung erheblich ist. Unsere Beobachtungen sind definitiv nicht normal verteilt (die meisten unserer Benutzer geben nichts aus, und innerhalb derer, die dies tun, ist es stark verzerrt in Richtung vieler kleiner und einiger sehr großer Geldgeber). …

1
Wenn ein analytischer Jacobian verfügbar ist, ist es besser, den Hessischen durch oder durch endliche Differenzen des Jacobian anzunähern?
Angenommen, ich berechne einige Modellparameter, um die Summe der quadratischen Residuen zu minimieren, und gehe davon aus, dass meine Fehler Gaußsch sind. Mein Modell erzeugt analytische Ableitungen, sodass der Optimierer keine endlichen Differenzen verwenden muss. Sobald die Anpassung abgeschlossen ist, möchte ich Standardfehler der angepassten Parameter berechnen. Im Allgemeinen wird …

3
Wie kann man die Neigung anhand eines Boxplots beurteilen?
So bestimmen Sie die Schiefe anhand eines Boxplots, der aus diesen Daten erstellt wurde: 340, 300, 520, 340, 320, 290, 260, 330 Ein Buch sagt: "Wenn das untere Quartil weiter vom Median entfernt ist als das obere Quartil, ist die Verteilung negativ verzerrt." Mehrere andere Quellen sagten mehr oder weniger …

4
Wie gehen Menschen praktisch mit ANOVA um, wenn die Daten nicht ganz den Annahmen entsprechen?
Dies ist keine rein statistische Frage. Ich kann alle Lehrbücher über ANOVA-Annahmen lesen. Ich versuche herauszufinden, wie tatsächlich arbeitende Analysten mit Daten umgehen, die den Annahmen nicht ganz entsprechen. Ich habe viele Fragen auf dieser Website nach Antworten durchsucht und finde immer wieder Beiträge darüber, wann ich ANOVA nicht verwenden …

1
Caret und Koeffizienten (glmnet)
Ich möchte Caret verwenden, um Rückschlüsse auf einen bestimmten Datensatz zu ziehen. Ist es möglich, Folgendes zu tun: Erzeugt Koeffizienten eines Glmnet-Modells, das ich in Caret trainiert habe. Ich möchte glmnet verwenden, da ich glaube, dass glm es nicht hat. Gibt es eine andere Metrik als die ROC-Metrik, mit der …
19 caret  glmnet 

4
Problem mit dem Nachweis der bedingten Erwartung als bester Prädiktor
Ich habe ein Problem mit dem Beweis von E(Y|X)∈argming(X)E[(Y−g(X))2]E(Y|X)∈arg⁡ming(X)E[(Y−g(X))2]E(Y|X) \in \arg \min_{g(X)} E\Big[\big(Y - g(X)\big)^2\Big] die sehr wahrscheinlich ein tieferes Missverständnis der Erwartungen und bedingten Erwartungen aufdecken. Der mir bekannte Beweis lautet wie folgt (eine andere Version dieses Beweises finden Sie hier ) ===argming(X)E[(Y−g(x))2]argming(X)E[(Y−E(Y|X)+E(Y|X)−g(X))2]argming(x)E[(Y−E(Y|X))2+2(Y−E(Y|X))(E(Y|X)−g(X))+(E(Y|X)−g(X))2]argming(x)E[2(Y−E(Y|X))(E(Y|X)−g(X))+(E(Y|X)−g(X))2]arg⁡ming(X)E[(Y−g(x))2]=arg⁡ming(X)E[(Y−E(Y|X)+E(Y|X)−g(X))2]=arg⁡ming(x)E[(Y−E(Y|X))2+2(Y−E(Y|X))(E(Y|X)−g(X))+(E(Y|X)−g(X))2]=arg⁡ming(x)E[2(Y−E(Y|X))(E(Y|X)−g(X))+(E(Y|X)−g(X))2]\begin{align*} &\arg \min_{g(X)} E\Big[\big(Y - g(x)\big)^2\Big]\\ = …

2
Zufälliger Wald ist überpassend?
Ich experimentiere mit Scikit-Learn in zufälligen Wäldern und erhalte großartige Ergebnisse mit meinem Trainingssatz, aber relativ schlechte Ergebnisse mit meinem Testsatz ... Hier ist das Problem (inspiriert vom Poker), das ich zu lösen versuche: Mit den Hole Cards von Spieler A, den Hole Cards von Spieler B und einem Flop …

1
P-Werte für "multinom" in R abrufen (nnet-Paket)
Wie erhalte ich p-Werte mit der multinomFunktion von nnetpackage in R? Ich habe einen Datensatz, der aus "Pathologie-Scores" (Abwesend, Mild, Schwerwiegend) als Ergebnisvariable und zwei Haupteffekten besteht: Alter (zwei Faktoren: zwanzig / dreißig Tage) und Behandlungsgruppe (vier Faktoren: infiziert ohne ATB; infiziert +) ATB1; infiziert + ATB2; infiziert + ATB3). …



4
Ist in der Bayes'schen Statistik eine Leistungsanalyse erforderlich?
Ich habe in letzter Zeit die Bayes'sche Sichtweise der klassischen Statistik untersucht. Nachdem ich über den Bayes-Faktor gelesen hatte, fragte ich mich, ob in dieser Statistikansicht eine Leistungsanalyse erforderlich ist. Mein Hauptgrund für diese Frage ist, dass der Bayes-Faktor offenbar nur ein Wahrscheinlichkeitsverhältnis ist. Sobald es 25: 1 ist, kann …

3
Beispiel einer Verteilung, bei der ein großer Stichprobenumfang für den zentralen Grenzwertsatz erforderlich ist
Einige Bücher geben an, dass eine Stichprobengröße von 30 oder höher erforderlich ist, damit der zentrale Grenzwertsatz eine gute Näherung für ergibt . X¯X¯\bar{X} Ich weiß, dass dies nicht für alle Distributionen ausreicht. Ich möchte einige Beispiele für Verteilungen sehen, bei denen selbst bei einer großen Stichprobengröße (möglicherweise 100 oder …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.