Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


3
Funktionsauswahl unter Verwendung gegenseitiger Informationen in Matlab
Ich versuche, die Idee der gegenseitigen Information auf die Merkmalsauswahl anzuwenden, wie in diesen Vorlesungsunterlagen (auf Seite 5) beschrieben. Meine Plattform ist Matlab. Ein Problem, das ich bei der Berechnung gegenseitiger Informationen aus empirischen Daten finde, ist, dass die Anzahl immer nach oben verzerrt ist. Ich habe ungefähr 3 ~ …

1
randomForest und variabler Wichtigkeitsfehler?
Ich verstehe den Unterschied zwischen rfobject$importanceund importance(rfobject)in der Spalte MeanDecreaseAccuracy nicht. Beispiel: > data("iris") > fit <- randomForest(Species~., data=iris, importance=TRUE) > fit$importance setosa versicolor virginica MeanDecreaseAccuracy MeanDecreaseGini Sepal.Length 0.027078501 0.019418330 0.040497602 0.02898837 9.173648 Sepal.Width 0.008553449 0.001962036 0.006951771 0.00575489 2.472105 Petal.Length 0.313303381 0.291818815 0.280981959 0.29216790 41.284869 Petal.Width 0.349686983 0.318527008 0.270975757 0.31054451 …

1
Kann ein Modell von P (Y | X) durch stochastischen Gradientenabstieg von nicht-iid-Proben von P (X) und iid-Proben von P (Y | X) trainiert werden?
Beim Trainieren eines parametrisierten Modells (z. B. zur Maximierung der Wahrscheinlichkeit) über einen stochastischen Gradientenabstieg in einem Datensatz wird üblicherweise angenommen, dass die Trainingsmuster aus der Trainingsdatenverteilung entnommen werden. Wenn das Ziel darin besteht, eine gemeinsame Verteilung zu modellieren , sollte jede Trainingsprobe aus dieser Verteilung gezogen werden.P(X,Y)P(X,Y)P(X,Y)(xi,yi)(xi,yi)(x_i,y_i) Wenn das …

2
Potenzierter logistischer Regressionskoeffizient, der sich vom Odds Ratio unterscheidet
Nach meinem Verständnis ist der potenzierte Beta-Wert aus einer logistischen Regression das Odds Ratio dieser Variablen für die abhängige interessierende Variable. Der Wert stimmt jedoch nicht mit dem manuell berechneten Quotenverhältnis überein. Mein Modell prognostiziert Stunting (ein Maß für Unterernährung) unter anderem anhand von Versicherungen. // Odds ratio from LR, …


2
Asymptotische Verteilung der Statistik maximaler Ordnung von IID-Zufallsnormalen
Gibt es eine schöne Grenzverteilung von wenn n zu \ infty geht , vorausgesetzt, es handelt sich um Normalverteilungen mit Varianz \ sigma ^ 2 .max(X1,X2,...,Xn)max(X1,X2,...,Xn)\max( X_1,X_2,...,X_n) nnn∞∞\inftyσ2σ2\sigma^2 Dies ist mit ziemlicher Sicherheit ein bekanntes Problem mit einem cleveren Beweis und einer guten Lösung, aber ich habe herumgegraben und nichts …


1
Log-Cauchy-Zufallszahlengenerierung
Ich muss Zufallszahlen aus einer logarithmischen Verteilung mit der folgenden Dichte ziehen: Kann mir jemand helfen oder mich auf ein Buch / Papier verweisen, das mir zeigen könnte, wie?f( x ; μ , σ) = 1x πσ[ 1 + ( l n ( x ) - μσ)2]].f(x;μ,σ)=1xπσ[1+(ln(x)−μσ)2].f(x;\mu,\sigma)=\frac{1}{x\pi\sigma\left[1+\left(\frac{ln(x)-\mu}{\sigma}\right)^2\right]}.

2
Gigantische Kurtosis?
Ich mache einige beschreibende Statistiken über die täglichen Renditen von Aktienindizes. Das heißt, wenn und die an Tag 1 bzw. Tag 2 sind, dann ist die Rendite, die ich verwende (in der Literatur völlig Standard).P1P1P_1P2P2P_2loge(P2P1)loge(P2P1)log_e (\frac{P_2}{P_1}) In einigen Fällen ist die Kurtosis also enorm. Ich betrachte ungefähr 15 Jahre tägliche …



4
Warum Steuervariablen in Unterschieden verwenden?
Ich habe eine Frage zum Differenzen-in-Differenzen-Ansatz mit der folgenden Standardgleichung: Dabei ist Treat eine Dummy-Variable für die behandelte Gruppe und den Post. y=a+b1treat+b2post+b3treat⋅post+uy=a+b1treat+b2post+b3treat⋅post+u y= a + b_1\text{treat}+ b_2\text{post} + b_3\text{treat}\cdot\text{post} + u Nun ist meine Frage einfach: Warum verwenden die meisten Artikel immer noch zusätzliche Steuervariablen? Ich dachte, wenn die …


3
Mittlere Überlebenszeit für eine logarithmisch normale Überlebensfunktion
Ich habe viele Formeln gefunden, die zeigen, wie man die mittlere Überlebenszeit für eine Exponential- oder Weibull-Verteilung ermittelt, aber ich habe erheblich weniger Glück für logarithmisch normale Überlebensfunktionen. Bei folgender Überlebensfunktion: S.( t ) = 1 - ϕ [ ln( t ) - μσ]]S(t)=1−ϕ[ln⁡(t)−μσ]S(t) = 1 - \phi \left[ {{{\ln …
10 survival 

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.