Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


2
Unterschied zwischen Statistikmodell OLS und linearer Skikit-Regression
Ich habe eine Frage zu zwei verschiedenen Methoden aus verschiedenen Bibliotheken, die scheinbar den gleichen Job machen. Ich versuche, ein lineares Regressionsmodell zu erstellen. Hier ist der Code, den ich mit der Statistikmodellbibliothek mit OLS verwende: X_train, X_test, y_train, y_test = cross_validation.train_test_split(x, y, test_size=0.3, random_state=1) x_train = sm.add_constant(X_train) model = …

1
Eine Frage im Zusammenhang mit Borel-Cantelli Lemma
Hinweis: Borel-Cantelli Lemma sagt das ∑n=1∞P(An)<∞⇒P(limsupAn)=0∑n=1∞P(An)<∞⇒P(limsupAn)=0\sum_{n=1}^\infty P(A_n) \lt \infty \Rightarrow P(\lim\sup A_n)=0 ∑n=1∞P(An)=∞ and An's are independent⇒P(limsupAn)=1∑n=1∞P(An)=∞ and An's are independent⇒P(limsupAn)=1\sum_{n=1}^\infty P(A_n) =\infty \textrm{ and } A_n\textrm{'s are independent} \Rightarrow P(\lim\sup A_n)=1 Dann, wenn ∑n=1∞P(AnAcn+1)<∞∑n=1∞P(AnAn+1c)<∞\sum_{n=1}^\infty P(A_nA_{n+1}^c )\lt \infty unter Verwendung von Borel-Cantelli Lemma Ich möchte das zeigen zuerst, existiertlimn→∞P(An)limn→∞P(An)\lim_{n\to \infty}P(A_n) …


1
Verzerrter Schätzer für die Regression, der bessere Ergebnisse erzielt als der unverzerrte Schätzer im Modell für Fehler in Variablen
Ich arbeite an einigen syntaktischen Daten für das Error-In-Variable-Modell für einige Untersuchungen. Derzeit habe ich eine einzige unabhängige Variable und gehe davon aus, dass ich die Varianz für den wahren Wert der abhängigen Variablen kenne. Mit diesen Informationen kann ich also einen unverzerrten Schätzer für den Koeffizienten der abhängigen Variablen …


1
Parameter gegen latente Variablen
Ich habe schon früher danach gefragt und mich wirklich schwer getan, herauszufinden, was einen Modellparameter ausmacht und was ihn zu einer latenten Variablen macht. Wenn man sich also verschiedene Themen zu diesem Thema auf dieser Website ansieht, scheint der Hauptunterschied zu sein: Latente Variablen werden nicht beobachtet, haben aber eine …



3
Warum Spur von
Im Modell y=Xβ+ϵy=Xβ+ϵ{y} = X \beta + \epsilon können wir ββ\beta mit der Normalgleichung :abschätzen. β^=(X′X)−1X′y,β^=(X′X)−1X′y,\hat{\beta} = (X'X)^{-1}X'y,und wir konnten erhalten y =X β .y^=Xβ^.y^=Xβ^.\hat{y} = X \hat{\beta}. Der Vektor der Residuen wird geschätzt durch ϵ^=y−Xβ^=(I−X(X′X)−1X′)y=Qy=Q(Xβ+ϵ)=Qϵ,ϵ^=y−Xβ^=(I−X(X′X)−1X′)y=Qy=Q(Xβ+ϵ)=Qϵ,\hat{\epsilon} = y - X \hat{\beta} = (I - X (X'X)^{-1} X') y = Q …



3
Welches ist die bessere maximale oder marginale Wahrscheinlichkeit und warum?
Bei der Durchführung der Regression gehen wir von der Definition aus: Was ist der Unterschied zwischen einer Teilwahrscheinlichkeit, einer Profilwahrscheinlichkeit und einer Grenzwahrscheinlichkeit? dass, Maximum Likelihood Findet β und θ, die L (β, θ | data) maximieren. Während, Grenzwahrscheinlichkeit Wir integrieren θ aus der Wahrscheinlichkeitsgleichung, indem wir die Tatsache ausnutzen, …

1
Wird der Missbrauch durch die maschinelle Lerngemeinschaft "bedingt" und "parametrisiert durch"?
Angenommen, ist abhängig von . Genau genommenXXXαα\alpha wenn und beide Zufallsvariablen sind, könnten wir schreiben ;α p ( X ≤ α )XXXαα\alphap(X∣α)p(X∣α)p(X\mid\alpha) Wenn jedoch XXX eine Zufallsvariable und αα\alpha ein Parameter ist, müssen wir schreiben p(X;α)p(X;α)p(X; \alpha). Ich stelle mehrmals fest, dass die Community für maschinelles Lernen die Unterschiede zu …

1
Test auf Kointegration zwischen zwei Zeitreihen mit der Engle-Granger-Zweistufenmethode
Ich versuche, die Integration zwischen zwei Zeitreihen zu testen. Beide Serien haben wöchentliche Daten, die sich über ~ 3 Jahre erstrecken. Ich versuche die Engle-Granger Two Step Methode durchzuführen. Meine Arbeitsreihenfolge folgt. Testen Sie jede Zeitreihe mit Augmented Dickey-Fuller auf Unit Root. Angenommen, beide haben Einheitswurzeln, dann finde die lineare …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.