Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Ist eine präzisionsbasierte (dh inverse Varianz) Gewichtung ein wesentlicher Bestandteil der Metaanalyse?
Ist die präzisionsbasierte Gewichtung für die Metaanalyse von zentraler Bedeutung? Borenstein et al. (2009) schreiben, dass für eine mögliche Metaanalyse lediglich Folgendes erforderlich ist: Studien berichten über eine Punktschätzung, die als einzelne Zahl ausgedrückt werden kann. Für diese Punktschätzung kann eine Varianz berechnet werden. Mir ist nicht sofort klar, warum …

2
Warum jemals Durbin-Watson verwenden, anstatt die Autokorrelation zu testen?
Der Durbin-Watson-Test testet die Autokorrelation von Residuen bei Verzögerung 1. Aber auch das Testen der Autokorrelation bei Verzögerung 1 direkt. Außerdem können Sie die Autokorrelation bei Verzögerung 2,3,4 testen, und es gibt gute Portmanteau-Tests für die Autokorrelation bei mehreren Verzögerungen, um schöne, leicht interpretierbare Diagramme zu erhalten [z. B. die …


2
Welche Hypothesentests können neben Durbin-Watson zu nicht schlüssigen Ergebnissen führen?
Die Durbin-Watson-Teststatistik kann in einem nicht eindeutigen Bereich liegen, in dem es nicht möglich ist, die Nullhypothese (in diesem Fall der Null-Autokorrelation) abzulehnen oder nicht abzulehnen. Welche anderen statistischen Tests können zu "nicht schlüssigen" Ergebnissen führen? Gibt es eine allgemeine Erklärung (Handwinken ist in Ordnung), warum diese Tests nicht in …

1
Unterscheiden Sie zwischen kurzfristigen und langfristigen Effekten
Ich habe in einer Zeitung den folgenden Satz gelesen: Die Tatsache, dass es einen Unterschied zwischen kurzfristigen und langfristigen Koeffizienten gibt, ist ein Ergebnis unserer Spezifikation, die verzögerte endogene Variablen enthält. Sie führen eine Regression der ersten Differenzen durch und enthalten eine Verzögerung der abhängigen Variablen. Nun argumentieren sie, dass, …

1
Ableiten der Wahrscheinlichkeitsfunktion für IV-Probit
Ich habe also ein binäres Modell, bei dem die latente unbeobachtete Variable und die beobachtete ist. bestimmt und ist somit mein Instrument. Kurz gesagt, das Modell ist. Da die Fehlerterme nicht unabhängig sind, aber Ich verwende ein IV-Probit-Modell.y∗1y1∗y_1^*y1∈{0,1}y1∈{0,1}y_1 \in \{0,1\}y2y2y_2y1y1y_1z2z2z_2y∗1y2y1===δ1z1+α1y2+u1δ21z1+δ22z2+v2=zδ+v21[y∗>0]y1∗=δ1z1+α1y2+u1y2=δ21z1+δ22z2+v2=zδ+v2y1=1[y∗>0]\begin{eqnarray} y_1^*&=& \delta_1 z_1 + \alpha_1 y_2 + u_1 \\ y_2 …

3
So vermeiden Sie den log (0) -Term in der Regression
Ich habe folgende einfache X- und Y-Vektoren: > X [1] 1.000 0.063 0.031 0.012 0.005 0.000 > Y [1] 1.000 1.000 1.000 0.961 0.884 0.000 > > plot(X,Y) Ich möchte eine Regression mit dem Protokoll von X durchführen. Um zu vermeiden, dass das Protokoll (0) angezeigt wird, versuche ich, +1 …

1
Referenzen: Schwanz des inversen cdf
Ich bin mir fast sicher, dass ich das folgende Ergebnis bereits in der Statistik gesehen habe, aber ich kann mich nicht erinnern, wo. Wenn eine positive Zufallsvariable ist und dann wenn , wobei ist CDF von .XXXE(X)&lt;∞E(X)&lt;∞\mathbb{E}(X)<\inftyεF−1(1−ε)→0εF−1(1−ε)→0\varepsilon F^{-1}(1-\varepsilon) \to 0ε→0+ε→0+\varepsilon\to 0^+FFFXXX Dies ist geometrisch leicht zu erkennen, wenn die Gleichheit …

1
Ist der Median eine „Metrik“ oder eine „topologische“ Eigenschaft?
Ich entschuldige mich für den leichten Missbrauch der Terminologie; Ich hoffe es wird klar, was ich unten meine. Betrachten wir eine Zufallsvariable . Sowohl der Mittelwert als auch der Median können durch ein Optimalitätskriterium charakterisiert werden: Der Mittelwert ist die Zahl , die minimiert, und der Median die Zahl, die …
10 mean  median 

1
Zufälliger Wald gegen Adaboost
In Abschnitt 7 der Arbeit Random Forests (Breiman, 1999) stellt der Autor die folgende Vermutung auf: "Adaboost ist ein zufälliger Wald". Hat jemand dies bewiesen oder widerlegt? Was wurde getan, um diesen Beitrag von 1999 zu beweisen oder zu widerlegen?

1
So testen Sie, ob der „vorherige Zustand“ Einfluss auf den „nachfolgenden Zustand“ in R hat
Stellen Sie sich eine Situation vor: Wir haben historische Aufzeichnungen (20 Jahre) von drei Minen. Erhöht das Vorhandensein von Silber die Wahrscheinlichkeit, im nächsten Jahr Gold zu finden? Wie teste ich eine solche Frage? Hier sind Beispieldaten: mine_A &lt;- c("silver","rock","gold","gold","gold","gold","gold", "rock","rock","rock","rock","silver","rock","rock", "rock","rock","rock","silver","rock","rock") mine_B &lt;- c("rock","rock","rock","rock","silver","rock","rock", "silver","gold","gold","gold","gold","gold","rock", "silver","rock","rock","rock","rock","rock") mine_C &lt;- c("rock","rock","silver","rock","rock","rock","rock", …

1
Wird PCA immer noch über die Eigendekomposition der Kovarianzmatrix durchgeführt, wenn die Dimensionalität größer als die Anzahl der Beobachtungen ist?
Ich habe eine Matrix , die meine Abtastwerte im dimensionalen Raum enthält. Ich möchte jetzt meine eigene Hauptkomponentenanalyse (PCA) in Matlab codieren. Ich erniedrige zuerst zu .20×10020×10020\times100XXXN=20N=20N=20D=100D=100D=100XXXX0X0X_0 Ich habe aus dem Code von jemandem gelesen, dass wir in solchen Szenarien, in denen wir mehr Dimensionen als Beobachtungen haben, die Kovarianzmatrix …
10 pca 

4
Angenommen,
Wie im Titel vorgeschlagen. Angenommen, X1,X2,…,XnX1,X2,…,XnX_1, X_2, \dotsc, X_n sind kontinuierliche iid Zufallsvariablen mit pdf fff . Betrachten Sie das Ereignis, dass X1≤X2…≤XN−1&gt;XNX1≤X2…≤XN−1&gt;XNX_1 \leq X_2 \dotsc \leq X_{N-1} > X_N , N≥2N≥2N \geq 2 , also NNN ist, wenn die Sequenz zum ersten Mal abnimmt. Was ist dann der Wert …

2
Was ist Pretraining und wie trainiert man ein neuronales Netzwerk?
Ich verstehe, dass Pretraining verwendet wird, um einige Probleme beim konventionellen Training zu vermeiden. Wenn ich Backpropagation mit beispielsweise einem Autoencoder verwende, weiß ich, dass ich auf Zeitprobleme stoßen werde, weil die Backpropagation langsam ist und ich auch in lokalen Optima stecken bleiben und bestimmte Funktionen nicht lernen kann. Was …

2
Hat jemand jemals Daten gefunden, bei denen ARCH- und GARCH-Modelle funktionieren?
Ich bin Analyst in den Bereichen Finanzen und Versicherungen, und wenn ich versuche, Volatilitätsmodelle anzupassen, erhalte ich schreckliche Ergebnisse: Residuen sind oft instationär (im Sinne der Einheitswurzel) und heteroskedastisch (das Modell erklärt also nicht die Volatilität). Arbeiten ARCH / GARCH-Modelle möglicherweise mit anderen Daten? Bearbeitet am 17/04/2015 15:07, um einige …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.