Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Mustererkennung im Streudiagramm
Unten sehen Sie ein Streudiagramm (maximal 10.000 US-Dollar), das die durchschnittliche Spende darstellt, die ein Projekt erhält, und die Wortzahl des Aufsatzes über die Finanzierungsanfrage für alle Projekte, die in den offenen Spenderauswahldaten dargestellt sind . Es gibt ein auffälliges Muster, das ich durch Anpassen der Kurve zu charakterisieren versuchte …

6
Ist es sinnvoll, neuronale Netze ohne mathematische Ausbildung zu studieren?
Angesichts des modernen Zustands der Technologien und Werkzeuge für maschinelles Lernen (z. B. TensorFlow, Theano usw.) scheint die Einstiegsschwelle in letzter Zeit gesunken zu sein, und es reicht aus, beispielsweise auf Python programmieren zu können, um interessante Dinge zu erstellen. Eine weitere Quelle, die diesen Punkt unterstützt, ist die Spezialisierung …


1
Wie kann ich feststellen, ob ein statistisches Modell „identifiziert“ ist?
Mein Ökonometrieprofessor verwendete im Unterricht den Begriff "identifiziert". Wir betrachten der Form wobei eine Zufallsvariable und ein zufälliger Fehlerterm ist. Unsere Regressionslinien haben die FormY=β0+β1X+UY=β0+β1X+UY = \beta_0 + \beta_1 X + UXXXUUUY=β0^+β1^XY=β0^+β1^XY = \hat{\beta_0}+\hat{\beta_1}X Er gab die folgende Definition von "identifiziert": β0β0\beta_0 , werden identifiziert, wenn ein Datensatz genügend Informationen …

2
Robustheit des Korrelationstests gegenüber Nichtnormalität
Ich versuche, zwei scheinbar gegensätzliche Aussagen über die Robustheit gegenüber der Nichtnormalität der Pearson-Korrelationsteststatistik in Einklang zu bringen (wobei Null "keine Korrelation" bedeutet). Diese CV-Antwort lautet: Sehr nicht robust. Dieses Biostat-Handbuch sagt: [...] zahlreiche Simulationsstudien haben gezeigt, dass lineare Regression und Korrelation nicht empfindlich auf Nichtnormalität reagieren; Eine oder beide …

2
Entspricht jedes ARIMA (1,1,0) -Modell einem AR (2) -Modell?
Angenommen, ich habe eine Zeitreihe , die ich mit einem ARIMA (1,1,0) -Modell des Formulars anpassen möchte:xtxt x_t Δxt=αΔxt−1+wtΔxt=αΔxt−1+wt \Delta x_t = \alpha \Delta x_{t-1} + w_t Dies könnte wie folgt umgeschrieben werden: xt−xt−1=α(xt−1−xt−2)+wtxt−xt−1=α(xt−1−xt−2)+wt x_t - x_{t-1} = \alpha ( x_{t-1} - x_{t-2} )+ w_t xt=(1+α)xt−1−αxt−2+wtxt=(1+α)xt−1−αxt−2+wt x_t = ( 1 …
7 r  time-series  arima 

2
Warum benutzen wir nicht einfach
Immerhin berechnen wir das VIF mit 1 / ( 1 -R.2j)1/(1−Rj2)1/(1-R_j^2). Ein VIF von555 entspricht einem R.2J.RJ2R_J^2 von 0,80.80.8. Für mich sind die Informationen vonR.2jRj2R_j^2wird nur dunkler, wenn ich die VIF-Formel anwende. Warum kann ich nicht einfach verwendenR.2jRj2R_j^2 Multikollinearität zu erkennen?


1
Probabilistische Modelle für partielle kleinste Quadrate, reduzierte Rangregression und kanonische Korrelationsanalyse?
Diese Frage ergibt sich aus der Diskussion nach einer vorherigen Frage: Welche Verbindung besteht zwischen partiellen kleinsten Quadraten, reduzierter Rangregression und Hauptkomponentenregression? Für die Hauptkomponentenanalyse ist ein häufig verwendetes Wahrscheinlichkeitsmodell wobei , \ mathbf {w} \ in S ^ {p-1} , \ lambda> 0 und \ boldsymbol \ epsilon \ …



1
Wie erstelle ich ein Kalibrierungsdiagramm für Überlebensdaten, ohne Daten zu gruppieren?
Um ein Kalibrierungsdiagramm für Überlebenswahrscheinlichkeiten zu erstellen, die anhand eines Cox-Modells geschätzt wurden, kann das geschätzte Risiko in Gruppen unterteilt, das durchschnittliche Risiko innerhalb einer Gruppe berechnet und dann mit der Kaplan-Meier-Schätzung verglichen werden. Was sind alternative Ansätze, für die kein Binning erforderlich ist? Welche spezifischen Schritte sind erforderlich, um …

3
Weibull-Überlebensmodell mit zeitlich variierenden Covariaten in R.
Ich versuche, ein Überlebensmodell mit dem Weibull-Ansatz zu erstellen, aber die Falte ist, dass ich zeitlich variierende Kovariaten habe. Ich verwende das Überlebenspaket in R. Mein Anruf lautet: output <- survreg(Surv(start, stop, fail) ~ gdppc + [...] + cluster(name), data = mydata, dist="weibull") was den folgenden Fehler ergibt: Error in …

1
Ist es gültig, ein ARMAX-Modell für die TV-Zuordnung zu verwenden?
Angenommen, ich habe eine Website mit stündlichem Basisverkehr. Ich schalte auch zeitweise Fernsehwerbung, was meinen Webverkehr steigert. Ich möchte feststellen, welchen Einfluss meine Fernsehwerbung auf die Steigerung des Webverkehrs hat. Wenn ich ein ARMAX-Modell mit stündlichen TV-Werbeausgaben oder Impressionen als exogenen Variablen anpasse, kann dann behauptet werden, dass die AR-Begriffe …

1
FDR-Korrektur, wenn Tests korreliert sind
Ich habe einen Datensatz mit einer kleinen Anzahl von Stichproben und einer großen Anzahl von Variablen. Ich habe für jede Variable einen Hypothesentest (T-Test) durchgeführt und eine Reihe von p-Werten erhalten. Die Variablen sind jedoch miteinander korreliert und die FDR-Korrektur (Benjamini-Hochberg-Verfahren) geht davon aus, dass die Tests unabhängig oder positiv …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.