Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


1
Beispiele für eine fehlerhafte Anwendung des Bayes-Theorems
Diese Frage der Math Overflow- Community fragte nach "Beispielen für schlechte Argumente, die die Anwendung mathematischer Theoreme in nicht-mathematischen Kontexten beinhalten" und erstellte eine faszinierende Liste pathologisch angewandter Mathematik. Ich wundere mich über ähnliche Beispiele für pathologische Verwendungen der Bayes'schen Folgerung. Hat jemand auf akademische Artikel gestoßen, exzentrische Blog-Posts, die …
11 bayesian 

2
Worum geht es in der Praxis beim maschinellen Lernen?
Ich bin ein Neuling im Bereich maschinelles Lernen (auch einige Statistiken), habe eine Weile Wissen gelernt (überwachte / unbeaufsichtigte Lernalgorithmen, relevante Optimierungsmethoden, Regularisierungen, einige Philosophien (wie Bias-Varianz-Kompromiss?)). Ich weiß, dass ich ohne echte Übung kein tiefes Verständnis für diese maschinellen Lerninhalte gewinnen würde. Ich beginne also mit einem Klassifizierungsproblem mit …


1
Angepasste Werte des ARMA-Modells
Ich versuche zu verstehen, wie angepasste Werte für ARMA (p, q) -Modelle berechnet werden. Ich habe hier bereits eine Frage zu angepassten Werten von ARMA-Prozessen gefunden, konnte diese jedoch nicht verstehen. Wenn ich ein ARMA (1,1) -Modell habe, dh X.t= α1X.t - 1+ ϵt- - β1ϵt - 1X.t=α1X.t- -1+ϵt- -β1ϵt- …
11 arma 

2
Random Intercept-Modell vs. GEE
Betrachten Sie ein lineares Modell mit zufälligen Abschnitten. Dies entspricht einer linearen GEE-Regression mit einer austauschbaren Arbeitskorrelationsmatrix. Angenommen , die Prädiktoren sind und x 3 und die Koeffizienten für diese Prädiktoren sind β 1 , β 2 und β 3 . Was ist die Interpretation für die Koeffizienten im Zufallsschnittmodell? …

3
Die Zukunft der Statistik
Diese Frage kam mir in den Sinn, als ich in einem öffentlichen Vortrag über ungelöste Fragen der Mathematik saß. Es ist bekannt, dass es noch viele ungelöste mathematische Fragen gibt. Ich habe darüber nachgedacht, was die ungelösten Probleme in der Statistik sind. Nachdem ich einige Zeit damit verbracht habe, dieses …


1
Gibbs-Stichprobe für das Ising-Modell
Hausaufgabenfrage: Betrachten Sie das 1-d-Ising-Modell. Let x=(x1,...xd)x=(x1,...xd)x = (x_1,...x_d) . xixix_i ist entweder -1 oder +1 π(x)∝e∑39i=1xixi+1π(x)∝e∑i=139xixi+1\pi(x) \propto e^{\sum_{i=1}^{39}x_ix_{i+1}} Entwerfen Sie einen Gibbs-Abtastalgorithmus, um Abtastwerte ungefähr aus der Zielverteilung zu generieren.π(x)π(x)\pi(x) . Mein Versuch: Wählen Sie zufällig Werte (entweder -1 oder 1), um den Vektor zu füllen . Also vielleicht …


1
Wie adressieren instrumentelle Variablen die Auswahlverzerrung?
Ich frage mich, wie eine instrumentelle Variable die Auswahlverzerrung bei der Regression angeht. Hier ist das Beispiel, an dem ich kaue: In Mostly Harmless Econometrics diskutieren die Autoren eine IV-Regression in Bezug auf Militärdienst und Einkommen im späteren Leben. Die Frage ist: "Steigert oder verringert der Militärdienst die zukünftigen Einnahmen?" …

1
Gibt es für exponentielle Familienverteilungen immer den Mittelwert und die Varianz?
Angenommen, eine skalare Zufallsvariable gehört zu einer Vektorparameter-Exponentialfamilie mit PDFXXX fX(x|θ)=h(x)exp(∑i=1sηi(θ)Ti(x)−A(θ))fX(x|θ)=h(x)exp⁡(∑i=1sηi(θ)Ti(x)−A(θ)) f_X(x|\boldsymbol \theta) = h(x) \exp\left(\sum_{i=1}^s \eta_i({\boldsymbol \theta}) T_i(x) - A({\boldsymbol \theta}) \right) wobei der Parametervektor ist und T ( x ) = ( T 1 ( x ) , T 2 ( x ) , ⋯ , T s …

2
Validieren Sie Web-A / B-Tests, indem Sie ein Experiment erneut ausführen. Ist dies gültig?
In einem Webinar eines A / B-Testunternehmens wurde der ansässige "Data Scientist" erklärt, dass Sie Ihre Ergebnisse validieren sollten, indem Sie das Experiment erneut ausführen. Die Prämisse war, dass bei Auswahl von 95% Konfidenz eine Wahrscheinlichkeit von 5% (1/20) für ein falsches Positiv besteht. Wenn Sie Ihr Experiment mit denselben …

2
Wie lassen sich die Auswirkungen von Kategorien und ihre Verbreitung in der logistischen Regression am besten visualisieren?
Ich muss Informationen über die wichtigsten Prädiktoren für die Stimmen eines Kandidaten anhand von Umfragedaten zur öffentlichen Meinung präsentieren. Ich habe eine logistische Regression mit allen Variablen durchgeführt, die mir wichtig sind, aber ich kann keine gute Möglichkeit finden, diese Informationen darzustellen. Mein Kunde kümmert sich nicht nur um die …

3
Können (sollten?) Regularisierungstechniken in einem Zufallseffektmodell verwendet werden?
Mit Regularisierungstechniken beziehe ich mich auf Lasso, Gratregression, elastisches Netz und dergleichen. Stellen Sie sich ein Vorhersagemodell für Gesundheitsdaten vor, das demografische Daten und Diagnosedaten enthält, bei denen die Aufenthaltsdauer für stationäre Aufenthalte vorhergesagt wird. Für einige Personen gibt es mehrere LOS-Beobachtungen (dh mehr als eine IP-Episode) während des Basiszeitraums, …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.