Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


5
Rekursiver (online) regularisierter Algorithmus der kleinsten Quadrate
Kann mich jemand auf einen (rekursiven) Online-Algorithmus für die Tikhonov-Regularisierung (regularisierte kleinste Quadrate) hinweisen? In einer Offline-Einstellung würde ich Verwendung meines ursprünglichen Datensatzes berechnen, wobei unter Verwendung der n-fachen Kreuzvalidierung gefunden wird. Ein neuer Wert kann für ein gegebenes x mit y = x ^ T \ hat \ beta …


1
Verhältnis von Wahrscheinlichkeiten zu Verhältnis von PDFs
Ich verwende Bayes, um ein Clustering-Problem zu lösen. Nach einigen Berechnungen muss ich das Verhältnis zweier Wahrscheinlichkeiten ermitteln: P(A)/P(B)P(A)/P(B)P(A)/P(B) um . Diese Wahrscheinlichkeiten werden durch die Integration von zwei verschiedenen multivariaten 2D-KDEs erhalten, wie in dieser Antwort erläutert :P(H|D)P(H|D)P(H|D) P ( B ) = ∬ x , y : g …

3
Intuitiver Grund, warum die Fisher Information of Binomial umgekehrt proportional zu
Es verwirrt / verwirrt mich, dass das Binomial eine Varianz proportional zu p(1−p)p(1−p)p(1-p) . Entsprechend ist die Fisher-Information proportional zu 1p(1−p)1p(1−p)\frac{1}{p(1-p)} . Was ist der Grund dafür? Warum wird die Fisher-Information beiminimiertp=0.5p=0.5p=0.5? Das heißt, warum ist die Inferenz beiam schwierigstenp=0.5p=0.5p=0.5? Kontext: Ich arbeite an einem Stichprobengrößenrechner, und die Formel für …

2
Bedeutet MLE immer, dass wir das zugrunde liegende PDF unserer Daten kennen, und bedeutet EM, dass wir es nicht kennen?
Ich habe einige einfache konzeptionelle Fragen, die ich in Bezug auf MLE (Maximum Likelihood Estimation) klären möchte, und welchen Zusammenhang es gegebenenfalls mit EM (Expectation Maximization) hat. Wenn jemand sagt, "Wir haben die MLE verwendet", bedeutet dies nach meinem Verständnis dann automatisch, dass er ein explizites Modell der PDF-Datei seiner …

10
Allgemeine Wörter, die bestimmte statistische Bedeutungen haben
Ich bin kein Statistiker, aber meine Forschungsarbeit umfasst Statistiken (Daten analysieren, Literatur lesen usw.). Ein Kommentar zu einer meiner hier gestellten Fragen erinnerte mich erneut daran , dass es einige gebräuchliche Wörter gibt, die für diejenigen, die auf dem Gebiet der Statistik gut geübt sind, besondere Bedeutungen oder Konnotationen haben. …

2
Intuition hinter der t-Verteilungsdichtefunktion
Ich studiere die t-Verteilung von Studenten und begann mich zu fragen, wie man die t-Verteilungsdichtefunktion ableiten könnte (aus Wikipedia, http://en.wikipedia.org/wiki/Student%27s_t-distribution ): f(t)=Γ(v+12)vπ−−√Γ(v2)(1+t2v)−v+12f(t)=Γ(v+12)vπΓ(v2)(1+t2v)−v+12f(t) = \frac{\Gamma(\frac{v+1}{2})}{\sqrt{v\pi}\:\Gamma(\frac{v}{2})}\left(1+\frac{t^2}{v} \right)^{-\frac{v+1}{2}} Dabei ist der Freiheitsgrad und Γ die Gammafunktion. Was ist die Intuition dieser Funktion? Ich meine, wenn ich mir die Wahrscheinlichkeitsmassenfunktion der Binomialverteilung anschaue, ist …

2
Wie kann ich Bootstrap-p-Werte über mehrfach kalkulierte Datensätze zusammenfassen?
Ich befasse mich mit dem Problem, dass ich den p-Wert für eine Schätzung von aus multipliziert unterstellten (MI) Daten bootstrappen möchte , aber mir unklar ist, wie ich die p-Werte über MI-Mengen kombinieren soll.θθ\theta Für MI-Datensätze verwendet der Standardansatz zur Ermittlung der Gesamtvarianz von Schätzungen Rubins Regeln. Sehen Sie hier …


2
Warum testen manche Leute regressionsähnliche Modellannahmen an ihren Rohdaten und andere Leute testen sie an den Residuen?
Ich bin ein Doktorand in experimenteller Psychologie und ich bemühe mich sehr, meine Fähigkeiten und Kenntnisse im Analysieren meiner Daten zu verbessern. Bis zu meinem 5. Jahr in Psychologie dachte ich, dass die regressionsähnlichen Modelle (zB ANOVA) die folgenden Dinge annehmen: Normalität der Daten Varianzhomogenität für die Daten und so …

1
Logarithmisch verknüpftes Gamma-GLM vs. logarithmisch verknüpftes Gaußsches GLM vs. logarithmisch transformiertes LM
Aus meinen Ergebnissen geht hervor, dass GLM Gamma die meisten Annahmen erfüllt, aber ist es eine lohnende Verbesserung gegenüber dem logarithmisch transformierten LM? Die meiste Literatur, die ich gefunden habe, befasst sich mit Poisson- oder Binomial-GLMs. Ich fand den Artikel EVALUIERUNG VON GENERALISIERTEN LINEAREN MODELLANNAHMEN MIT RANDOMISIERUNG sehr nützlich, aber …


5
John Kerrich Coin-Flip-Daten
Kann jemand vorschlagen, wo man die Ergebnisse der 10.000 Münzwürfe (dh aller 10.000 Kopf- und Zahlwürfe) erhält, die John Kerrich während des Zweiten Weltkriegs durchgeführt hat?

4
In R, wie der p-Wert für die Fläche unter ROC berechnet wird
Ich habe Mühe, einen Weg zu finden, um den p-Wert für das Gebiet unter einer Empfängeroperatorcharakteristik (ROC) zu berechnen. Ich habe eine kontinuierliche Variable und ein diagnostisches Testergebnis. Ich möchte sehen, ob AUROC statistisch signifikant ist. Ich habe viele Pakete gefunden, die sich mit ROC-Kurven befassen: pROC, ROCR, caTools, verification, …
12 r  p-value  roc 

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.