Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Grundstatistik für Juroren
Ich wurde zur Jury bestellt. Ich bin mir der Relevanz der Statistik für einige Gerichtsverfahren bewusst. Zum Beispiel ist das Konzept des "Basiszinssatzes" und seine Anwendung auf Wahrscheinlichkeitsberechnungen manchmal - vielleicht immer - relevant. Welche statistischen Themen könnte eine Person in meiner Situation sinnvoll untersuchen und welche Materialien wären für …

2
Wie kann ich posteriore Mittel und glaubwürdige Intervalle nach mehrfacher Imputation zusammenfassen?
Ich habe mehrere Imputationen verwendet, um eine Reihe vollständiger Datensätze zu erhalten. Ich habe bei jedem der vervollständigten Datensätze Bayes'sche Methoden verwendet, um die posterioren Verteilungen für einen Parameter zu erhalten (ein zufälliger Effekt). Wie kann ich die Ergebnisse für diesen Parameter kombinieren / bündeln? Mehr Kontext: Mein Modell ist …

2
Simulation von Zeitreihen bei gegebener Leistung und Kreuzspektraldichte
Aufgrund ihrer Kovarianzmatrix (ihre Leistungsspektraldichten (PSDs) und Kreuzleistungsspektraldichten (CSDs)) habe ich Probleme, eine Reihe stationärer farbiger Zeitreihen zu erstellen. Ich weiß, dass ich mit zwei Zeitreihen und ihre Leistungsspektraldichten (PSDs) und Kreuzspektraldichten (CSDs) unter Verwendung vieler allgemein verfügbarer Routinen abschätzen kann, wie z und Funktionen in Matlab usw. Die PSDs …

3
Ich bekomme in Rollapply PCA in R "nervöse" Ladungen. Kann ich das beheben?
Ich habe 10 Jahre tägliche Rückgabedaten für 28 verschiedene Währungen. Ich möchte die erste Hauptkomponente extrahieren, aber anstatt PCA für die gesamten 10 Jahre zu betreiben, möchte ich ein 2-Jahres-Zeitfenster einhalten, da sich das Verhalten der Währungen verändert und ich dies reflektieren möchte. Ich habe jedoch ein großes Problem: Sowohl …
20 r  pca 

6
PCA von nicht-Gaußschen Daten
Ich habe ein paar kurze Fragen zu PCA: Geht die PCA davon aus, dass der Datensatz Gaußsch ist? Was passiert, wenn ich eine PCA auf inhärent nichtlineare Daten anwende? Bei einem gegebenen Datensatz besteht der Prozess darin, zunächst die Mittelwerte zu normalisieren, die Varianz auf 1 zu setzen, eine SVD …
20 pca  svd 


1
Berechnen von Vorhersageintervallen für die logistische Regression
Ich möchte verstehen, wie man Vorhersageintervalle für logistische Regressionsschätzungen erzeugt. Mir wurde geraten, die Verfahren in Colletts Modeling Binary Data , 2nd Ed S.98-99, zu befolgen. Nachdem predict.glmich dieses Verfahren implementiert und mit Rs verglichen habe, denke ich, dass dieses Buch das Verfahren zum Berechnen von Konfidenzintervallen und nicht von …

1
Fehler in der normalen Annäherung an eine gleichmäßige Summenverteilung
Eine naive Methode zur Annäherung an eine Normalverteilung besteht darin, etwa IID-Zufallsvariablen, die gleichmäßig auf verteilt sind, zu addieren , neu zu zentrieren und neu zu skalieren, wobei auf den zentralen Grenzwertsatz zurückgegriffen wird. ( Randnotiz : Es gibt genauere Methoden wie die Box-Muller-Transformation .) Die Summe der IID -Zufallsvariablen …

6
"Voll Bayesian" vs "Bayesian"
Ich habe etwas über Bayes'sche Statistiken gelernt und oft in Artikeln gelesen "Wir verfolgen einen bayesianischen Ansatz" oder etwas ähnliches. Ich bemerkte auch seltener: "Wir verfolgen einen vollständig bayesianischen Ansatz" (meine Betonung). Gibt es einen Unterschied zwischen diesen Ansätzen in praktischer oder theoretischer Hinsicht? FWIW, ich benutze das Paket MCMCglmmin …
20 bayesian 

2
Kreuzvalidierung gegen empirische Bayes zur Schätzung von Hyperparametern
Unter der Annahme eines hierarchischen Modells möchte ich, dass ein zweistufiger Prozess zum Modell passt. Korrigieren Sie zuerst eine Handvoll Hyperparameter und führen Sie dann die Bayes'sche Inferenz für die restlichen Parameter . Zur Fixierung der Hyperparameter überlege ich mir zwei Möglichkeiten.θ ϕp ( x | ϕ , θ )p(x|ϕ,θ)p(x|\phi,\theta)θθ\thetaϕϕ\phi …



4
Welchen Sinn macht es, p-Werte miteinander zu vergleichen?
Ich habe zwei Populationen (Männer und Frauen) mit jeweils Proben. Für jede Stichprobe habe ich zwei Eigenschaften A & B (Notendurchschnitt des ersten Jahres und SAT-Punktzahl). Ich habe einen T-Test separat für A & B verwendet: beide fanden signifikante Unterschiede zwischen den beiden Gruppen; A mit und B mit .100010001000p=0.008p=0.008p=0.008p=0.002p=0.002p=0.002 …

1
Konfidenzintervall um das Verhältnis von zwei Anteilen
Ich habe zwei Proportionen (z. B. Klickrate (CTR) für einen Link in einem Steuerungslayout und Klickrate für einen Link in einem experimentellen Layout) und möchte ein 95% -Konfidenzintervall um das Verhältnis dieser Proportionen berechnen. Wie mache ich das? Ich weiß, dass ich die Delta-Methode verwenden kann, um die Varianz dieses …

2
Caret-Methoden zur erneuten Probenahme
Ich benutze die Bibliothek caretin R, um verschiedene Modellierungsverfahren zu testen. Das trainControlObjekt erlaubt es, eine Neuabtastungsmethode anzugeben. Die Verfahren werden in der beschriebenen Dokumentation Abschnitt 2.3 und beinhalten: boot, boot632, cv, LOOCV, LGOCV, repeatedcvund oob. Obwohl einige davon leicht abzuleiten sind, sind nicht alle dieser Methoden klar definiert. Welche …
20 r  resampling  caret 

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.