Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


5
Hat -squared einen Wert?
Ich habe mich verwirrt zu verstehen versucht, ob ein rrr Quadrat-Wert auch einen p- Wert hat ppp. Wie ich es verstehe, kann r in linearer Korrelation mit einer Menge von Datenpunkten rrreinen Wert im Bereich von - 1−1-1 bis 111 und dieser Wert kann, was auch immer er ist, einen …


5
Was ist der Grund, warum die Protokolltransformation bei rechtsseitigen Verteilungen verwendet wird?
Das habe ich mal gehört Die log-Transformation ist die beliebteste für rechtsgerichtete Verteilungen in der linearen oder quantilen Regression Ich würde gerne wissen, ob dieser Aussage ein Grund zugrunde liegt. Warum eignet sich die Protokollumwandlung für eine Verteilung mit einem rechten Versatz? Wie wäre es mit einer linksgerichteten Verteilung?

5
Variabilität der cv.glmnet-Ergebnisse
Ich benutze cv.glmnet, um Prädiktoren zu finden. Das Setup, das ich verwende, ist wie folgt: lassoResults<-cv.glmnet(x=countDiffs,y=responseDiffs,alpha=1,nfolds=cvfold) bestlambda<-lassoResults$lambda.min results<-predict(lassoResults,s=bestlambda,type="coefficients") choicePred<-rownames(results)[which(results !=0)] Um sicherzustellen, dass die Ergebnisse reproduzierbar sind, habe ich set.seed(1). Die Ergebnisse sind sehr unterschiedlich. Ich habe genau den gleichen Code 100 ausgeführt, um zu sehen, wie variabel die Ergebnisse …

4
Handelt es sich um Synonyme für „Zufallsstichprobe“ und „Zufallsvariable“?
Ich habe Schwierigkeiten gehabt, die Bedeutung von "Zufallsstichprobe" und "iid Zufallsvariable" zu verstehen. Ich habe versucht, die Bedeutung aus mehreren Quellen herauszufinden, wurde aber immer verwirrter. Ich poste hier, was ich versucht und erfahren habe: Degroots Wahrscheinlichkeit & Statistik sagt: Zufällige Stichproben / iid / Stichprobengröße: Betrachten Sie eine gegebene …


4
Wie lassen sich Unterschiede in unterschiedlichen Anteilen in drei Gruppen am besten darstellen?
Ich versuche visuell zu vergleichen, wie drei verschiedene Nachrichtenpublikationen verschiedene Themen abdecken (bestimmt durch ein LDA-Themenmodell). Ich habe dazu zwei verwandte Methoden, aber viele Rückmeldungen von Kollegen erhalten, dass dies nicht sehr intuitiv ist. Ich hoffe, dass jemand da draußen eine bessere Idee hat, dies zu visualisieren. In der ersten …


1
MCMC in einem begrenzten Parameterraum?
Ich versuche, MCMC auf ein Problem anzuwenden, aber meine Prioritäten (in meinem Fall ) sind auf einen Bereich beschränkt? Kann ich normales MCMC verwenden und die Samples ignorieren, die außerhalb der eingeschränkten Zone liegen (in meinem Fall [0,1] ^ 2), dh die Übergangsfunktion wiederverwenden, wenn der neue Übergang aus einem …

3
Was bedeutet „Normalisierung“ und wie kann überprüft werden, ob eine Stichprobe oder eine Verteilung normalisiert ist?
Ich habe eine Frage, in der nachgefragt wird, ob die Gleichverteilung ( Uniform(a,b)Uniform(a,b){\rm Uniform}(a,b) ) normalisiert ist. Was bedeutet es für eine Distribution, normalisiert zu werden? Und zweitens, wie können wir überprüfen, ob eine Distribution normalisiert ist oder nicht? Ich verstehe, dass wir unter normalisierte Daten erhalten , aber hier …

2
Was sind die vier Achsen im PCA-Biplot?
Wenn Sie einen Biplot für eine PCA-Analyse erstellen, haben Sie die Hauptkomponente PC1-Scores auf der x-Achse und PC2-Scores auf der y-Achse. Aber was sind die anderen beiden Achsen rechts und oben auf dem Bildschirm?
18 r  pca  biplot 

2
Anomalieerkennung mit Dummy-Funktionen (und anderen diskreten / kategorialen Funktionen)
tl; dr Was ist die empfohlene Methode zum Umgang mit discreteDaten bei der Erkennung von Anomalien? Was ist die empfohlene Methode zum Umgang mit categoricalDaten bei der Erkennung von Anomalien? Diese Antwort schlägt vor, diskrete Daten zu verwenden, um nur die Ergebnisse zu filtern. Vielleicht den Kategoriewert durch die prozentuale …

2
Verwendung von Gewichten in svyglm vs glm
Ich würde gerne wissen, wie sich die Behandlung von Gewichten zwischen svyglmund unterscheidetglm Ich benutze das twangPaket in R, um Neigungsbewertungen zu erstellen, die dann wie folgt als Gewichte verwendet werden (dieser Code stammt aus der twangDokumentation): library(twang) library(survey) set.seed(1) data(lalonde) ps.lalonde <- ps(treat ~ age + educ + black …
18 r  survey 

1
Grundlegende Fragen zur zeitdiskreten Überlebensanalyse
Ich versuche, mithilfe eines logistischen Regressionsmodells eine diskrete Zeitüberlebensanalyse durchzuführen, und bin nicht sicher, ob ich den Prozess vollständig verstehe. Ich würde mich sehr über Unterstützung bei ein paar grundlegenden Fragen freuen. Hier ist der Aufbau: Ich sehe die Mitgliedschaft in einer Gruppe innerhalb eines Zeitfensters von fünf Jahren. Jedes …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.