Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Logistische Regression und Wahrscheinlichkeit verstehen
Wie funktioniert die Parameterschätzung / Training der logistischen Regression wirklich? Ich werde versuchen, das, was ich habe, so weit zu bringen. Die Ausgabe ist y die Ausgabe der logistischen Funktion in Form einer Wahrscheinlichkeit in Abhängigkeit vom Wert von x: P(y=1|x)=11+e−ωTx≡σ(ωTx)P(y=1|x)=11+e−ωTx≡σ(ωTx)P(y=1|x)={1\over1+e^{-\omega^Tx}}\equiv\sigma(\omega^Tx) P(y=0|x)=1−P(y=1|x)=1−11+e−ωTxP(y=0|x)=1−P(y=1|x)=1−11+e−ωTxP(y=0|x)=1-P(y=1|x)=1-{1\over1+e^{-\omega^Tx}} Für eine Dimension ist die sogenannte Quote wie …

1
Wie können fehlende Daten bei der Verwendung von Splines oder Bruchpolynomen behandelt werden?
Ich lese Multivariable Model Building: Ein pragmatischer Ansatz zur Regressionsanalyse basierend auf fraktionellen Polynomen zur Modellierung kontinuierlicher Variablen von Patrick Royston und Willie Sauerbrei. Bisher bin ich beeindruckt und es ist ein interessanter Ansatz, den ich vorher nicht in Betracht gezogen hatte. Die Autoren gehen jedoch nicht auf fehlende Daten …

3
Gibt es heute jemanden, der schneller ist als Usain Bolt?
EDIT: Ich interessiere mich mehr für die technischen Fragen und Methoden zur Bestimmung der Wahrscheinlichkeit eines "wahren" Maximums in einer bestimmten Population bei einer Stichprobenstatistik. Es gibt Probleme, die Wahrscheinlichkeit schnellerer Läufer als Mr. Bolt anhand von Rekordzeiten zu schätzen, die sowohl offensichtlich als auch subtil sind. Humor mich, indem …

2
Splines in GLM und GAM
Ist es falsch, dass Splines nur in GAM-Modellen und nicht in GLM-Modellen verfügbar sind? Ich habe das vor einiger Zeit gehört und mich gefragt, ob dies nur ein Missverständnis ist oder ob es eine Wahrheit ist. Hier ist eine Illustration:

3
Ist die PCA-Optimierung konvex?
Die objektive Funktion der Hauptkomponentenanalyse (PCA) ist die Minimierung des Rekonstruktionsfehlers in der L2-Norm (siehe Abschnitt 2.12 hier) . Eine andere Ansicht versucht, die Varianz bei der Projektion zu maximieren. Wir haben auch hier einen ausgezeichneten Beitrag: Was ist die objektive Funktion der PCA? ? ). Meine Frage ist, dass …

1
Warum beschleunigt die redundante mittlere Parametrisierung Gibbs MCMC?
In dem Buch von Gelman & Hill (2007) (Datenanalyse unter Verwendung von Regression und mehrstufigen / hierarchischen Modellen) behaupten die Autoren, dass die Einbeziehung redundanter mittlerer Parameter zur Beschleunigung der MCMC beitragen kann. Das gegebene Beispiel ist ein nicht verschachteltes Modell des "Flugsimulators" (Gl. 13.9): yiγjδk∼N(μ+γj[i]+δk[i],σ2y)∼N(0,σ2γ)∼N(0,σ2δ)yi∼N(μ+γj[i]+δk[i],σy2)γj∼N(0,σγ2)δk∼N(0,σδ2) \begin{align} y_i &\sim N(\mu …


2
Sind Kaggle-Wettbewerbe nur zufällig gewonnen?
Kaggle-Wettbewerbe bestimmen die endgültigen Platzierungen auf der Grundlage eines durchgehaltenen Testsatzes. Ein durchgehaltener Testsatz ist eine Stichprobe; Es kann sein, dass es nicht repräsentativ für die zu modellierende Population ist. Da jede Einsendung wie eine Hypothese ist, hat der Algorithmus, der den Wettbewerb gewonnen hat, möglicherweise den Testsatz besser als …

2
Wie benutze ich einen Kalman-Filter?
Ich habe eine Flugbahn eines Objekts in einem 2D-Raum (einer Oberfläche). Die Flugbahn wird als eine Folge von (x,y)Koordinaten angegeben. Ich weiß, dass meine Messungen laut sind und ich manchmal offensichtliche Ausreißer habe. Also möchte ich meine Beobachtungen filtern. Soweit ich Kalman Filter verstanden habe, tut es genau das, was …

2
Ist es falsch, Features basierend auf dem p-Wert auszuwählen?
Es gibt mehrere Beiträge zum Auswählen von Features. Eine der Methoden beschreibt die Wichtigkeit von Merkmalen basierend auf t-Statistiken. In R, varImp(model)angewendet auf ein lineares Modell mit standardisierten Merkmalen, wird der Absolutwert der t-Statistik für jeden Modellparameter verwendet. Im Grunde genommen wählen wir ein Feature basierend auf seiner t-Statistik aus, …


2
QQ-Plot sieht normal aus, aber Shapiro-Wilk-Test sagt etwas anderes
In R habe ich eine Stichprobe von 348 Kennzahlen und möchte wissen, ob ich davon ausgehen kann, dass sie für zukünftige Tests normalverteilt sind. Nach einer weiteren Stack-Antwort betrachte ich im Wesentlichen die Dichtekurve und die QQ-Kurve mit: plot(density(Clinical$cancer_age)) qqnorm(Clinical$cancer_age);qqline(Clinical$cancer_age, col = 2) Ich habe keine große Erfahrung mit Statistik, …




Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.