Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


1
Warum erhöht sich der Standardfehler des Abschnitts, je weiter von 0 entfernt ist?
Der Standardfehler des Intercept-Terms ( ) in ist gegeben durch wobei \ bar {x} ist der Mittelwert der x_i 's.β^0β^0\hat{\beta}_0y=β1x+β0+εy=β1x+β0+εy=\beta_1x+\beta_0+\varepsilonSE(β^0)2=σ2[1n+x¯2∑ni=1(xi−x¯)2]SE(β^0)2=σ2[1n+x¯2∑i=1n(xi−x¯)2]SE(\hat{\beta}_0)^2 = \sigma^2\left[\frac{1}{n}+\frac{\bar{x}^2}{\sum_{i=1}^n(x_i-\bar{x})^2}\right]x¯x¯\bar{x}xixix_i [β^0−2SE,β^0+2SE][β^0−2SE,β^0+2SE][\hat{\beta}_0-2SE,\hat{\beta}_0+2SE] ich weiß, quantifiziert die SE Ihre Unsicherheit - zum Beispiel wird in 95% der Stichproben das Intervall [\ hat {\ beta} _0-2SE, \ hat {\ beta} _0 …

1
Eine Routine zur Auswahl von eps und minPts für DBSCAN
DBSCAN ist laut einiger Literatur der am häufigsten zitierte Cluster-Algorithmus und kann beliebige Formcluster basierend auf der Dichte finden. Es hat zwei Parameter eps (als Nachbarschaftsradius) und minPts (als minimale Nachbarn, um einen Punkt als Kernpunkt zu betrachten), von denen ich glaube, dass sie in hohem Maße davon abhängen. Gibt …

3
Transformieren extrem verzerrter Verteilungen
Angenommen, ich habe eine Variable, deren Verteilung zu einem sehr hohen Grad positiv verzerrt ist, so dass das Aufnehmen des Protokolls nicht ausreicht, um es in den Bereich der Verzerrung für eine Normalverteilung zu bringen. Welche Möglichkeiten habe ich derzeit? Was kann ich tun, um die Variable in eine Normalverteilung …


1
Geometrische Interpretation des verallgemeinerten linearen Modells
Für lineares Modell , können wir eine schöne geometrische Interpretation des geschätzten Modells über OLS haben: y = x β + e . Y ist die Projektion von Y auf den Raum aufgespannt durch X- und Rest e senkrecht zu diesem Raum durch x aufgespannt.y=xβ+ey=xβ+ey=x\beta+ey^=xβ^+e^y^=xβ^+e^\hat{y}=x\hat{\beta}+\hat{e}y^y^\hat{y}e^e^\hat{e} Meine Frage ist nun: Gibt …


1
Verwenden von MLE vs. OLS
Wann ist es vorzuziehen, die Maximum-Likelihood-Schätzung anstelle der gewöhnlichen kleinsten Quadrate zu verwenden? Was sind die Stärken und Grenzen eines jeden? Ich versuche, praktisches Wissen darüber zu sammeln, wo sie in allgemeinen Situationen eingesetzt werden können.


1
LogLikelihood-Parameterschätzung für linearen Gaußschen Kalman-Filter
Ich habe einen Code geschrieben, der die Kalman-Filterung (unter Verwendung einer Reihe verschiedener Kalman-Filter [Information Filter et al.]) Für die lineare Gaußsche Zustandsraumanalyse für einen n-dimensionalen Zustandsvektor durchführen kann. Die Filter funktionieren sehr gut und ich bekomme eine schöne Ausgabe. Die Parameterschätzung über die Loglikelihood-Schätzung verwirrt mich jedoch. Ich bin …


2
Vertrauensform und Vorhersageintervalle für nichtlineare Regression
Sollen die Konfidenz- und Vorhersagebänder einer nichtlinearen Regression symmetrisch zur Regressionslinie sein? Das heißt, sie nehmen nicht die Sanduhrform an, wie im Fall der Bänder für die lineare Regression. Warum das? Hier ist das fragliche Modell: F(x)=⎛⎝⎜⎜A−D1+(xC)B⎞⎠⎟⎟+DF(x)=(A−D1+(xC)B)+D F(x) = \left(\frac{A-D}{1 + \left(\frac x C\right)^B}\right) + D Hier ist die Abbildung: …


2
Was ist die maximale Entropiewahrscheinlichkeitsdichtefunktion für eine positive stetige Variable eines gegebenen Mittelwerts und einer gegebenen Standardabweichung?
Was ist die maximale Entropieverteilung ? für eine positive stetige Variable angesichts ihres ersten und zweiten Moments? Zum Beispiel ist eine Gaußsche Verteilung die maximale Entropieverteilung für eine unbegrenzte Variable aufgrund ihres Mittelwerts und ihrer Standardabweichung, und eine Gamma-Verteilung ist die maximale Entropieverteilung für eine positive Variable aufgrund ihres Mittelwerts …

2
Dunnetts Test in R liefert jedes Mal andere Werte
Ich benutze die R "Multcomp" -Bibliothek ( http://cran.r-project.org/web/packages/multcomp/ ), um Dunnetts Test zu berechnen. Ich benutze das folgende Skript: Group <- factor(c("A","A","B","B","B","C","C","C","D","D","D","E","E","F","F","F")) Value <- c(5,5.09901951359278,4.69041575982343,4.58257569495584,4.79583152331272,5,5.09901951359278,4.24264068711928,5.09901951359278,5.19615242270663,4.58257569495584,6.16441400296898,6.85565460040104,7.68114574786861,7.07106781186548,6.48074069840786) data <- data.frame(Group, Value) aov <- aov(Value ~ Group, data) summary(glht(aov, linfct=mcp(Group="Dunnett"))) Wenn ich dieses Skript nun mehrmals über die R-Konsole ausführe, erhalte ich jedes …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.