Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Das Bayes-Risiko verstehen
Bei der Bewertung eines Schätzers sind die beiden wahrscheinlich am häufigsten verwendeten Kriterien das maximale Risiko und das Bayes-Risiko. Meine Frage bezieht sich auf die letztere: Das Bayes-Risiko unter dem vorherigen ist wie folgt definiert:ππ\pi Bπ(θ^)=∫R(θ,θ^)π(θ)dθBπ(θ^)=∫R(θ,θ^)π(θ)dθB_{\pi} (\hat{\theta}) = \int R(\theta, \hat{\theta} ) \pi ( \theta ) d \theta Ich verstehe …

3
Wann sollte GLM anstelle von LM verwendet werden?
Wann sollte ein verallgemeinertes lineares Modell gegenüber einem linearen Modell verwendet werden? Ich weiß, dass das verallgemeinerte lineare Modell zum Beispiel zulässt, dass die Fehler eine andere Verteilung als normal haben, aber warum befasst man sich mit der Verteilung der Fehler? Zum Beispiel, warum sind verschiedene Fehlerverteilungen nützlich?

3
Hohe Autokorrelation bei der L-ten Differenzordnung einer Folge unabhängiger Zufallszahlen
Um diese Frage genauer zu erläutern, werde ich zunächst meinen Ansatz erläutern: Ich simulierte eine Folge unabhängiger Zufallszahlen .X={x1,...,xN}X={x1,...,xN}X = \{x_1,...,x_N\} Ich nehme dann mal den Unterschied; dh ich erstelle die Variablen:LLL dX1={X(2)−X(1),...,X(N)−X(N−1)}dX1={X(2)−X(1),...,X(N)−X(N−1)}dX_{1} = \{X(2)-X(1),...,X(N)-X(N-1)\} dX.2= { dX.1( 2 ) - dX.1( 1 ) , . . . , dX.1( …

3
Friedman-Test und Post-Hoc-Test für Python
In meinem Datensatz habe ich fünf (ordinale) Gruppen mit einem x-Maß. Da die Homoskedastizität verletzt wird, habe ich den Friedman-Chi-Quadrat-Test durchgeführt, um festzustellen, ob es statistische Unterschiede zwischen den Gruppen gibt: fried = stats.friedmanchisquare(*[grp for idx, grp in df.iteritems()])) Dies ergab einen statistischen Unterschied, aber jetzt möchte ich herausfinden, zwischen …

4
Gibt es eine Version des Korrelationskoeffizienten, die für Ausreißer weniger empfindlich ist?
Der Korrelationskoeffizient ist: r =∑k(xk- -x¯) (yk- -yk¯)sxsyn - 1r=∑k(xk- -x¯)(yk- -yk¯)sxsyn- -1 r = \frac{\sum_k \frac{(x_k - \bar{x}) (y_k - \bar{y_k})}{s_x s_y}}{n-1} Der Stichprobenmittelwert und die Standardabweichung der Stichprobe sind empfindlich gegenüber Ausreißern. Auch der Mechanismus, wo, r =∑kZeugkn - 1r=∑kZeugkn- -1 r = \frac{\sum_k \text{stuff}_k}{n -1} ist auch …

3
Warum ist die Varianz von 2SLS größer als die von OLS?
... Ein weiteres potenzielles Problem bei der Anwendung von 2SLS- und anderen IV-Verfahren besteht darin, dass die 2SLS-Standardfehler tendenziell "groß" sind. Mit dieser Aussage ist normalerweise gemeint, dass entweder 2SLS-Koeffizienten statistisch nicht signifikant sind oder dass der 2SLS-Standard Fehler sind viel größer als die OLS-Standardfehler. Es überrascht nicht, dass die …

2
Wie löse ich logistische Regression mit gewöhnlichen kleinsten Quadraten?
Ich habe selbst maschinell gelernt. Ich bin auf diesen Abschnitt der Wikipedia-Seite über logistische Regression gestoßen , in dem behauptet wird Weil das Modell als verallgemeinertes lineares Modell (siehe unten) für 0 ausgedrückt werden kann Es scheint mir, dass ich ein logistisches Regressions-Setup in ein lineares Regressions-Setup umwandeln kann. Aber …


1
max_delta_step in xgboost
Ich kann anhand der Beschreibung in der Dokumentation nicht vollständig verstehen, wie dieser Parameter funktioniert [max_delta_step [default = 0]] Maximaler Delta-Schritt, den wir für die Gewichtsschätzung jedes Baums zulassen. Wenn der Wert auf 0 gesetzt ist, gibt es keine Einschränkung. Wenn ein positiver Wert festgelegt ist, kann dies dazu beitragen, …
9 xgboost 


1
Was bricht die Vergleichbarkeit von Modellen mit dem AIC?
Angenommen, ich habe einige Modelle mit Prädiktoren (und der Antwortvariablen) aus demselben Datensatz angepasst. Welche Änderungen am Modell machen es für mich unangemessen, die Modelle auf der Basis von AIC zu vergleichen? 1) Angenommen, wenn ich die Transformation der abhängigen Variablen protokolliere, ist es fair, sie mit einem Modell zu …
9 aic 




1
Wie kann man eine Überanpassung im Faltungs-Neuronalen Netz identifizieren?
Ich verstehe, dass Dropout verwendet wird, um Überanpassungen im Netzwerk zu reduzieren. Dies ist eine Verallgemeinerungstechnik. Wie kann ich im Faltungsnetzwerk eine Überanpassung erkennen? Eine Situation, an die ich denken kann, ist, wenn die Trainingsgenauigkeit im Vergleich zur Test- oder Validierungsgenauigkeit zu hoch ist. In diesem Fall versucht das Modell, …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.