Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Interpretation der Radon-Nikodym-Ableitung zwischen Wahrscheinlichkeitsmaßen?
Ich habe an einigen Stellen die Verwendung der Radon-Nikodym-Ableitung eines Wahrscheinlichkeitsmaßes in Bezug auf ein anderes gesehen, insbesondere in der Kullback-Leibler-Divergenz, wo es die Ableitung des Wahrscheinlichkeitsmaßes eines Modells für einen beliebigen Parameter mit ist bezüglich des realen Parameters θ 0 :θθ\thetaθ0θ0\theta_0 dPθdPθ0dPθdPθ0\frac {dP_\theta}{dP_{\theta_0}} Wobei dies beide Wahrscheinlichkeitsmaße für den …



1
RMSProp und Adam gegen SGD
Ich führe Experimente mit dem EMNIST-Validierungssatz unter Verwendung von Netzwerken mit RMSProp, Adam und SGD durch. Ich erreiche eine Genauigkeit von 87% mit SGD (Lernrate von 0,1) und Dropout (0,1 Dropout Prob) sowie L2-Regularisierung (1e-05-Strafe). Wenn ich die gleiche exakte Konfiguration mit RMSProp und Adam sowie die anfängliche Lernrate von …

4
Warum sind die Regressionsmethoden Least-Squares und Maximum-Likelihood nicht gleichwertig, wenn die Fehler nicht normal verteilt sind?
Titel sagt alles. Ich verstehe, dass die kleinsten Quadrate und die maximale Wahrscheinlichkeit das gleiche Ergebnis für Regressionskoeffizienten liefern, wenn die Fehler des Modells normal verteilt sind. Aber was passiert, wenn die Fehler nicht normal verteilt sind? Warum sind die beiden Methoden nicht mehr gleichwertig?

2
Warum sind diese Regressionsanova-Tabellen identisch?
Ich habe zwei Regressionen des gleichen Y und des dreistufigen X. Insgesamt n = 15, mit n = 5 in jeder Gruppe oder Stufe von X. Die erste Regression behandelt das X als kategorisch und weist den Stufen 2 und 3 mit Stufe Indikatorvariablen zu eine davon ist die Referenz. …
11 regression  anova 

4
Welche Beziehung besteht zwischen ANOVA zum Vergleichen der Mittelwerte mehrerer Gruppen und ANOVA zum Vergleichen verschachtelter Modelle?
Ich habe ANOVA bisher auf zwei Arten gesehen: Zunächst wurde in meinem einführenden Statistiktext ANOVA eingeführt, um Mittelwerte von drei oder mehr Gruppen zu vergleichen, als Verbesserung gegenüber dem paarweisen Vergleich, um festzustellen, ob eines der Mittelwerte einen statistisch signifikanten Unterschied aufweist. Zweitens habe ich in meinem statistischen Lerntext gesehen, …


3
Wie implementiere ich die L2-Regularisierung in Richtung eines beliebigen Punktes im Raum?
Folgendes habe ich in Ian Goodfellows Buch Deep Learning gelesen . Im Zusammenhang mit neuronalen Netzen "wird die L2-Parameternormstrafe allgemein als Gewichtsabfall bezeichnet. Diese Regularisierungsstrategie bringt die Gewichte näher an den Ursprung [...]. Allgemeiner könnten wir die Parameter so regulieren, dass sie nahe an einem bestimmten Punkt liegen im Raum …

4
Korrelation zwischen X und XY
Wenn ich zwei unabhängige Zufallsvariablen X und Y habe, wie ist die Korrelation zwischen X und dem Produkt XY? Wenn dies nicht bekannt ist, wäre ich daran interessiert, zumindest zu wissen, was im speziellen Fall passiert, wenn X und Y mit dem Mittelwert Null normal sind, wenn dies einfacher zu …

2
Ist die Fehlerrate eine konvexe Funktion des Regularisierungsparameters Lambda?
Bei der Auswahl des Regularisierungsparameters Lambda in Ridge oder Lasso wird empfohlen, verschiedene Lambda-Werte auszuprobieren, den Fehler im Validierungssatz zu messen und schließlich den Lambda-Wert auszuwählen, der den niedrigsten Fehler zurückgibt. Es ist mir kein Problem, wenn die Funktion f (Lambda) = Fehler konvex ist. Könnte es so sein? Dh …

3
Warum wird die Wahrscheinlichkeit im Kalman-Filter anhand von Filterergebnissen anstelle glatterer Ergebnisse berechnet?
Ich benutze den Kalman-Filter ganz normal. Das System wird durch die Zustandsgleichung und die Beobachtungsgleichung .xt + 1= F.xt+ vt + 1xt+1=F.xt+vt+1x_{t+1}=Fx_{t}+v_{t+1}yt= H.xt+ A zt+ wtyt=H.xt+EINzt+wty_{t}=Hx_{t}+Az_{t}+w_{t} Lehrbücher lehren, dass wir nach dem Anwenden des Kalman-Filters und dem Abrufen der "One-Step-Ahead-Prognosen" (oder "gefilterte Schätzung") diese verwenden sollten, um die Wahrscheinlichkeitsfunktion zu …

5
Warum wir die Nullhypothese auf der Ebene von 0,05 und nicht auf der Ebene von 0,5 ablehnen (wie wir es in der Klassifikation tun)
Das Testen von Hypothesen ähnelt einem Klassifizierungsproblem. Nehmen wir also an, wir haben zwei mögliche Bezeichnungen für eine Beobachtung (Subjekt) - Schuldig gegen Nichtschuldig. Sei Nichtschuld die Nullhypothese. Wenn wir das Problem unter dem Gesichtspunkt der Klassifizierung betrachten würden, würden wir einen Klassifizierer trainieren, der die Wahrscheinlichkeit vorhersagt, dass das …

5
Zeigen, dass der OLS-Schätzer skalierungsäquivariante ist?
Ich habe keine formale Definition der Skalenäquivarianz, aber hier ist die Einführung in das statistische Lernen dazu. 217: Die Standardkoeffizienten der kleinsten Quadrate ... sind skalierungsäquivariante : Das Multiplizieren von XjXjX_j mit einer Konstanten ccc führt einfach zu einer Skalierung der Koeffizientenschätzungen der kleinsten Quadrate um einen Faktor von 1/c1/c1/c …

5
Wie wird eine Sequenz mit einem Mittelwert von ?
Ich weiß, wie man eine Sequenz mit dem Mittelwert . Wenn ich in Matlab beispielsweise eine Sequenz mit einer Länge von generieren möchte , lautet dies:±1±1\pm 1000±1±1\pm 1100001000010000 2*(rand(1, 10000, 1)<=.5)-1 Wie kann man jedoch eine -Sequenz mit einem Mittelwert von erzeugen , dh wobei leicht bevorzugt wird?±1±1\pm 10.050.050.05111

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.