Ich habe an einigen Stellen die Verwendung der Radon-Nikodym-Ableitung eines Wahrscheinlichkeitsmaßes in Bezug auf ein anderes gesehen, insbesondere in der Kullback-Leibler-Divergenz, wo es die Ableitung des Wahrscheinlichkeitsmaßes eines Modells für einen beliebigen Parameter mit ist bezüglich des realen Parameters θ 0 :θθ\thetaθ0θ0\theta_0 dPθdPθ0dPθdPθ0\frac {dP_\theta}{dP_{\theta_0}} Wobei dies beide Wahrscheinlichkeitsmaße für den …
Ich habe mir dieses Notizbuch angesehen und bin verwirrt über diese Aussage: Wenn wir über Normalität sprechen, meinen wir, dass die Daten wie eine Normalverteilung aussehen sollten. Dies ist wichtig, da sich mehrere statistische Tests darauf stützen (z. B. t-Statistik). Ich verstehe nicht, warum eine T-Statistik die Daten benötigt, um …
In den univariaten Regressionseinstellungen versuchen wir zu modellieren y=Xβ+noisey=Xβ+noisey = X\beta +noise wobei ein Vektor von n Beobachtungen und X ∈ R n × m die Entwurfsmatrix mit m Prädiktoren ist. Die Lösung ist β 0 = ( X T X ) - 1 X y .y∈Rny∈Rny \in \mathbb{R}^nnnnX.∈ R.n …
Ich führe Experimente mit dem EMNIST-Validierungssatz unter Verwendung von Netzwerken mit RMSProp, Adam und SGD durch. Ich erreiche eine Genauigkeit von 87% mit SGD (Lernrate von 0,1) und Dropout (0,1 Dropout Prob) sowie L2-Regularisierung (1e-05-Strafe). Wenn ich die gleiche exakte Konfiguration mit RMSProp und Adam sowie die anfängliche Lernrate von …
Titel sagt alles. Ich verstehe, dass die kleinsten Quadrate und die maximale Wahrscheinlichkeit das gleiche Ergebnis für Regressionskoeffizienten liefern, wenn die Fehler des Modells normal verteilt sind. Aber was passiert, wenn die Fehler nicht normal verteilt sind? Warum sind die beiden Methoden nicht mehr gleichwertig?
Ich habe zwei Regressionen des gleichen Y und des dreistufigen X. Insgesamt n = 15, mit n = 5 in jeder Gruppe oder Stufe von X. Die erste Regression behandelt das X als kategorisch und weist den Stufen 2 und 3 mit Stufe Indikatorvariablen zu eine davon ist die Referenz. …
Ich habe ANOVA bisher auf zwei Arten gesehen: Zunächst wurde in meinem einführenden Statistiktext ANOVA eingeführt, um Mittelwerte von drei oder mehr Gruppen zu vergleichen, als Verbesserung gegenüber dem paarweisen Vergleich, um festzustellen, ob eines der Mittelwerte einen statistisch signifikanten Unterschied aufweist. Zweitens habe ich in meinem statistischen Lerntext gesehen, …
Ich möchte mein Verständnis der neuronalen Netze und ihrer Vorteile im Vergleich zu anderen Algorithmen für maschinelles Lernen verbessern. Mein Verständnis ist wie folgt und meine Frage ist: Können Sie bitte mein Verständnis korrigieren und ergänzen? :) :) Mein Verständnis: (1) Künstliche neuronale Netze = Eine Funktion, die Ausgabewerte aus …
Folgendes habe ich in Ian Goodfellows Buch Deep Learning gelesen . Im Zusammenhang mit neuronalen Netzen "wird die L2-Parameternormstrafe allgemein als Gewichtsabfall bezeichnet. Diese Regularisierungsstrategie bringt die Gewichte näher an den Ursprung [...]. Allgemeiner könnten wir die Parameter so regulieren, dass sie nahe an einem bestimmten Punkt liegen im Raum …
Wenn ich zwei unabhängige Zufallsvariablen X und Y habe, wie ist die Korrelation zwischen X und dem Produkt XY? Wenn dies nicht bekannt ist, wäre ich daran interessiert, zumindest zu wissen, was im speziellen Fall passiert, wenn X und Y mit dem Mittelwert Null normal sind, wenn dies einfacher zu …
Bei der Auswahl des Regularisierungsparameters Lambda in Ridge oder Lasso wird empfohlen, verschiedene Lambda-Werte auszuprobieren, den Fehler im Validierungssatz zu messen und schließlich den Lambda-Wert auszuwählen, der den niedrigsten Fehler zurückgibt. Es ist mir kein Problem, wenn die Funktion f (Lambda) = Fehler konvex ist. Könnte es so sein? Dh …
Ich benutze den Kalman-Filter ganz normal. Das System wird durch die Zustandsgleichung und die Beobachtungsgleichung .xt + 1= F.xt+ vt + 1xt+1=F.xt+vt+1x_{t+1}=Fx_{t}+v_{t+1}yt= H.xt+ A zt+ wtyt=H.xt+EINzt+wty_{t}=Hx_{t}+Az_{t}+w_{t} Lehrbücher lehren, dass wir nach dem Anwenden des Kalman-Filters und dem Abrufen der "One-Step-Ahead-Prognosen" (oder "gefilterte Schätzung") diese verwenden sollten, um die Wahrscheinlichkeitsfunktion zu …
Das Testen von Hypothesen ähnelt einem Klassifizierungsproblem. Nehmen wir also an, wir haben zwei mögliche Bezeichnungen für eine Beobachtung (Subjekt) - Schuldig gegen Nichtschuldig. Sei Nichtschuld die Nullhypothese. Wenn wir das Problem unter dem Gesichtspunkt der Klassifizierung betrachten würden, würden wir einen Klassifizierer trainieren, der die Wahrscheinlichkeit vorhersagt, dass das …
Ich habe keine formale Definition der Skalenäquivarianz, aber hier ist die Einführung in das statistische Lernen dazu. 217: Die Standardkoeffizienten der kleinsten Quadrate ... sind skalierungsäquivariante : Das Multiplizieren von XjXjX_j mit einer Konstanten ccc führt einfach zu einer Skalierung der Koeffizientenschätzungen der kleinsten Quadrate um einen Faktor von 1/c1/c1/c …
Ich weiß, wie man eine Sequenz mit dem Mittelwert . Wenn ich in Matlab beispielsweise eine Sequenz mit einer Länge von generieren möchte , lautet dies:±1±1\pm 1000±1±1\pm 1100001000010000 2*(rand(1, 10000, 1)<=.5)-1 Wie kann man jedoch eine -Sequenz mit einem Mittelwert von erzeugen , dh wobei leicht bevorzugt wird?±1±1\pm 10.050.050.05111
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.