Ich habe die beliebtesten Bücher zum statistischen Lernen gelesen 1- Die Elemente des statistischen Lernens. 2- Eine Einführung in das statistische Lernen . Beide erwähnen, dass die Gratregression zwei äquivalente Formeln hat. Gibt es einen nachvollziehbaren mathematischen Beweis für dieses Ergebnis? Ich habe auch Cross Validated durchlaufen , kann dort …
Diese Frage bezieht sich auf Galit Shmuelis Aufsatz "To Explain or to Predict" . Im Einzelnen schreibt Professor Shmueli in Abschnitt 1.5, "Erklärung und Vorhersage sind unterschiedlich": Bei der erklärenden Modellierung liegt der Schwerpunkt auf der Minimierung der Verzerrung, um die genaueste Darstellung der zugrunde liegenden Theorie zu erhalten. Das …
Ich habe keine zufriedenstellende Antwort von Google gefunden . Wenn die Daten, die ich habe, in der Größenordnung von Millionen liegen, ist Deep Learning natürlich der richtige Weg. Und ich habe gelesen, dass es vielleicht besser ist, beim maschinellen Lernen andere Methoden zu verwenden, wenn ich keine großen Datenmengen habe. …
Frage: Was sind die Hauptunterschiede und -ähnlichkeiten zwischen der Verwendung von Standardfehlern nach Newey-West (1987) und nach Hansen-Hodrick (1980)? In welchen Situationen sollte eine dieser Situationen der anderen vorgezogen werden? Anmerkungen: Ich weiß, wie jedes dieser Anpassungsverfahren funktioniert. Ich habe jedoch noch kein Dokument gefunden, das sie vergleichen könnte, weder …
Ich versuche zu lernen, wie man neuronale Netze benutzt. Ich habe dieses Tutorial gelesen . Nach dem Anpassen eines neuronalen Netzes an eine Zeitreihe unter Verwendung des Wertes bei zur Vorhersage des Wertes bei t + 1 erhält der Autor das folgende Diagramm, wobei die blaue Linie die Zeitreihe ist, …
Fragen Kommt es darauf an, ob der Baum flach oder tief ist? Oder können wir das unabhängig von der Tiefe / Höhe des Baumes sagen? Warum ist die Vorspannung niedrig und die Varianz hoch? Erklären Sie dies bitte intuitiv und mathematisch
Bei der Durchführung einer ANOVA wird uns mitgeteilt, dass bestimmte Annahmen des Tests vorliegen müssen, damit er auf die Daten anwendbar ist. Ich habe nie verstanden, warum die folgenden Annahmen erforderlich waren, damit der Test funktioniert: Die Varianz Ihrer abhängigen Variablen (Residuen) sollte in jeder Zelle des Designs gleich sein …
Ich lerne etwas über Splines aus dem Buch "Die Elemente des statistischen Lernens, Data Mining, Inferenz und Vorhersage" von Hastie et al. Ich habe auf Seite 145 festgestellt, dass natürliche kubische Splines jenseits der Grenzknoten linear sind. Es gibt Knoten, in den Splines und das Folgende wird über einen solchen …
Der Erwartungswert einer Verteilung f(x)f(x)f(x) ist der Mittelwert, das heißt der gewichtete Mittelwert E[x]=∫+∞−∞xf(x)dxE[x]=∫−∞+∞xf(x)dxE[x]=\int_{-\infty}^{+\infty} x \, \, f(x) dx Der wahrscheinlichste Wert ist der Modus, dh der wahrscheinlichste Wert. Erwarten wir jedoch, dass wir E[x]E[x]E[x] oft sehen werden? Zitat von hier : Wenn die Ergebnisse nicht gleich wahrscheinlich sind, muss …
Ab wann werden mehrschichtige neuronale Netze als tiefe neuronale Netze klassifiziert oder anders ausgedrückt: Wie viele Schichten müssen mindestens in einem tiefen neuronalen Netz vorhanden sein?
In der linearen Regression (quadratischer Verlust) haben wir mithilfe der Matrix eine sehr präzise Notation für das Ziel minimize ∥Ax−b∥2minimize ‖Ax−b‖2\text{minimize}~~ \|Ax-b\|^2 Dabei ist AAA die Datenmatrix, xxx die Koeffizienten und bbb die Antwort. Gibt es eine ähnliche Matrixnotation für das logistische Regressionsziel? Alle die Bezeichnungen ich gesehen habe , …
Ich versuche, den grundsätzlichen Unterschied zwischen schrittweiser und rückwärtiger Regression in R mit der Sprungfunktion zu verstehen. Für die schrittweise Regression habe ich den folgenden Befehl verwendet step(lm(mpg~wt+drat+disp+qsec,data=mtcars),direction="both") Ich habe die folgende Ausgabe für den obigen Code. Für die Auswahl der Rückwärtsvariablen habe ich den folgenden Befehl verwendet step(lm(mpg~wt+drat+disp+qsec,data=mtcars),direction="backward") Und …
Eine Grundannahme bei der Verwendung von Regressionsmodellen zur Inferenz ist, dass "alle relevanten Prädiktoren" in die Prädiktionsgleichung einbezogen wurden. Der Grund dafür ist, dass die Nichteinbeziehung eines wichtigen Faktors aus der realen Welt zu verzerrten Koeffizienten und damit zu ungenauen Schlussfolgerungen führt (dh eine variable Verzerrung wird weggelassen). Aber in …
In Kapitel 9 des Buches Mustererkennung und maschinelles Lernen gibt es diesen Teil über das Gaußsche Mischungsmodell: Um ehrlich zu sein, verstehe ich nicht wirklich, warum dies eine Singularität schaffen würde. Kann mir das jemand erklären? Es tut mir leid, aber ich bin nur ein Student und ein Anfänger im …
Ich versuche, die Ergebnisse aus der sklearnlogistischen Regressionsbibliothek mit glmnetpackage in R zu duplizieren . Aus der Dokumentation der sklearnlogistischen Regression geht es darum, die Kostenfunktion unter l2 Penalty minw,c12wTw+C∑i=1Nlog(exp(−yi(XTiw+c))+1)minw,c12wTw+C∑i=1Nlog(exp(−yi(XiTw+c))+1)\min_{w,c} \frac12 w^Tw + C\sum_{i=1}^N \log(\exp(-y_i(X_i^Tw+c)) + 1) Ausgehend von den Vignetten von glmnetminimiert seine Implementierung eine geringfügig andere Kostenfunktion minβ,β0−[1N∑i=1Nyi(β0+xTiβ)−log(1+e(β0+xTiβ))]+λ[(α−1)||β||22/2+α||β||1]minβ,β0−[1N∑i=1Nyi(β0+xiTβ)−log(1+e(β0+xiTβ))]+λ[(α−1)||β||22/2+α||β||1]\min_{\beta, …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.