Ich bin ein Software-Ingenieur, der am maschinellen Lernen arbeitet. Nach meinem Verständnis bilden lineare Regression (wie OLS) und lineare Klassifikation (wie logistische Regression und SVM) eine Vorhersage auf der Grundlage eines inneren Produkts zwischen trainierten Koeffizienten und Merkmalsvariablen :w⃗ w→\vec{w}x⃗ x→\vec{x} y^=f(w⃗ ⋅x⃗ )=f(∑iwixi)y^=f(w→⋅x→)=f(∑iwixi) \hat{y} = f(\vec{w} \cdot \vec{x}) = …
Als ich Mini Batch Gradient Decent implementiert habe, habe ich nur die Gradienten aller Beispiele im Trainingsbatch gemittelt. Allerdings ist mir aufgefallen, dass jetzt die optimale Lernrate deutlich höher ist als bei anständigen Online-Gefällen. Meiner Intuition nach ist dies so, weil der gemittelte Gradient weniger verrauscht ist und somit schneller …
Ich habe immer wieder gelesen, dass die Kreuzvalidierung "Auslassen" aufgrund der großen Überlappung der Trainingsfalten eine hohe Varianz aufweist. Ich verstehe jedoch nicht, warum das so ist: Sollte die Leistung der Kreuzvalidierung nicht sehr stabil sein (geringe Varianz), gerade weil die Trainingssätze fast identisch sind? Oder habe ich ein falsches …
Nach meinem Verständnis ist die Entfernungskorrelation eine robuste und universelle Methode, um zu überprüfen, ob es eine Beziehung zwischen zwei numerischen Variablen gibt. Wenn wir zum Beispiel eine Reihe von Zahlenpaaren haben: (x1, y1) (x2, y2) ... (xn, yn) Wir können die Entfernungskorrelation verwenden, um zu überprüfen, ob eine (nicht …
Ich versuche Markov-Ketten mit SAS zu verstehen. Ich verstehe, dass ein Markov-Prozess ein Prozess ist, bei dem der zukünftige Zustand nur vom aktuellen und nicht vom vergangenen Zustand abhängt und es eine Übergangsmatrix gibt, die die Übergangswahrscheinlichkeit von einem Zustand in einen anderen erfasst. Aber dann bin ich auf diesen …
Eine Tweedie-Verteilung kann verzerrte Daten mit einer Punktmasse von Null modellieren, wenn der Parameter (Exponent in der Mittelwert-Varianz-Beziehung) zwischen 1 und 2 liegt.ppp In ähnlicher Weise kann ein Modell mit Null-Inflation (unabhängig davon, ob es sich um ein kontinuierliches oder ein diskretes Modell handelt) eine große Anzahl von Nullen aufweisen. …
Ich passe zurzeit zufällige Gesamtstrukturen für ein Klassifizierungsproblem mit dem randomForestPaket in R an und bin nicht sicher, wie Trainingsfehler für diese Modelle gemeldet werden sollen. Mein Trainingsfehler liegt nahe bei 0%, wenn ich ihn mit Vorhersagen berechne, die ich mit dem Befehl erhalte: predict(model, data=X_train) Wo X_trainsind die Trainingsdaten? …
Hinweis: Falls es sich um ein Duplikat handelt, bitte im Voraus um Entschuldigung. Ich habe bei meiner Suche kein ähnliches q gefunden Angenommen, wir haben einen wahren Parameter p. Ein Konfidenzintervall C (X) ist ein RV, das p enthält, beispielsweise 95% der Zeit. Nehmen wir nun an, wir beobachten X …
Gibt es eine Möglichkeit, festzustellen, ob ein Unterschied zwischen der Anzahl der Verkehrsunfälle zum Zeitpunkt 1 erheblich von der Anzahl zum Zeitpunkt 2 abweicht? Ich habe verschiedene Methoden gefunden, um den Unterschied zwischen Beobachtungsgruppen zu verschiedenen Zeiten zu bestimmen (z. B. Vergleich der Poisson-Mittelwerte), aber nicht, um nur zwei Zählungen …
In der Wahrscheinlichkeitstheorie wird eine nichtnegative Zufallsvariable als Gitter bezeichnet, wenn es d ≥ 0 gibt, so dass ∑ ∞ n = 0 P ( X = n d ) = 1 ist .XXXd≥0d≥0d \geq 0∑∞n=0P(X=nd)=1∑n=0∞P(X=nd)=1\sum_{n=0}^{\infty}P(X=nd) = 1 Gibt es eine geometrische Interpretation, warum diese Definition als Gitter bezeichnet wird?
Ich habe eine spezielle Frage zur Validierung in der maschinellen Lernforschung. Wie wir wissen, fordert das Regime des maschinellen Lernens die Forscher auf, ihre Modelle anhand der Trainingsdaten zu trainieren, anhand des Validierungssatzes aus den Kandidatenmodellen auszuwählen und die Genauigkeit des Testsatzes zu melden. In einer sehr strengen Studie kann …
Ich habe viel über gewundene neuronale Netze gelesen und mich gefragt, wie sie das Problem des verschwindenden Gradienten vermeiden. Ich weiß, dass Deep-Believe-Netzwerke Single-Level-Auto-Encoder oder andere vorgefertigte flache Netzwerke stapeln und so dieses Problem vermeiden können, aber ich weiß nicht, wie es in CNNs vermieden wird. Laut Wikipedia : "Trotz …
Ich habe einen Datensatz mit 11 Variablen und PCA (orthogonal) wurde gemacht, um die Daten zu reduzieren. Die Wahl der Anzahl der Komponenten, die beibehalten werden sollen, ergab sich für mich aus meinem Fachwissen und dem Geröllplot (siehe unten), dass zwei Hauptkomponenten (PCs) ausreichten, um die Daten zu erläutern, und …
Ich habe einen 5-fachen Lebenslauf durchgeführt, um das optimale K für KNN auszuwählen. Und es scheint, je größer K wird, desto kleiner wird der Fehler ... Es tut mir leid, dass ich keine Legende hatte, aber die verschiedenen Farben repräsentieren verschiedene Versuche. Insgesamt gibt es 5, und es scheint, als …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.