Die Bayesianische Datenanalyse (S. 64) sagt zu einem normalen Modell : Eine vernünftige vage vorherige Dichte für und unter der Annahme einer vorherigen Unabhängigkeit von Orts- und Skalenparametern ist einheitlich für oder äquivalent fürμμ\muσσ\sigma( μ , logσ)(μ,Logσ)(\mu, \log \sigma)p ( μ , σ2) ∝ ( σ2)- 1.p(μ,σ2)∝(σ2)- -1. p(\mu, \sigma^2) …
Ein Variations-Autoencoder (VAE) bietet eine Möglichkeit, die Wahrscheinlichkeitsverteilung lernen die einen Eingang mit seiner latenten Darstellung Beziehung setzt . Insbesondere ordnet der Codierer einen Eingang einer Verteilung auf . Ein typischer Encoder gibt Parameter , die die Gaußsche Verteilung . Diese Verteilung wird als Näherung für .p ( x , …
Ich lese praktisches maschinelles Lernen mit Scikit-Learn und TensorFlow: Konzepte, Tools und Techniken zum Aufbau intelligenter Systeme . Dann bin ich nicht in der Lage, den Unterschied zwischen hartem und weichem Voting im Zusammenhang mit ensemblebasierten Methoden herauszufinden. Ich zitiere Beschreibungen von ihnen aus dem Buch. Die ersten beiden Bilder …
Frage : Ich habe ein Wahrscheinlichkeitsmodell (Bayes'sches Netzwerk) zur Modellierung einer binären Ergebnisvariablen angepasst. Ich möchte ein hochauflösendes Kalibrierungsdiagramm (z. B. Spline) erstellen, das wegen Überanpassung mit Bootstrapping korrigiert wurde. Gibt es ein Standardverfahren zur Berechnung einer solchen Kurve? Überlegungen : Ich könnte dies leicht mit Zug- / Testaufteilung tun, …
Ich lese Deep Learning von Ian Goodfellow et al. Es führt Bias als B i a s ( θ ) = E.( θ^) - θB.icheins(θ)=E.(θ^)- -θBias(\theta)=E(\hat\theta)-\theta wo und werden die geschätzten Parameter und der zugrunde liegende reelle Parameter, respectively.θ^θ^\hat\thetaθθ\theta Konsistenz, auf der anderen Seite, ist definiert durch was bedeutet , …
Ich arbeite derzeit an einer Bedarfsprognose mit Daten zu Zehntausenden von Produkten in ein paar Tausend Filialen. Insbesondere habe ich in jedem Geschäft tägliche Verkaufsdaten für ein paar Jahre pro Produkt. Mein Ziel ist es, die zukünftigen Verkäufe jedes Artikels in jedem Geschäft einen Tag im Voraus vorherzusagen. dann zwei …
Es gibt eine Reihe von Websites, die den Gradientenabstieg beschreiben, um die Parameter für die einfache lineare Regression zu finden ( hier ist einer davon). Google beschreibt es auch in ihrem neuen (für die Öffentlichkeit) ML-Kurs. Jedoch auf Wikipedia , die folgenden Formeln , die Parameter zur Berechnung α^β^=y¯−β^x¯,=∑ni=1(xi−x¯)(yi−y¯)∑ni=1(xi−x¯)2α^=y¯−β^x¯,β^=∑i=1n(xi−x¯)(yi−y¯)∑i=1n(xi−x¯)2 {\displaystyle …
Definiere "Münze hat die Wahrscheinlichkeit 1, Köpfe zu landen" Angenommen, man hat den vorherigen Glauben: . Nach dem Werfen der Münze, sobald sie Schwänze landet ( "Münze gelandet Schwänze"). Wie sollte ein Bayesianer seine Überzeugungen aktualisieren, um kohärent zu bleiben? ist undefiniert, da . Es scheint mir jedoch, dass er, …
Der Titel sagt schon alles - wie viele trainierbare Parameter gibt es in einer GRU-Schicht? Diese Art von Frage taucht häufig auf, wenn versucht wird, Modelle verschiedener RNN-Schichttypen, wie z. B. LSTM-Einheiten (Long Short Term Memory), mit GRU hinsichtlich der Leistung pro Parameter zu vergleichen. Da eine größere Anzahl trainierbarer …
Ich lese Thinking, Fast and Slow von Daniel Kahneman und bin auf den folgenden Text gestoßen Vor einigen Jahren hatte ich die ungewöhnliche Gelegenheit, die Illusion finanzieller Fähigkeiten aus nächster Nähe zu untersuchen. Ich war eingeladen worden, mit einer Gruppe von Anlageberatern in einer Firma zu sprechen, die sehr wohlhabenden …
Welche Situationen kennen wir, in denen gezeigt werden kann, dass der Gradientenabstieg für nicht konvexe Funktionen konvergiert (entweder zu einem kritischen Punkt oder zu einem lokalen / globalen Minimum)? Für SGD zu nicht konvexen Funktionen wurde hier eine Art von Beweis überprüft: http://www.cs.cornell.edu/courses/cs6787/2017fa/Lecture7.pdf
Sei . Wir wissen, dass und . Bedeutet dies , dass die Probe Mittelwert und die Probenvarianz sind abhängig voneinander? Oder bedeutet es nur, dass die Populationsvarianz als Funktion des Populationsmittelwerts geschrieben werden kann ?E [ X ] = n p V a r [ X ] = n p …
Ich weiß, dass die Stichprobengröße die Leistung bei jeder statistischen Methode beeinflusst. Es gibt Faustregeln für die Anzahl der Stichproben, die eine Regression für jeden Prädiktor benötigt. Ich höre auch oft, dass die Anzahl der Stichproben in jeder Kategorie in der abhängigen Variablen einer logistischen Regression wichtig ist. Warum ist …
Ich habe ein einfaches Regressionsmodell ( y = param1 * x1 + param2 * x2 ). Wenn ich das Modell an meine Daten anpasse, finde ich zwei gute Lösungen: Lösung A, params = (2,7), ist am besten für den Trainingssatz mit RMSE = 2,5 geeignet ABER! Lösung B params = …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.