Weiß jemand, in welchem Jahr MCMC alltäglich wurde (dh eine beliebte Methode für Bayes'sche Inferenz)? Ein Link zur Anzahl der im Laufe der Zeit veröffentlichten MCMC (Journal) -Artikel wäre besonders hilfreich.
Um das Konfidenzintervall (CI) für den Mittelwert mit unbekannter Populationsstandardabweichung (SD) zu berechnen, schätzen wir die Populationsstandardabweichung unter Verwendung der t-Verteilung. Bemerkenswerterweise ist CI=X¯±Z95%σX¯CI=X¯±Z95%σX¯CI=\bar{X} \pm Z_{95\% }\sigma_{\bar X} wobei σX¯=σn√σX¯=σn\sigma_{\bar X} = \frac{\sigma}{\sqrt n} . Da wir jedoch keine Punktschätzung der Standardabweichung der Grundgesamtheit haben, schätzen wir durch die NäherungCI=X¯±t95%(se)CI=X¯±t95%(se)CI=\bar{X} …
Viele Online-Tutorials befassen sich mit dem Gradientenabstieg und fast alle verwenden eine feste Schrittgröße (Lernrate ). Warum wird die Zeilensuche nicht verwendet (z. B. Backtracking-Zeilensuche oder exakte Zeilensuche)?αα\alpha
Ich möchte ganze Zahlen von 1 bis zu einem bestimmten zeichnen, indem ich eine Reihe von fairen sechsseitigen Würfeln würfle (d6). Eine gute Antwort erklärt, warum seine Methode einheitliche und unabhängige ganze Zahlen erzeugt.NNN Als anschauliches Beispiel wäre es hilfreich zu erläutern, wie eine Lösung für den Fall von funktioniert …
Aus vielen Diskussionen habe ich ähnliche Schlussfolgerungen gezogen, dass die Konvergenz von SGD mit zunehmender Minibatch-Größe tatsächlich schwieriger / schlechter wird, zum Beispiel in diesem Artikel und in dieser Antwort . Ich habe auch von Leuten gehört, die im frühen Stadium Tricks wie kleine Lernraten oder Losgrößen einsetzten, um diese …
Warum wird Newtons Methode zur Optimierung der logistischen Regression als iterative, neu gewichtete Fehlerquadrate bezeichnet? Es scheint mir nicht klar zu sein, weil logistischer Verlust und Verlust der kleinsten Quadrate völlig verschiedene Dinge sind.
Ich lese das buch: Bischof, Mustererkennung und maschinelles Lernen (2006) was die Exponentialfamilie als Verteilungen der Form definiert (Gl. 2.194): p(x|η)=h(x)g(η)exp{ηTu(x)}p(x|η)=h(x)g(η)exp{ηTu(x)}p(\mathbf x|\boldsymbol \eta) = h(\mathbf x) g(\boldsymbol \eta) \exp \{\boldsymbol \eta^\mathrm T \mathbf u(\mathbf x)\} Aber ich sehe keine Einschränkungen für oder . Bedeutet das nicht, dass jede Verteilung in …
Wir definieren eine Epoche, in der alle verfügbaren Trainingsmuster durchlaufen wurden, und die Mini-Batch-Größe als die Anzahl der Muster, über die wir den Durchschnitt bilden, um die Aktualisierungen der Gewichte / Vorspannungen zu finden, die zum Abstieg des Gradienten erforderlich sind. Meine Frage ist, ob wir aus den Trainingsbeispielen ersatzlos …
Während des Studiums von Reinforcement Learning bin ich auf viele Formen der Belohnungsfunktion gestoßen: , und sogar eine Belohnungsfunktion, die nur vom aktuellen Status abhängt. Allerdings wurde mir klar, dass es nicht sehr einfach ist, eine Belohnungsfunktion zu erstellen oder zu definieren.R ( s , a , s ' )R …
Es gibt umfangreiche aktuelle Forschungen zur Bayesianischen Optimierung (1) zur Optimierung von ML-Hyperparametern. Die treibende Motivation dabei ist, dass eine minimale Anzahl von Datenpunkten erforderlich ist, um fundierte Entscheidungen darüber zu treffen, welche Punkte es wert sind, ausprobiert zu werden (objektive Funktionsaufrufe sind teuer, weniger zu machen ist also besser), …
Ich verwende ein Logit-Modell. Meine abhängige Variable ist binär. Ich habe jedoch eine unabhängige Variable , die kategorischen und enthält die Antworten: 1.very good, 2.good, 3.average, 4.poor and 5.very poor. Es ist also ordinal ("quantitativ kategorisch"). Ich bin mir nicht sicher, wie ich damit im Modell umgehen soll. Ich benutze …
Einige Funktionen meiner Daten haben große Werte, während andere Funktionen viel kleinere Werte haben. Müssen die Daten vor dem Anwenden von t-SNE zentriert und skaliert werden, um eine Verzerrung in Richtung der größeren Werte zu vermeiden? Ich verwende die sklearn.manifold.TSNE-Implementierung von Python mit der standardmäßigen euklidischen Distanzmetrik.
Ich lerne nur etwas über Optimierung und habe Probleme, den Unterschied zwischen konvexer und nichtkonvexer Optimierung zu verstehen. Nach meinem Verständnis ist eine konvexe Funktion eine, bei der "das Liniensegment zwischen zwei beliebigen Punkten im Diagramm der Funktion über oder im Diagramm liegt". In diesem Fall könnte ein Algorithmus für …
Einige Autoren (z. B. Pallant, 2007, S. 225; siehe Bild unten) schlagen vor, die Effektgröße für einen von Wilcoxon signierten Rangtest zu berechnen, indem die Teststatistik durch die Quadratwurzel der Anzahl der Beobachtungen dividiert wird: r = Znx+ ny√r=Znx+nyr = \frac{Z}{\sqrt{n_x + n_y}} ZGibt die Teststatistik sowohl von SPSS (siehe …
Hintergrund: Hinweis: Mein Datensatz und R-Code sind unter dem Text enthalten Ich möchte AIC verwenden, um zwei Modelle mit gemischten Effekten zu vergleichen, die mit dem lme4-Paket in R erstellt wurden. Jedes Modell hat einen festen und einen zufälligen Effekt. Der festgelegte Effekt unterscheidet sich zwischen den Modellen, der Zufallseffekt …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.