Zum ersten Mal (entschuldigen Sie Ungenauigkeit / Fehler) habe ich mir Gaußsche Prozesse angesehen und mir dieses Video von Nando de Freitas genauer angesehen . Die Notizen sind hier online verfügbar . Irgendwann zieht er 101010 Zufallsstichproben aus einer multivariaten Normalen, die durch Konstruktion einer Kovarianzmatrix basierend auf einem Gaußschen …
Sei die Ordnungsstatistik einer iid-Stichprobe der Größe n aus \ exp (\ lambda) . Angenommen, die Daten werden zensiert, sodass nur die obersten (1-p) \ mal 100% Prozent der Daten angezeigt werden, dh X _ {(\ lfloor pn \ rfloor)}, X _ {(\ lfloor pn \ rfloor + 1)} , …
Lassen Sie mich zunächst einige Hintergrundinformationen geben. Ich werde meine Fragen am Ende zusammenfassen. Die Beta-Verteilung, parametrisiert durch ihren Mittelwert und ϕ , hat Var ( Y ) = V ( μ ) / ( ϕ + 1 ) , wobei V ( μ ) = μ ( 1 - …
Ich habe nicht wirklich gesehen, dass Wahrscheinlichkeitsbücher die bedingte Erwartung berechnen, außer für σσ\sigma Algebren, die durch eine diskrete Zufallsvariable erzeugt werden. Sie geben einfach die Existenz der bedingten Erwartung zusammen mit ihren Eigenschaften an und belassen sie dabei. Ich finde das etwas ärgerlich und versuche, eine Methode zu finden, …
In SGD wäre eine Epoche die vollständige Darstellung der Trainingsdaten, und dann würde es N Gewichtsaktualisierungen pro Epoche geben (wenn der Trainingssatz N Datenbeispiele enthält). Wenn wir jetzt stattdessen Mini-Batches durchführen, beispielsweise in Batches von 20. Besteht eine Epoche jetzt aus N / 20 Gewichtsaktualisierungen oder wird eine Epoche um …
Es scheint, als könnte ich die Parameter gut lernen und die hinteren Wahrscheinlichkeiten für die Trainingsdaten finden, aber ich habe keine Ahnung, wie ich neue Vorhersagen für neue Daten treffen kann. Das Problem liegt insbesondere in den Übergangswahrscheinlichkeiten, die sich bei Kovariaten ändern. Daher ist es nicht trivial, Code zu …
Ich habe mich immer der Volksweisheit angeschlossen, dass das Verringern der Lernrate in einem GBM (Gradient Boosted Tree Model) die Out-of-Sample-Leistung des Modells nicht beeinträchtigt. Heute bin ich mir nicht so sicher. Ich passe Modelle (Minimierung der Summe der quadratischen Fehler) an den Boston-Gehäusedatensatz an . Hier ist eine Darstellung …
Ein Rezensent von mir fragt nach einem Grund, warum ich ungewichtete Daten anstelle von gewichteten Daten verwendet habe. Ich habe das Problem mit einem Statistiker besprochen, und seine Antwort war in etwa so Wenn Sie unabhängige Beobachtungen haben und den Gesamtmittelwert nehmen, ist seine Varianz immer kleiner als die Varianz …
Ich versuche, HMC mit einer nicht diagonalen Massenmatrix zu implementieren, aber ich werde von einigen Begriffen gestolpert. Laut BDA3 und Neals Bericht ist der kinetische Energiebegriff (der meiner Meinung nach aus Bequemlichkeitsgründen immer verwendet wird) K.( p ) = pT.M.- 1p2.K(p)=pTM−1p2. K(p) = \frac{p^T M^{-1} p}{2} \,. Dies ist auch …
Mein wiederkehrendes neuronales Netzwerk (LSTM bzw. GRU) verhält sich auf eine Weise, die ich nicht erklären kann. Das Training beginnt und es trainiert gut (die Ergebnisse sehen ziemlich gut aus), wenn die Genauigkeit plötzlich abnimmt (und der Verlust schnell zunimmt) - sowohl Trainings- als auch Testmetriken. Manchmal wird das Netz …
Ich habe mich gefragt, ob hier jemand den Unterschied zwischen dem Normalisierungsmodus l1, l2 und max im Modul sklearn.preprocessing.normalize () erklären kann. Nachdem ich die Dokumentation gelesen hatte, konnte ich den Unterschied nicht erkennen!
Ich zitiere (Hervorhebung meiner) aus der Wikipedia-Definition : Der Satz in der Wahrscheinlichkeitstheorie, bekannt als das Gesetz der Gesamterwartung, ... besagt, dass wenn X eine integrierbare Zufallsvariable ist (dh eine Zufallsvariable, die E (| X |) <∞ erfüllt) und Y eine beliebige Zufallsvariable ist, nicht notwendigerweise integrierbar, auf demselben Wahrscheinlichkeitsraum …
Geschlossen. Diese Frage ist nicht zum Thema . Derzeit werden keine Antworten akzeptiert. Möchten Sie diese Frage verbessern? Aktualisieren Sie die Frage so dass es beim Thema für Kreuz Validated. Geschlossen vor 12 Monaten . Ich versuche, ein verallgemeinertes lineares Modell für die weibliche Familie anzupassen, aber wenn ich es …
Wenn Paare zufällig an einem runden Tisch sitzen, wie groß ist dann die Chance, dass niemand ihrem Partner gegenüber sitzt? Wenn es vier Personen gibt, lautet die Antwort 2/3. Wenn es sechs sind, ist es 8/15, denke ich. Danach wird meine Schritt-für-Schritt-Methode, bei der alle Möglichkeiten ausgefüllt werden und eine …
Ich wollte ein Netzwerk mit Nichtlinearitäten trainieren, die unter dem Verschwinden leiden (oder dem explodierenden Gradientenproblem, obwohl es hauptsächlich verschwindet). Ich weiß, dass die (derzeitige) Standardmethode darin besteht, die Chargennormalisierung 1 [BN] 1 zu verwenden oder einfach die Nichtlinearität aufzugeben und ReLu- Gleichrichter- / ReLu- Einheiten zu verwenden. Ich wollte …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.