Warum ist die KL-Divergenz nicht negativ? Aus informationstheoretischer Sicht verstehe ich das so intuitiv: Angenommen, es gibt zwei Ensembles AAA und BBB die aus der gleichen Menge von Elementen bestehen, die mit xxx . p(x)p(x)p(x) und q(x)q(x)q(x) sind verschiedene Wahrscheinlichkeitsverteilungen über ensemble und jeweils.AAABBB Aus informationstheoretischer Sicht ist log2(P(x))log2(P(x))\log_{2}(P(x)) die …
Ich versuche zu verstehen, wie ich die Feature-Wichtigkeit einer kategorialen Variablen ermitteln kann, die in Dummy-Variablen zerlegt wurde. Ich benutze scikit-learn, das kategoriale Variablen für Sie nicht so behandelt, wie es R oder H2O tun. Wenn ich eine kategoriale Variable in Dummy-Variablen zerlege, erhalte ich separate Feature-Wichtigkeiten pro Klasse in …
Ich versuche die Ausgabe der Kolmogorov-Smirnov-Testfunktion zu verstehen (zwei Beispiele, zweiseitig). Hier ist ein einfacher Test. x <- c(1,2,2,3,3,3,3,4,5,6) y <- c(2,3,4,5,5,6,6,6,6,7) z <- c(12,13,14,15,15,16,16,16,16,17) ks.test(x,y) # Two-sample Kolmogorov-Smirnov test # #data: x and y #D = 0.5, p-value = 0.1641 #alternative hypothesis: two-sided # #Warning message: #In ks.test(x, y) …
Die Frage Ich habe Probleme zu verstehen, wie die Vorhersage im Intervall [0,1][0,1][0,1] wenn ich eine binäre Klassifizierung mit Gradient Boosting durchführe. Angenommen, wir arbeiten an einem binären Klassifizierungsproblem und unsere Zielfunktion ist der logarithmische Verlust , wobei ist die Zielvariable und ist unser aktuelles Modell.−∑yilog(Hm(xi))+(1−yi)log(1−Hm(xi))−∑yilog(Hm(xi))+(1−yi)log(1−Hm(xi))-\sum y_i \log(H_m(x_i)) + (1-y_i) …
Geschlossen. Diese Frage ist nicht zum Thema . Derzeit werden keine Antworten akzeptiert. Möchten Sie diese Frage verbessern? Aktualisieren Sie die Frage so, dass sie zum Thema passt für Kreuz Validated. Geschlossen vor 2 Jahren . Bisher habe ich kollineare Variablen als Teil des Datenvorbereitungsprozesses entfernt, indem ich Korrelationstabellen betrachtet …
Ich möchte einen Algorithmus in einem Artikel implementieren, der Kernel-SVD zum Zerlegen einer Datenmatrix verwendet. Ich habe also Materialien über Kernelmethoden und Kernel-PCA usw. gelesen. Aber es ist für mich immer noch sehr dunkel, besonders wenn es um mathematische Details geht, und ich habe ein paar Fragen. Warum Kernelmethoden? Oder …
Angenommen, ich habe eine Variable Xmit unbekannter Verteilung. In Mathematica SmoothKernelDensitykönnen wir mithilfe der Funktion eine geschätzte Dichtefunktion haben. Diese geschätzte Dichtefunktion kann zusammen mit der PDFFunktion verwendet werden, um die Wahrscheinlichkeitsdichtefunktion eines Werts zu berechnen, etwa Xin der Form der PDF[density,X]Annahme, dass "Dichte" das Ergebnis von ist SmoothKernelDensity. Es …
Random Forests (RFs) ist eine wettbewerbsfähige Datenmodellierungs- / Miningmethode. Ein RF-Modell hat eine Ausgabe - die Ausgabe- / Vorhersagevariable. Der naive Ansatz zur Modellierung mehrerer Ausgänge mit RFs besteht darin, für jede Ausgangsvariable einen RF zu erstellen. Wir haben also N unabhängige Modelle, und wenn es eine Korrelation zwischen Ausgabevariablen …
Kennt jemand einen guten Übersichtsartikel für die statistische Literatur zur nichtlinearen Regression? Ich interessiere mich hauptsächlich für Konsistenzergebnisse und Asymptotika. Von besonderem Interesse ist das Modell yich t= m ( xich t, θ ) + ϵich t,yicht=m(xicht,θ)+ϵicht,y_{it} = m(x_{it},\theta) + \epsilon_{it}, für Paneldaten. Weniger interessant sind nicht parametrische Methoden. Vorschläge …
Können wir Bilder mit variabler Größe als Eingabe für die Objekterkennung in ein Faltungsnetzwerk geben? Wenn möglich, wie können wir das tun? Wenn wir jedoch versuchen, das Bild zuzuschneiden, verlieren wir einen Teil des Bildes, und wenn wir versuchen, die Größe zu ändern, geht die Klarheit des Bildes verloren. Bedeutet …
Es scheint, als ob die Definition des überwachten Lernens eine Teilmenge des verstärkenden Lernens ist, mit einer bestimmten Art von Belohnungsfunktion, die auf beschrifteten Daten basiert (im Gegensatz zu anderen Informationen in der Umgebung). Ist das eine genaue Darstellung?
Ich bin auf einige Statistiker gestoßen, die niemals andere Modelle als die lineare Regression zur Vorhersage verwenden, weil sie der Meinung sind, dass "ML-Modelle" wie zufällige Gesamtstruktur- oder Gradientenerhöhungen schwer zu erklären oder "nicht interpretierbar" sind. In einer linearen Regression bieten die t-Tests eine Möglichkeit, die Signifikanz von Variablen zu …
Was ist die mathematische Definition eines Kausalzusammenhangs zwischen zwei Zufallsvariablen? Wann würde man bei einer Stichprobe aus der gemeinsamen Verteilung zweier Zufallsvariablen und sagen, dass verursacht ?XXXYYYXXXYYY Zum Kontext lese ich dieses Papier über die kausale Entdeckung .
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.