Ich beschäftige mich mit Datentypen und brauche Hilfe: Wenn Sie sich das Bild oben ansehen (von hier aus aufgenommen ), hat es folgende Datentypen: Quantitativ (diskret, kontinuierlich) Qualitativ (Nominal (N), Ordinal (O), Binär (B)). Aber wenn Sie sich dieses nächste Bild (von hier ) ansehen , sind die Kategorien: Quantitativ …
Ich verstehe den Beweis, dass aber ich verstehe nicht, wie man die Verallgemeinerung auf beliebige lineare Kombinationen beweist.V.a r ( a X.+ b Y.) = a2V.a r ( X.) + b2V.a r ( Y.) + 2 a b C.o v ( X., Y.) ,Var(aX.+bY.)=ein2V.einr(X.)+b2V.einr(Y.)+2einbC.Öv(X.,Y.),Var(aX+bY) = a^2Var(X) +b^2Var(Y) + 2abCov(X,Y), Sei …
Ich verwende die logistische Regression für die binäre Klassifizierung. Ich habe einen großen Datensatz (zufällig sehr unausgeglichen: 19: 1). Also benutze ich Scikit-Learns LogisticRegression(), um 80% meiner beschrifteten Daten zu trainieren, und validierte dann mit den anderen 20% (ich habe mir den Bereich unter ROC sowie den Präzisionsrückruf angesehen, weil …
Sei iid und zieht aus B e t a ( kx1, … , X.nx1,…,xnx_1,\dots,x_n. Wie sind die Statistiken für minimale und maximale Bestellungen verteilt?B e t a ( k2, k - p - 12)Beta(k2,k−p−12)Beta\left(\frac{k}2,\frac{k-p-1}{2}\right) Ich würde mich sehr über eine Referenz freuen, wenn dies möglich ist. Im Allgemeinen bin ich …
Ich lerne gerade selbst in der linearen Modelltheorie und finde es überraschend, dass für einen Zufallsvektor definiert ist , außer der Kovarianzmatrix werden keine weiteren Momente erwähnt.Y = [ y 1 y 2 ⋮ y n ]E [ Y ]E[Y]\mathbb{E}[\mathbf{Y}]Y = ⎡⎣⎢⎢⎢⎢y1y2⋮yn⎤⎦⎥⎥⎥⎥Y=[y1y2⋮yn]\mathbf{Y} = \begin{bmatrix} y_1 \\ y_2 \\ \vdots \\ …
Der folgende Satz stammt aus der 7. Ausgabe von " Introduction to Mathematical Statistics " von Hogg, Craig und Mckean und betrifft die notwendige und ausreichende Bedingung für die Unabhängigkeit zweier quadratischer Formen normaler Variablen. Dies ist ein ziemlich langer Auszug, aber ich würde mich über Hilfe nur beim Übergang …
Nehmen wir an, man hat parallele MCMC-Ketten ausgeführt, in denen jede Kette eingebrannt ist. Die resultierenden Ketten seien mit wobei die Länge jeder Kette danach ist verbrennen in.x ( i ) 1 , … , x ( i ) N.mmmN.x( i )1, … , X.( i )N. für i = …
Meine Frage bezieht sich auf den 1-nächsten Nachbarn-Klassifikator und auf eine Aussage, die in dem ausgezeichneten Buch Die Elemente des statistischen Lernens von Hastie, Tibshirani und Friedman gemacht wurde. Die Aussage lautet (S. 465, Abschnitt 13.3): "Da nur der Trainingspunkt verwendet wird, der dem Abfragepunkt am nächsten liegt, ist die …
Beim verstärkten Lernen haben wir eine Belohnungsfunktion, die den Agenten darüber informiert, wie gut seine aktuellen Aktionen und Zustände sind. In einigen allgemeinen Einstellungen ist die Belohnungsfunktion eine Funktion von drei Variablen: Aktueller ZustandS.SS Aktuelle Aktion im aktuellen Zustandπ( s ) = aπ(s)=a\pi(s) = a Nächster ZustandS.'S′S' Es sieht also …
Ich habe es mit einem Problem zu tun, das mit dem Finden des Gradienten der Kreuzentropieverlustfunktion für den Parameter θθ\theta wobei: CE(θ)=−∑iyi∗log(y^i)CE(θ)=−∑iyi∗log(y^i)CE(\theta) = -\sum\nolimits_{i}{y_i*log({\hat{y}_{i}})} Wobei y i = s o f t m ein x ( θ i ) und θ i ist ein Vektoreingang.y^i=softmax(θi)y^i=softmax(θi)\hat{y}_{i} = softmax(\theta_i)θiθi\theta_i Auch yyy ist …
Wir wissen, dass wenn , dann wobei ist die Digamma-Funktion. Gibt es eine einfache Form für ?p∼Beta(α,β)p∼Beta(α,β)p \sim Beta(\alpha, \beta)E[lnp]=ψ(α)−ψ(α+β)E[lnp]=ψ(α)−ψ(α+β) \mathbb{E}[\ln p] = \psi(\alpha) - \psi(\alpha + \beta) ψ(.)ψ(.)\psi(.)E[ln(1−p)]E[ln(1−p)] \mathbb{E}[\ln (1-p)]
Ich studiere 'Einführung in das statistische Lernen' von James, Witten, Hastie, Tibshirani. Auf Seite 139 ihres Buches begannen sie mit der Einführung des Bayes-Theorems . ist keine mathematische Konstante, sondern bezeichnet die vorherige Wahrscheinlichkeit. In dieser Gleichung ist nichts seltsam. πpk(X)=P(Y=k|X=x)=πkfk(x)∑kl=1πlfl(x)pk(X)=P(Y=k|X=x)=πkfk(x)∑l=1kπlfl(x)p_k(X)=P(Y=k|X=x) = \dfrac{\pi_kf_k(x)}{\sum_{l=1}^k \pi_l f_l(x)}ππ\pi Das Buch behauptet, dass es …
Ich lerne etwas über Regression. Ich habe einige Querschnittsregressionen durchgeführt, die in Ordnung sind. Ich habe kürzlich eine einfache Zeitreihenregression durchgeführt. Ich habe also ay & x Vektoren, die jeweils 1000 Beobachtungen enthalten. Ich habe eine einfache alte Regression in Excel durchgeführt, die ich für in Ordnung hielt. Mein Online-Tutor …
\def\l{|\!|} Angesichts der elastischen Netzregression minb12||y−Xb||2+αλ||b||22+(1−α)λ||b||1minb12||y−Xb||2+αλ||b||22+(1−α)λ||b||1\min_b \frac{1}{2}\l y - Xb \l^2 + \alpha\lambda \l b\l_2^2 + (1 - \alpha) \lambda \l b\l_1 Wie kann ein geeigneter Bereich von λλ\lambda für die Kreuzvalidierung ausgewählt werden? Im Fall α=1α=1\alpha=1 (Gratregression) die Formel dof=∑js2js2j+λdof=∑jsj2sj2+λ\textrm{dof} = \sum_j \frac{s_j^2}{s_j^2+\lambda} kann verwendet werden, um für jedes …
Mein Lehrer hat bewiesen, dass das 2. Derivat der Kreuzentropie immer positiv ist, so dass die Kostenfunktion neuronaler Netze mit Kreuzentropie konvex ist. Ist das wahr? Ich bin ziemlich verwirrt darüber, weil ich immer gelernt habe, dass die Kostenfunktion von ANN nicht konvex ist. Kann jemand das bestätigen? Vielen Dank! …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.