Wenn wir den kausalen Effekt von auf im folgenden berechnen wollten , können wir sowohl den Satz für die Anpassung der Hintertür als auch für die Anpassung der Vordertür verwenden, dh XXXYYYP(y|do(X=x))=∑uP(y|x,u)P(u)P(y|do(X=x))=∑uP(y|x,u)P(u)P(y | \textit{do}(X = x)) = \sum_u P(y | x, u) P(u) und P.( y| tun (X.= x ) …
Zunächst einmal: Ich weiß, dass zum Trainieren eines neuronalen Netzwerks keine allgemeine Anzahl von Stichproben erforderlich ist. Es hängt von viel zu vielen Faktoren ab, wie der Komplexität der Aufgabe, dem Rauschen in den Daten und so weiter. Und je mehr Trainingsbeispiele ich habe, desto besser wird mein Netzwerk. Aber …
Ich bin mir nie sicher, wann ich eine One-Hot-Codierung für nicht geordnete kategoriale Variablen verwenden soll und wann nicht. Ich benutze es immer dann, wenn der Algorithmus eine Distanzmetrik verwendet, um Ähnlichkeit zu berechnen. Kann jemand eine allgemeine Faustregel geben, welche Arten von Algorithmen erfordern würden, dass nicht geordnete kategoriale …
Nehmen wir an, wir haben ein Klassifizierungsproblem und möchten zunächst einen Einblick in die Daten erhalten, und wir machen t-SNE. Das Ergebnis von t-SNE trennt Klassen sehr gut. Dies impliziert, dass es möglich ist, ein Klassifizierungsmodell zu erstellen, das auch Klassen sehr gut trennt (wenn t-SNE nicht gut trennt, bedeutet …
Nach meinem (sehr bescheidenen) Verständnis der Variationsinferenz versucht man, eine unbekannte Verteilung zu approximieren, pppindem man eine Verteilung qqq , die Folgendes optimiert: KL(p||q)=∑xp(x)logp(x)q(x)KL(p||q)=∑xp(x)logp(x)q(x)KL (p||q) = \sum\limits_{x} p(x)log \frac {p(x)}{q(x)} Immer wenn ich Zeit in das Verständnis von Variationsinferenzen investiere, treffe ich diese Formel und kann nicht anders, als das …
Hintergrund: Ich studiere Kapitel 6 von Deep Learning von Ian Goodfellow und Yoshua Bengio und Aaron Courville. In Abschnitt 6.2.2.2 (Seiten 182 von 183, die hier eingesehen werden können ) wird die Verwendung von Sigmoid zur Ausgabe von P(y=1|x)P(y=1|x)P(y=1|x) motiviert. Um einen Teil des Materials zusammenzufassen, lassen sie z=wTh+bz=wTh+bz = …
Ich arbeite an einem sehr großen linearen Regressionsproblem, dessen Daten so groß sind, dass sie auf einem Cluster von Computern gespeichert werden müssen. Es ist viel zu groß, um alle Samples im Speicher einer einzelnen Maschine (sogar auf der Festplatte) zusammenzufassen. Um diese Daten zu regressieren, denke ich über einen …
Ich habe diesen riesigen Datensatz mit ungefähr 2500 Variablen und ungefähr 142 Beobachtungen. Ich möchte eine Korrelation zwischen Variable X und dem Rest der Variablen ausführen. Bei vielen Spalten fehlen jedoch Einträge. Ich habe versucht, dies in R mit dem Argument "pairwise-complete" ( use=pairwise.complete.obs) zu tun, und es wurden eine …
Hier ist ein Keras-Codebeispiel, das es verwendet: from keras.constraints import max_norm model.add(Convolution2D(32, 3, 3, input_shape=(3, 32, 32), border_mode='same', activation='relu', kernel_constraint=max_norm(3)))
Ich habe eine Rastersuche für eine Reihe von Parametern eingerichtet. Ich versuche, die besten Parameter für ein neuronales Keras-Netz zu finden, das eine binäre Klassifizierung durchführt. Die Ausgabe ist entweder eine 1 oder eine 0. Es gibt ungefähr 200 Funktionen. Als ich eine Rastersuche durchführte, bekam ich eine Reihe von …
Ich habe kürzlich eine Frage gestellt, die nach einer mathematischen Interpretation / Intuition hinter der Elementargleichung für Stichprobenmittelwert und Varianz sucht: , geometrisch oder auf andere Weise.E[X2]=Var(X)+(E[X])2E[X2]=Var(X)+(E[X])2 E[X^2] = Var(X) +(E[X])^2 Aber jetzt bin ich neugierig auf die oberflächlich ähnliche Bias-Varianz-Kompromissgleichung. (Formeln ausWikipedia)MSE(θ^)=E[(θ^−θ)2]==E[(θ^−E[θ^])2]+(E[θ^]−θ)2Var(θ^)+Bias(θ^,θ)2MSE(θ^)=E[(θ^−θ)2]=E[(θ^−E[θ^])2]+(E[θ^]−θ)2=Var(θ^)+Bias(θ^,θ)2 \begin{eqnarray} \text{MSE}(\hat{\theta}) = E [(\hat{\theta}-\theta)^2 ] &=& …
Ich möchte den Unterschied zwischen der linearen Regression in einer regulären Analyse des maschinellen Lernens und der linearen Regression in der Einstellung "Deep Learning" kennen. Welche Algorithmen werden für die lineare Regression in Deep-Learning-Umgebungen verwendet?
Sowohl die Begriffe "Upsampling" als auch "Transponierungsfaltung" werden verwendet, wenn Sie "Entfaltung" durchführen (<- kein guter Begriff, aber lassen Sie mich ihn hier verwenden). Ursprünglich dachte ich, dass sie dasselbe bedeuten, aber es scheint mir, dass sie sich unterscheiden, nachdem ich diese Artikel gelesen habe. kann jemand bitte klarstellen? Transponieren …
Ich habe einen Datensatz, der aus Proportionen besteht, die das "Aktivitätsniveau" einzelner Kaulquappen messen, wodurch die Werte zwischen 0 und 1 gebunden werden. Diese Daten wurden gesammelt, indem gezählt wurde, wie oft sich die Person innerhalb eines bestimmten Zeitintervalls bewegt hat (1 für Bewegung, 1). 0 für keine Bewegung) und …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.