Ich habe in letzter Zeit viel über Reinforcement Learning geforscht. Ich folgte Sutton & Bartos Reinforcement Learning: Eine Einführung für das meiste davon. Ich weiß, was Markov-Entscheidungsprozesse sind und wie das Lernen mit dynamischer Programmierung (DP), Monte Carlo und zeitlichem Unterschied (DP) verwendet werden kann, um sie zu lösen. Das …
Während ich die Maximum-Likelihood-Schätzung studiere, müssen wir die Varianz kennen, um Rückschlüsse auf die Maximum-Likelihood-Schätzung zu ziehen. Um die Varianz herauszufinden, muss ich die untere Grenze des Cramer-Rao kennen, die wie eine hessische Matrix mit zweiter Ableitung auf der Krümmung aussieht. Ich bin irgendwie durcheinander, um die Beziehung zwischen Kovarianzmatrix …
Ich habe über die Nyström-Methode für die Annäherung an Kernel mit niedrigem Rang gelesen. Diese Methode wird in scikit-learn [1] implementiert, um Datenproben auf eine niedrigrangige Näherung der Kernel-Feature-Mapping zu projizieren. Nach meinem besten Wissen erzeugt es bei gegebenem Trainingssatz und einer Kernelfunktion eine niedrigrangige Approximation der Kernelmatrix durch Anwenden …
Ich habe einige Probleme, die Markov-Ketteneigenschaft nicht reduzierbar zu verstehen . Irreduzibel soll bedeuten, dass der stochastische Prozess "von jedem Zustand in jeden Zustand übergehen kann". Aber was definiert, ob es von Zustand zu Zustand j gehen kann oder nicht?ichiijjj Die Wikipedia-Seite gibt die Formalisierung: Der Zustand ist vom Zustand …
Wikipedia sagt das: Die VC-Dimension ist die Kardinalität der größten Menge von Punkten, die ein Algorithmus zerstören kann. Zum Beispiel hat ein linearer Klassifikator eine Kardinalität n + 1. Meine Frage ist, warum es uns interessiert? Die meisten Datensätze, für die Sie eine lineare Klassifizierung durchführen, sind in der Regel …
Wenn jemand sagt, dass Daten aus einer logarithmisch gleichmäßigen Verteilung zwischen 128 und 4000 entnommen werden, was bedeutet das? Wie unterscheidet sich das von einer gleichmäßigen Verteilung? Siehe dieses Dokument: http://www.jmlr.org/papers/volume13/bergstra12a/bergstra12a.pdf Vielen Dank!
Soweit ich weiß, werden sowohl Autoencoder als auch t-SNE zur nichtlinearen Dimensionsreduktion verwendet. Was sind die Unterschiede zwischen ihnen und warum sollte ich einen gegen einen anderen verwenden?
Ich habe eine Zooserie mit vielen fehlenden Werten. Ich habe gelesen, dass auto.arimadiese fehlenden Werte unterstellt werden können? Kann mir jemand beibringen, wie es geht? Danke vielmals! Das habe ich versucht, aber ohne Erfolg: fit <- auto.arima(tsx) plot(forecast(fit))
Predicted class Cat Dog Rabbit Actual class Cat 5 3 0 Dog 2 3 1 Rabbit 0 2 11 Wie kann ich Präzision berechnen und abrufen, damit es einfach wird, den F1-Score zu berechnen? Die normale Verwirrungsmatrix ist eine 2 x 2-Dimension. Wenn es jedoch 3 x 3 wird, weiß …
Ich bin kein Mathematiker. Ich habe im Internet nach KL Divergence gesucht. Was ich gelernt habe, ist, dass die KL-Divergenz den Informationsverlust misst, wenn wir die Verteilung eines Modells in Bezug auf die Eingabeverteilung approximieren. Ich habe diese zwischen zwei kontinuierlichen oder diskreten Verteilungen gesehen. Können wir es zwischen kontinuierlich …
Kann mir bitte jemand helfen, die Unterschiede zwischen dem Simultangleichungsmodell und dem Strukturgleichungsmodell (SEM) zu verstehen? Es wird großartig sein, wenn mir jemand Literatur dazu zur Verfügung stellen kann. Gibt es auch Literatur, in der SEM im Kontext von Zeitreihen verwendet wurde? Die Literaturen, die ich bekomme, werden meistens im …
Das LSTM im folgenden Keras-Code input_t = Input((4, 1)) output_t = LSTM(1)(input_t) model = Model(inputs=input_t, outputs=output_t) print(model.summary()) kann dargestellt werden als Ich verstehe, dass, wenn wir model.predict(np.array([[[1],[2],[3],[4]]]))die (einzige) LSTM-Einheit aufrufen , zuerst der Vektor [1], dann [2] plus die Rückmeldung von der vorherigen Eingabe usw. bis zum Vektor [4] verarbeitet …
Ich implementiere PCA, LDA und Naive Bayes für die Komprimierung bzw. Klassifizierung (Implementierung einer LDA für die Komprimierung und Klassifizierung). Ich habe den Code geschrieben und alles funktioniert. Was ich für den Bericht wissen muss, ist die allgemeine Definition des Rekonstruktionsfehlers . Ich kann viel Mathematik finden und in der …
Ich weiß, dass die Verteilung der Stichprobenvarianz Es liegt an der Tatsache, dass kann in Matrixform (wobei A: symmetrisch) ausgedrückt werden, und er kann erneut ausgedrückt werden in: x'QDQ'x (wobei Q: orthonormal, D: diagonale Matrix). ∑(Xi−X¯)2σ2∼χ2(n−1)∑(Xi−X¯)2σ2∼χ(n−1)2 \sum\frac{(X_i-\bar{X})^2}{\sigma^2}\sim \chi^2_{(n-1)} ∑(Xi−X¯)2n−1∼σ2n−1χ2(n−1)∑(Xi−X¯)2n−1∼σ2n−1χ(n−1)2 \sum\frac{(X_i-\bar{X})^2}{n-1}\sim \frac{\sigma^2}{n-1}\chi^2_{(n-1)} (X−X¯)2(X−X¯)2(X-\bar{X})^2xAx′xAx′xAx'x'Q D Q.'xx′QDQ′xx'QDQ'x Was ist mit ∑ ( Y.ich- …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.