Ich dachte daran, Lasso mit Vanille-Subgradienten-Methoden zu lösen. Aber ich habe Leute gelesen, die vorschlagen, den proximalen Gradientenabstieg zu verwenden. Kann jemand hervorheben, warum für Lasso proximale GD anstelle von Vanille-Subgradienten-Methoden verwendet werden?
Dies ist tatsächlich eines der Probleme in Gujaratis 4. Ausgabe von Basic Econometrics (Q3.11) und besagt, dass der Korrelationskoeffizient in Bezug auf die Änderung von Ursprung und Maßstab, dh unveränderlich ist. = corr ( X , Y ) wobei a , b , c , d beliebige Konstanten sind.corr(aX+b,cY+d)=corr(X,Y)corr(aX+b,cY+d)=corr(X,Y)\text{corr}(aX+b, cY+d) …
Es wurde viel über die Bedeutung von Normalverteilungen in der Natur gesagt. Viele Maße wie Größe oder Gewicht sind ungefähr normal verteilt. Aber keiner von ihnen ist genau normal, soweit ich verstehe. Angesichts der Tatsache, dass die Normalverteilung eine der maximalen Entropieverteilungen ist , erscheint es plausibel, dass die Natur …
Ich versuche, verschiedene Datensätze mit unbeaufsichtigten Algorithmen (Clustering) zu gruppieren. Das Problem ist, dass ich viele Funktionen (~ 500) und eine kleine Anzahl von Fällen (200-300) habe. Bisher habe ich nur Klassifizierungsprobleme gemacht, für die ich Daten immer als Trainingssätze gekennzeichnet hatte. Dort habe ich ein Kriterium (dh random.forest.importance oder …
Sei eine diskrete Zufallsvariable, die ihre Werte in annimmt . Ich möchte diese Variable halbieren , dh eine Zufallsvariable wie zum Beispiel:X.X.XN.N.\mathbb{N}Y.Y.Y X.= Y.+ Y.∗X.=Y.+Y.∗X = Y + Y^* wobei eine unabhängige Kopie von .Y.∗Y.∗Y^*Y.Y.Y Ich bezeichne diesen Prozess als Halbierung ; Dies ist eine erfundene Terminologie. Gibt es in …
Wenn ich einen k-fachen CV zur Auswahl unter Regressionsmodellen verwende, berechne ich normalerweise den CV-Fehler für jedes Modell separat zusammen mit seinem Standardfehler SE und wähle das einfachste Modell innerhalb von 1 SE des Modells mit dem niedrigsten CV-Fehler (der 1) aus Standardfehlerregel, siehe zum Beispiel hier ). Kürzlich wurde …
Was halten Sie von der Verwendung von Regression für Projekte außerhalb des Datenbereichs? Wenn wir sicher sind, dass es einer linearen oder Potenzmodellform folgt, könnte das Modell dann nicht über den Datenbereich hinaus nützlich sein? Zum Beispiel habe ich das Volumen vom Preis getrieben. Wir sollten in der Lage sein, …
Autoencoder- Netzwerke scheinen viel schwieriger zu sein als normale Klassifikator-MLP-Netzwerke. Nach mehreren Versuchen mit Lasagne ist alles, was ich in der rekonstruierten Ausgabe bekomme, etwas, das im besten Fall einer verschwommenen Mittelung aller Bilder der MNIST- Datenbank ähnelt, ohne zu unterscheiden, was die eingegebene Ziffer tatsächlich ist. Die von mir …
Betrachten Sie ein lineares Regressionsmodell: yi=xi⋅β+εi,i=1,…,n,yi=xi⋅β+εi,i=1,…,n, y_i = \mathbf x_i \cdot \boldsymbol \beta + \varepsilon _i, \, i=1,\ldots ,n, wobei εi∼L(0,b)εi∼L(0,b)\varepsilon _i \sim \mathcal L(0, b) , das heißt , Laplace-Verteilung mit 000 Mittelwert und bbb Skalenparameter sind alle voneinander unabhängig. Betrachten Sie eine maximale Wahrscheinlichkeitsschätzung des unbekannten Parameters ββ\boldsymbol …
Ist es möglich, eine Reihe von Variablen zu haben, die nicht korreliert, aber linear abhängig sind?KK.K dh und∑ K i = 1 a i x i = 0cor(xi, xj) = 0cÖr(xich,xj)=0cor(x_i, x_j)=0∑K.i = 1einichxich= 0∑ich=1K.einichxich=0 \sum_{i=1}^K a_ix_i=0 Wenn ja, können Sie ein Beispiel schreiben? EDIT: Aus den Antworten folgt, dass …
Ich habe in einem Buch über maschinelles Lernen gelesen, dass Parameter der linearen Regression (unter anderem) durch Gradientenabstieg geschätzt werden können, während Parameter der logistischen Regression normalerweise durch Schätzung der maximalen Wahrscheinlichkeit geschätzt werden. Ist es möglich, einem Neuling (mir) zu erklären, warum wir unterschiedliche Methoden für die lineare / …
In diesem ( Bayesianische Inferenz für Varianzkomponenten, die nur Fehlerkontraste verwenden , Harville, 1974) behauptet der Autor als "bekannt" Beziehung ", für eine lineare Regression wobei y = X β(y−Xβ)′H−1(y−Xβ)=(y−Xβ^)′H−1(y−Xβ^)+(β−β^)′(X′H−1X)(β−β^)(y−Xβ)′H−1(y−Xβ)=(y−Xβ^)′H−1(y−Xβ^)+(β−β^)′(X′H−1X)(β−β^)(y-X\beta)'H^{-1}(y-X\beta)=(y-X\hat\beta)'H^{-1}(y-X\hat\beta)+(\beta-\hat\beta)'(X'H^{-1}X)(\beta-\hat\beta)ϵ ∼ N ( 0 , H ) .y=Xβ+ϵ,y=Xβ+ϵ,y=X\beta+\epsilon,ϵ∼N(0,H).ϵ∼N(0,H).\epsilon\sim\mathcal{N}(0, H). Wie ist das bekannt? Was ist der einfachste Weg, dies zu …
Diese Frage fragt nach der Wahrscheinlichkeit eines Erfolgs in einem Rollenspiel. Die Frage und ihre Antworten decken jedoch einige der Komplexitäten der Würfelmechanik nicht ab. Insbesondere werden Pfuschereien (ein mögliches Ergebnis) überhaupt nicht behandelt. Ein Spieler hat einen Würfelpool, der auf einer Mechanik im Spiel basiert, die für diese Frage …
Ich versuche, die Dimensionalität und das Rauschen eines Datensatzes zu reduzieren, indem ich eine PCA für den Datensatz durchführe und die letzten PCs wegwerfe. Danach möchte ich einige Algorithmen für maschinelles Lernen auf den verbleibenden PCs verwenden und daher die Daten normalisieren, indem ich die Varianz der PCs anpasse, damit …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.