In verallgemeinerten linearen Modellen muss die bedingte Verteilung der Antwortvariablen zur Exponentialfamilie gehören. Warum ist diese Einschränkung wichtig? Welche Eigenschaft würde ein Regressionsmodell verlieren, wenn wir eine Verteilung außerhalb der Exponentialfamilie wählen würden?
Dies hängt nicht direkt mit meiner anderen Frage zusammen , obwohl das Thema dasselbe ist. Es ist höchstwahrscheinlich auch eine sehr triviale Frage, aber nehmen Sie sie mit :) Ich habe mit einem Kollegen über die Verwendung der Gaußschen Prozessregression gesprochen und er hat zwei Behauptungen aufgestellt, denen ich nicht …
Die traditionelle Kammregressionsschätzung ist β^ridge=(XTX+λI)−1XTYβ^ridge=(XTX+λI)−1XTY \hat{\beta}_{ridge} = (X^TX+\lambda I)^{-1} X^T Y ergibt sich aus dem Hinzufügen des .λ||β||22λ||β||22\lambda ||\beta||^2_2 Ich habe mich bemüht, Literatur über die Regularisierung auf einen bestimmten Wert zu finden . Insbesondere habe ich mir ein Ridge-Regressionsmodell angesehen, das die Form der Strafe wobei die anfängliche Schätzung …
Ein reguläres lineares Regressionsmodell ist , wobei unbekannte Koeffizienten sind und \ varepsilon Gaußsches Rauschen mit einem Mittelwert von Null und einer konstanten Varianz ist. Ich baue ein Modell, bei dem der Fehlerbegriff \ varepsilon zwei Komplikationen hat:y=c′x+εy=c′x+εy = c'x + \varepsiloncccεε\varepsilonεε\varepsilon Seine Verteilung ist nicht normal. Die Fehlervarianz ist …
Warum wird die logistische Regressionshypothese als Wahrscheinlichkeitsfunktion angesehen? Ich verstehe, dass wir es verwenden, um 0 oder 1 vorherzusagen, aber warum kann eine Funktion (die Hypothese), die Zahlen zwischen 0 und 1 ausgibt, als Wahrscheinlichkeitsfunktion betrachtet werden? Ist das eine Heuristik?
Wenn ein Lernalgorithmus (z. B. Klassifizierung, Regression, Clustering oder Dimensionsreduktion) nur das Punktprodukt zwischen Datenpunkten verwendet xxT.xxT.\mathbf {x x^T} Wir können implizit eine höherdimensionale Abbildung verwenden ϕ ( x )ϕ(x)\phi(\mathbf x) Durch den Kernel-Trick wird jede Instanz ausgetauscht, in der das Punktprodukt vom Kernel auftritt K =ϕ( x )ϕ( x)T.K.=ϕ(x)ϕ(x)T.\mathbf …
Meine Frage bezieht sich auf die Regularisierung in der linearen Regression und der logistischen Regression. Ich mache gerade Woche 3 von Andrew Ngs Kurs über maschinelles Lernen auf Coursera. Ich verstehe, wie Überanpassung ein häufiges Problem sein kann, und ich habe eine gewisse Intuition dafür, wie Regularisierung Überanpassung reduzieren kann. …
Ich habe Daten über verschiedene Teams, Spieler usw. Ich versuche herauszufinden, wie ich das Ergebnis eines Spiels am besten modellieren kann. Dies kann zu einem Sieg für die Heimmannschaft, einer Niederlage für die Heimmannschaft oder einem Unentschieden führen. Ich habe jedoch Probleme, dies zu modellieren. Zum Beispiel kann ich eine …
Was sind die neuesten Alternativen zu Gaußschen Prozessen (GP) für nichtparametrische nichtlineare Regression mit Vorhersageunsicherheit, wenn die Größe des Trainingssatzes für Vanille-Allgemeinmediziner unerschwinglich wird, aber immer noch nicht sehr groß ist? Details meines Problems sind: Der Eingaberaum ist niedrigdimensional (X⊆RdX⊆Rd\mathcal{X} \subseteq \mathbb{R}^dmit 2≤d≤202≤d≤202\le d \le 20) Ausgabe ist reellwertig (Y⊆RY⊆R\mathcal{Y} …
Um herauszufinden, wie die LASSORegression funktioniert, habe ich einen kleinen Code geschrieben, der die LASSORegression durch Auswahl des besten Alpha-Parameters optimieren soll . Ich kann nicht herausfinden, warum die LASSORegression nach der Kreuzvalidierung so instabile Ergebnisse für den Alpha-Parameter liefert. Hier ist mein Python-Code: from sklearn.linear_model import Lasso from sklearn.cross_validation …
Wenn wir stochastische Regressoren haben, zeichnen wir zufällige Paare für eine Gruppe von , der sogenannten Zufallsstichprobe, aus einer festen, aber unbekannten Wahrscheinlichkeitsverteilung . Theoretisch erlaubt uns die Zufallsstichprobe, einige Parameter der Verteilung kennenzulernen oder abzuschätzen .(yich,x⃗ ich)(yi,x→i)(y_i,\vec{x}_i)ichii( y,x⃗ )(y,x→)(y,\vec{x})( y,x⃗ )(y,x→)(y,\vec{x}) Wenn wir feste Regressoren haben, können wir theoretisch …
Bei Verwendung des Befehls drop1 in R für die Modellbildung muss die Variable mit dem niedrigsten AIC-Wert gelöscht werden. Was könnte der Grund dafür sein? Ich weiß, dass AIC über Informationsverlust spricht und ein niedrigerer AIC-Wert besser ist, aber das Löschen einer Variablen mit niedrigem AIC scheint nicht intuitiv zu …
Bei der linearen Regression von Grat und Lasso besteht ein wichtiger Schritt darin, den Abstimmungsparameter Lambda zu wählen. Oft verwende ich die Rastersuche auf der Protokollskala von -6-> 4, sie funktioniert gut auf Grat, aber auf Lasso sollte ich die Reihenfolge berücksichtigen der Größe der Ausgabe y? Wenn die Ausgabe …
Unten sehen Sie ein Streudiagramm (maximal 10.000 US-Dollar), das die durchschnittliche Spende darstellt, die ein Projekt erhält, und die Wortzahl des Aufsatzes über die Finanzierungsanfrage für alle Projekte, die in den offenen Spenderauswahldaten dargestellt sind . Es gibt ein auffälliges Muster, das ich durch Anpassen der Kurve zu charakterisieren versuchte …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.