Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Die Lasso-Strafe galt nur für eine Untergruppe von Regressoren
Diese Frage wurde bereits gestellt, aber es gab keine Antworten, daher dachte ich, ich könnte sie noch einmal stellen. Ich bin daran interessiert, eine Lasso-Strafe auf eine Untergruppe der Regressoren anzuwenden, dh mit objektiver Funktion E=||y−X1β1−X2β2||2+λ||β1||1E=||y−X1β1−X2β2||2+λ||β1||1E = ||\mathbf{y} - \mathbf{X}_1 \boldsymbol{\beta}_1 - \mathbf{X}_2 \boldsymbol{\beta}_2||^2 + \lambda ||\boldsymbol{\beta}_1||_1 Dabei wird das …

2
Unterschied zwischen Advantage Actor Critic und TD Actor Critic?
Ich habe eine Frage zu Methoden der Schauspielerkritik beim Lernen zur Stärkung. In diesen Folien ( https://hadovanhasselt.files.wordpress.com/2016/01/pg1.pdf ) werden verschiedene Arten von Schauspieler-Kritikern erläutert. Vorteil Schauspieler Kritiker und TD Schauspieler Kritiker werden auf der letzten Folie erwähnt: Wenn ich mir aber die Folie "Schätzen der Vorteilsfunktion (2)" anschaue, heißt es, …

1
Homoskedastizitätsannahme bei linearer Regression vs. Konzept studentisierter Residuen
Nachdem ich über studentisierte Residuen gelesen habe, verstehe ich nicht, wie die Idee unterschiedlicher Residuenvarianzen, die von bestimmten Werten eines Prädiktors abhängig sind (wie dies durch das Konzept studentisierter Residuen impliziert wird), nicht inhärent im Widerspruch zur Annahme der Homoskedastizität in linearen Regressionsmodellen mit einem einzigen steht Prädiktorvariable.XXX In meinem …

2
Die Wahrscheinlichkeit von k Nullen ergibt die Summe von n Poisson-Zufallsvariablen ist t?
Angenommen, ich habe X.1,X.2,X.3, . . .X.nX1,X2,X3,...XnX_1,X_2,X_3,...X_n iid Zufallsvariablen aus einer Poisson-Verteilung von Parametern λλ\lambda. Angesichts dessenX.1+X.2+X.3+ . . . +X.n= tX1+X2+X3+...+Xn=tX_1 +X_2+X_3 +...+X_n = t, wie hoch ist die Wahrscheinlichkeit, dass genau kkk von X.1,X.2,X.3, . . .X.nX1,X2,X3,...XnX_1,X_2,X_3,...X_n sind Null? - - Mein Ansatz: Ich begann mit der Betrachtung …

1
Ist dies auch eine * notwendige * Bedingung, um ein Bayes-Schätzer zu sein, oder nur eine ausreichende?
Ein Bayes-Schätzer minimiert das Bayes-Risiko. Insbesondere genau dann, wenn δΛ=argminBR(Λ,δ):=∫R(θ,δ)dΛ(θ)=∫(∫L(θ,δ(x))dx)dΛ(θ)δΛ=arg⁡minBR⁡(Λ,δ):=∫R(θ,δ)dΛ(θ)=∫(∫L(θ,δ(x))dx)dΛ(θ)\delta_{\Lambda} = \arg\min \operatorname{BR}(\Lambda,\delta) := \int R(\theta, \delta) d \Lambda(\theta) = \int \left( \int L(\theta, \delta(x))dx \right) d \Lambda(\theta) wobei L(θ,δ(X))L(θ,δ(X))L(\theta, \delta(X)) eine gegebene Verlustfunktion ist, R(θ,δ)R(θ,δ)R(\theta, \delta) ist Die entsprechende Risikofunktion und BR(Λ,δ)BR⁡(Λ,δ)\operatorname{BR}(\Lambda, \delta) wird als Bayes-Risiko definiert. δΛδΛ\delta_{\Lambda} ein …

1
Bayesianisches Netzwerk vs. Assoziationsregeln
Der Apriori-Algorithmus findet einige Implikationsregeln. Ähnliche Ergebnisse liefern Bayes'sche Netzwerke. Was ist der wesentliche Unterschied? Was sind die spezifischen Vor- und Nachteile? Bearbeiten: Der Apriori-Algorithmus generiert Zuordnungsregeln als eine Art Implikation, die auf dem folgenden Bild (aus diesem Dokument entnommen ) visuell überprüft werden können .


1
Anwenden von Dualitäts- und KKT-Bedingungen auf das LASSO-Problem
Ich habe einige Schwierigkeiten zu verstehen, wie Dualität zu der häufigen Form des LASSO-Problems und der Karush-Kuhn-Tucker-Bedingung führt, die als komplementäre Schlaffheit bezeichnet wird. Ich habe zwei Fragen: Wir wissen das angesichts eines Optimierungsproblems minxf(x)s.t.hi(x)≤0,i=1,…,mminxf(x)s.t.hi(x)≤0,i=1,…,m \begin{align*} &\min_x f(x)\\ &s.t. \quad h_i(x) \leq 0 \, ,\quad i=1,\dots, m \end{align*} Das Lösen …

1
Warum haben einige Formeln den Koeffizienten der logistischen Regressionswahrscheinlichkeit im Vordergrund und andere nicht?
Ich leite die Wahrscheinlichkeit einer logistischen Regression ab. Ich habe zwei verschiedene Versionen gesehen: f(y|β)=∏i=1Nniyi!(ni−yi)!πyii(1−πi)ni−yi(1)(1)f(y|β)=∏i=1Nniyi!(ni−yi)!πiyi(1−πi)ni−yi\begin{equation} f(y|\beta)={\displaystyle \prod_{i=1}^{N} \frac{n_i} {y_i!(n_i-y_i)!}} \pi_{i}^{y_i}(1-\pi_i)^{n_i - y_i} \tag 1 \end{equation} Oder dieses L(β0,β1)=∏i=1Np(xi)yi(1−p(xi))1−yi(2)(2)L(β0,β1)=∏i=1Np(xi)yi(1−p(xi))1−yi\begin{equation} L(\beta_0,\beta_1)= \displaystyle \prod_{i=1}^{N}p(x_i)^{y_i}(1-p(x_i))^{1-y_i} \tag 2 \end{equation} Warum gibt es in Gleichung 1 ?niyi!(ni−yi)!niyi!(ni−yi)!\frac{n_i} {y_i!(n_i-y_i)!} Quellen: Erstens: https://czep.net/stat/mlelr.pdf (Seite 3, Äqu. 2) Zweitens: …




1
Verteilungsentropie mit gleichmäßiger Unterverteilung
Lassen XXX eine Zufallsvariable sein, die Werte in einer Menge annimmt XX\mathcal{X}. Die Verteilung vonXXXist nicht einheitlich, aber es gibt eine TeilmengeA∈XA∈XA\in\mathcal{X} Das ist "einheitlich": alle Ereignisse in AAA mit gleicher Wahrscheinlichkeit auftreten. Können wir die Entropie von XXX auf die Größe des Sets AAA? Intuitiv scheint es uns möglich …

2
Was sind die Motive für die Verwendung der logistischen Funktion als Modell für die binäre Klassifizierung?
Die bei der binären Klassifizierung verwendete logistische Regression verwendet die logistische Funktion als Modell für die zugrunde liegende Wahrscheinlichkeit der Ergebnisvariablen. Es hat einige nützliche und wesentliche Eigenschaften für die Anpassung eines solchen Modells. Zum Beispiel nimmt es monoton zu, es tendiert zu 1, wenn x gegen unendlich tendiert, es …

2
Normalerweise Abtastung vom Standard-Simplex
Ich möchte in der Lage sein, Werte aus einer dimensionalen multivariaten Gaußschen Verteilung zu generieren mit gegebenen Mitteln und einer Kovarianzmatrix auf den Bereich abgeschnitten ist, so dass sie sich zu eins summieren.nnn[0,1][0,1][0, 1] Ich denke, dies ist dasselbe wie das Abtasten aus dem Standard- Implex nach der Gaußschen Verteilung, …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.