Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren



2
Wie lässt sich richtig bestimmen, welche Merkmale am meisten zur Vorhersage eines bestimmten Eingabevektors beigetragen haben?
Ich verwende die logistische Regression für die binäre Klassifizierung. Ich habe einen großen Datensatz (zufällig sehr unausgeglichen: 19: 1). Also benutze ich Scikit-Learns LogisticRegression(), um 80% meiner beschrifteten Daten zu trainieren, und validierte dann mit den anderen 20% (ich habe mir den Bereich unter ROC sowie den Präzisionsrückruf angesehen, weil …

1
Bestellstatistik für die Betaverteilung
Sei iid und zieht aus B e t a ( kx1, … , X.nx1,…,xnx_1,\dots,x_n. Wie sind die Statistiken für minimale und maximale Bestellungen verteilt?B e t a ( k2, k - p - 12)Beta(k2,k−p−12)Beta\left(\frac{k}2,\frac{k-p-1}{2}\right) Ich würde mich sehr über eine Referenz freuen, wenn dies möglich ist. Im Allgemeinen bin ich …

2
Sei
Ich lerne gerade selbst in der linearen Modelltheorie und finde es überraschend, dass für einen Zufallsvektor definiert ist , außer der Kovarianzmatrix werden keine weiteren Momente erwähnt.Y = [ y 1 y 2 ⋮ y n ]E [ Y ]E[Y]\mathbb{E}[\mathbf{Y}]Y = ⎡⎣⎢⎢⎢⎢y1y2⋮yn⎤⎦⎥⎥⎥⎥Y=[y1y2⋮yn]\mathbf{Y} = \begin{bmatrix} y_1 \\ y_2 \\ \vdots \\ …



3
KNN: 1 nächster Nachbar
Meine Frage bezieht sich auf den 1-nächsten Nachbarn-Klassifikator und auf eine Aussage, die in dem ausgezeichneten Buch Die Elemente des statistischen Lernens von Hastie, Tibshirani und Friedman gemacht wurde. Die Aussage lautet (S. 465, Abschnitt 13.3): "Da nur der Trainingspunkt verwendet wird, der dem Abfragepunkt am nächsten liegt, ist die …

5
Warum (und wann) muss man die Belohnungsfunktion aus Stichproben beim Verstärkungslernen lernen?
Beim verstärkten Lernen haben wir eine Belohnungsfunktion, die den Agenten darüber informiert, wie gut seine aktuellen Aktionen und Zustände sind. In einigen allgemeinen Einstellungen ist die Belohnungsfunktion eine Funktion von drei Variablen: Aktueller ZustandS.SS Aktuelle Aktion im aktuellen Zustandπ( s ) = aπ(s)=a\pi(s) = a Nächster ZustandS.'S′S' Es sieht also …

2
Vektorisierung des Kreuzentropieverlustes
Ich habe es mit einem Problem zu tun, das mit dem Finden des Gradienten der Kreuzentropieverlustfunktion für den Parameter θθ\theta wobei: CE(θ)=−∑iyi∗log(y^i)CE(θ)=−∑iyi∗log(y^i)CE(\theta) = -\sum\nolimits_{i}{y_i*log({\hat{y}_{i}})} Wobei y i = s o f t m ein x ( θ i ) und θ i ist ein Vektoreingang.y^i=softmax(θi)y^i=softmax(θi)\hat{y}_{i} = softmax(\theta_i)θiθi\theta_i Auch yyy ist …

1
Geschlossene Form für
Wir wissen, dass wenn , dann wobei ist die Digamma-Funktion. Gibt es eine einfache Form für ?p∼Beta(α,β)p∼Beta(α,β)p \sim Beta(\alpha, \beta)E[lnp]=ψ(α)−ψ(α+β)E[ln⁡p]=ψ(α)−ψ(α+β) \mathbb{E}[\ln p] = \psi(\alpha) - \psi(\alpha + \beta) ψ(.)ψ(.)\psi(.)E[ln(1−p)]E[ln⁡(1−p)] \mathbb{E}[\ln (1-p)]

1
Lineare Diskriminanzanalyse für
Ich studiere 'Einführung in das statistische Lernen' von James, Witten, Hastie, Tibshirani. Auf Seite 139 ihres Buches begannen sie mit der Einführung des Bayes-Theorems . ist keine mathematische Konstante, sondern bezeichnet die vorherige Wahrscheinlichkeit. In dieser Gleichung ist nichts seltsam. πpk(X)=P(Y=k|X=x)=πkfk(x)∑kl=1πlfl(x)pk(X)=P(Y=k|X=x)=πkfk(x)∑l=1kπlfl(x)p_k(X)=P(Y=k|X=x) = \dfrac{\pi_kf_k(x)}{\sum_{l=1}^k \pi_l f_l(x)}ππ\pi Das Buch behauptet, dass es …


1
Lambda-Bereich in elastischer Netzregression
\def\l{|\!|} Angesichts der elastischen Netzregression minb12||y−Xb||2+αλ||b||22+(1−α)λ||b||1minb12||y−Xb||2+αλ||b||22+(1−α)λ||b||1\min_b \frac{1}{2}\l y - Xb \l^2 + \alpha\lambda \l b\l_2^2 + (1 - \alpha) \lambda \l b\l_1 Wie kann ein geeigneter Bereich von λλ\lambda für die Kreuzvalidierung ausgewählt werden? Im Fall α=1α=1\alpha=1 (Gratregression) die Formel dof=∑js2js2j+λdof=∑jsj2sj2+λ\textrm{dof} = \sum_j \frac{s_j^2}{s_j^2+\lambda} kann verwendet werden, um für jedes …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.