Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Ist die Student-t-Verteilung eine stabile Lévy-Verteilung?
Lassen Sie eine Student-t-Verteilung haben, so dass XXXfX(x|ν,μ,β)=Γ(ν+12)Γ(ν2)πν−−√β(1+1ν(x−μβ)2)−1+ν2fX(x|ν,μ,β)=Γ(ν+12)Γ(ν2)πνβ(1+1ν(x−μβ)2)−1+ν2\begin{align*} f_X(x|\nu ,\mu ,\beta) = \frac{\Gamma (\frac{\nu+1}{2})}{\Gamma (\frac{\nu}{2}) \sqrt{\pi \nu} \beta} \left(1+\frac{1}{\nu}\left(\frac{x - \mu}{\beta}\right)^2 \right)^{\text{$-\frac{1+\nu}{2}$}} \end{align*} Ich weiß, dass Student-t-Verteilungen ein Potenzgesetz im Schwanz zeigen. Ich weiß auch, dass Lévy stabile Verteilungen (zB mit folgender charakteristischer Funktion: ϕ(t|α,β,c,μ)=exp[itμ−|ct|α(1−iβsgn(t)Φ)]ϕ(t|α,β,c,μ)=exp[itμ−|ct|α(1−iβsgn(t)Φ)]\begin{align*} \phi(t|\alpha ,\beta, c ,\mu) = …

1
Bibliographie für lineare Modelle
Meine Hauptfrage: Welche Bibliographie würden Sie für die Theorie linearer Modelle empfehlen? Ich denke darüber nach, Flugzeugantworten auf komplexe Fragen zu erhalten: die Theorie der linearen Modelle von Ronald Christensen. Hat es hier jemals jemand gelesen? Was sind die Vor- und Nachteile des Buches? Ist die Briefgröße angemessen? Das mag …


3
GLM mit Logit-Link und Gaußscher Familie zur Vorhersage eines kontinuierlichen DV zwischen 0 und 1
Können Sie einen GLM über eine Logit-Verbindung mit einem kontinuierlichen DV (zwischen 0 und 1) ausführen? Im Allgemeinen wird empfohlen, eine Binomialfamilie mit einem Logit-Link zu verwenden, aber ich vermute, das liegt daran, dass das Modell einen binären DV annimmt. Wenn wir eine kontinuierliche DV haben, möchten wir eine Gaußsche …

1
Effektive Freiheitsgrade
Können wir die Spur der Hutmatrix im Falle einer Kernelregression für die effektiven Freiheitsgrade verwenden? Wo wir die Hutmatrix erhalten, H als: H=y^∗y+H=y^∗y+H = \hat{y} * y^+ wo y^y^\hat{y} ist die vorhergesagten Antwortwerte, y+y+y^+ ist die Pseudo-Inverse von yyy.


1
Verteilung einer quadratischen Form, nicht zentrale Chi-Quadrat-Verteilung
Definition . Angenommen, y∼N(μ,In×n)y∼N(μ,In×n)\mathbf{y} \sim \mathcal{N}(\boldsymbol{\mu}, I_{n \times n}) . Dann ist w=yTy=∥y∥2∼χ2n(θ=∥μ∥2/2=μTμ/2),w=yTy=‖y‖2∼χn2(θ=‖μ‖2/2=μTμ/2),w = \mathbf{y}^{T}\mathbf{y} = \|\mathbf{y}\|^2 \sim \chi^{2}_{n}\left(\theta = \|\boldsymbol{\mu}\|^2/2 =\boldsymbol{\mu}^{T}\boldsymbol{\mu}/2 \right)\text{,} dh die χ2χ2\chi^2 Verteilung mit nnn Graden von Freiheits- und Nichtzentralitätsparameter θθ\theta . Ich versuche, (am allerwenigsten) findet einen Beweis des folgenden Satzes: Satz . Angenommen, ΣΣ\Sigma …

1
Ableiten wahrscheinlicher Daten basierend auf anderen verwandten Daten in einem unvollständigen Datensatz
Ich mache meine ersten Schritte in den Bereichen Datenwissenschaft und maschinelles Lernen. Ich experimentiere mit einem Projekt, bei dem ich keine Ahnung habe, mit welchen Ansätzen ich beginnen könnte, daher würde ich mich über Hinweise freuen: Ich habe einen Datensatz (zur Erklärung) der Studienabschlüsse. Der Datensatz ist insofern vollständig, als …

1
Hauptkomponentenanalyse mit Gruppendaten
In meinem Experiment habe ich 30 verschiedene Akzessionen einer Art verwendet. Eine Gruppe ist von Dürre betroffen und die andere Gruppe ist die Kontrolle. Ich habe Daten zu 6 verschiedenen Parametern gesammelt. Ich möchte wissen, welcher Beitritt toleranter oder anfälliger ist, welcher Beitritt von welcher Variablen (Parameter) stärker betroffen ist …


1
Was ist "Multinomial Deviance" im glmnet-Paket?
Ich passe eine multinomiale logistische Regression mit dem glmnet-Paket in R an: library(glmnet) data(MultinomialExample) cvfit=cv.glmnet(x, y, family="multinomial", type.multinomial = "grouped") plot(cvfit) Was ist "Multinomial Deviance" und in welcher Beziehung steht es zu " Multinomial Logloss "?
7 r  multinomial  glmnet 


3
Warum erfolgt die Probenahme aus der posterioren prädiktiven Verteilung?
In einem Bayes'schen Modell wird die posteriore Vorhersageverteilung normalerweise wie folgt geschrieben: p (xn e w∣x1, …xn) =∫∞- ∞p (xn e w∣ μ ) p ( μ ∣ x1, …xn) dμp(xnew∣x1,…xn)=∫- -∞∞p(xnew∣μ) p(μ∣x1,…xn)dμ p(x_{new} \mid x_1, \ldots x_n) = \int_{-\infty}^{\infty} p(x_{new}\mid \mu) \ p(\mu \mid x_1, \ldots x_n)d\mu für einen …
7 bayesian  mcmc  gibbs 

2
Wie kann ich die Leistung einer halbüberwachten Lernmethode beurteilen?
Ich arbeite mit einer halbüberwachten Lernaufgabe, bei der ich nur positive und unbeschriftete Daten habe (PU-Lernen). Ich habe einige Algorithmen getestet und möchte deren Leistung bewerten. Für betreutes Lernen verwende ich normalerweise: Fehlklassifizierungsfehler Richtigkeit ROC-Kurven Leistung zu bewerten. Da meine Trainings- und Validierungssätze jedoch nur positive und unbeschriftete Daten enthalten, …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.