Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


4
Was ist der Unterschied zwischen kleinsten Quadraten und pseudoinversen Techniken für die lineare Regression?
Ich wundere mich über den Unterschied zwischen ihnen. Grundsätzlich erledigen sie am Ende die gleiche Aufgabe, indem sie Parameterkoeffizienten finden, aber sie sehen genauso anders aus, wie wir die Koeffizienten finden. Für mich scheint die Methode der kleinsten Quadrate Differenzierung und Matrixform zu verwenden, um die Koeffizienten zu finden, und …

2
Wie verwende ich XGboost.cv mit der Optimierung von Hyperparametern?
Ich möchte die Hyperparameter von XGboost mithilfe der Kreuzvalidierung optimieren. Es ist jedoch nicht klar, wie man das Modell erhält xgb.cv. Zum Beispiel rufe ich objective(params)von an fmin. Dann wird das Modell montiert dtrainund validiert dvalid. Was ist, wenn ich KFold Crossvalidation verwenden möchte, anstatt zu trainieren dtrain? from hyperopt …

1
Hauptkomponentenanalyse gegen Merkmalsauswahl
Ich mache ein maschinelles Lernprojekt mit WEKA. Es ist eine überwachte Klassifizierung und in meinen grundlegenden Experimenten habe ich ein sehr schlechtes Maß an Genauigkeit erreicht. Dann wollte ich eine Funktionsauswahl treffen, aber dann hörte ich von PCA. Bei der Merkmalsauswahl berücksichtigen wir eine Teilmenge von Attributen, die den größten …

1
Beziehung zwischen Gramm- und Kovarianzmatrizen
Für ein n × pn×pn\times p Matrix X.XX, wo p ≫ np≫np \gg n, wie ist die Beziehung zwischen X.T.X.XTXX^{T}X (Streumatrix, auf der die Kovarianzmatrix basiert) und X.X.T.XXTXX^{T} (äußeres Produkt manchmal Gram-Matrix genannt)? Wenn einer bekannt ist, wie ist es möglich , den anderen zu erhalten (das Beste, was man …




1
Interpretation der Zeitreihenzerlegung mit TBATS aus dem R-Prognosepaket
Ich möchte die folgenden Zeitreihendaten in saisonale, Trend- und Restkomponenten zerlegen. Die Daten sind ein stündliches Kühlenergieprofil eines Geschäftsgebäudes: TotalCoolingForDecompose.ts <- ts(TotalCoolingForDecompose, start=c(2012,3,18), freq=8765.81) plot(TotalCoolingForDecompose.ts) Es gibt offensichtliche tägliche und wöchentliche saisonale Effekte, basierend auf den Ratschlägen von: Wie zerlegt man eine Zeitreihe mit mehreren saisonalen Komponenten? Ich habe die …


2
Lösung für das deutsche Panzerproblem
Gibt es einen formalen mathematischen Beweis dafür , dass die Lösung den German Tank Problem ist eine Funktion von nur der Parameter k (Anzahl der beobachteten Proben) und m (Maximalwert unter beobachteten Proben)? Kann man also mit anderen Worten beweisen, dass die Lösung neben dem Maximalwert unabhängig von den anderen …

1
Ist MLE von asymptotisch normal, wenn ?
Angenommen, hat das PDF(X,Y)(X,Y)(X,Y) fθ(x,y)=e−(x/θ+θy)1x>0,y>0,θ>0fθ(x,y)=e−(x/θ+θy)1x>0,y>0,θ>0f_{\theta}(x,y)=e^{-(x/\theta+\theta y)}\mathbf1_{x>0,y>0}\quad,\,\theta>0 Die Dichte der Stichprobe die aus dieser Population gezogen wird, ist daher(X,Y)=(Xi,Yi)1≤i≤n(X,Y)=(Xi,Yi)1≤i≤n(\mathbf X,\mathbf Y)=(X_i,Y_i)_{1\le i\le n} gθ(x,y)=∏i=1nfθ(xi,yi)=exp[−∑i=1n(xiθ+θyi)]1x1,…,xn,y1,…,yn>0=exp[−nx¯θ−θny¯]1x(1),y(1)>0,θ>0gθ(x,y)=∏i=1nfθ(xi,yi)=exp⁡[−∑i=1n(xiθ+θyi)]1x1,…,xn,y1,…,yn>0=exp⁡[−nx¯θ−θny¯]1x(1),y(1)>0,θ>0\begin{align} g_{\theta}(\mathbf x,\mathbf y)&=\prod_{i=1}^n f_{\theta}(x_i,y_i) \\&=\exp\left[{-\sum_{i=1}^n\left(\frac{x_i}{\theta}+\theta y_i\right)}\right]\mathbf1_{x_1,\ldots,x_n,y_1,\ldots,y_n>0} \\&=\exp\left[-\frac{n\bar x}{\theta}-\theta n\bar y\right]\mathbf1_{x_{(1)},y_{(1)}>0}\quad,\,\theta>0 \end{align} Der Maximum-Likelihood-Schätzer von θθ\theta kann abgeleitet werden als θ^(X,Y)=X¯¯¯¯Y¯¯¯¯−−−√θ^(X,Y)=X¯Y¯\hat\theta(\mathbf X,\mathbf Y)=\sqrt\frac{\overline X}{\overline Y} Ich möchte wissen, …

1
Wiederholte Maßnahmen anova: lm vs lmer
Ich versuche, mehrere Interaktionstests zwischen beiden lmund lmerwiederholten Messungen (2x2x2) zu reproduzieren. Der Grund, warum ich beide Methoden vergleichen möchte, ist, dass das GLM von SPSS für wiederholte Messungen genau die gleichen Ergebnisse liefert wie der lmhier vorgestellte Ansatz. Am Ende möchte ich SPSS mit R-lmer vergleichen. Bisher habe ich …


5
Warum sollte Binning um jeden Preis vermieden werden?
Deshalb habe ich ein paar Beiträge darüber gelesen, warum Binning immer vermieden werden sollte. Eine beliebte Referenz für diese Behauptung ist dieser Link . Das Hauptproblem besteht darin, dass die Binning-Punkte (oder Cutpoints) sowie der daraus resultierende Informationsverlust eher willkürlich sind und dass Splines bevorzugt werden sollten. Derzeit arbeite ich …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.