Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Vergleich hierarchischer Cluster-Dendrogramme, die mit unterschiedlichen Entfernungen und Methoden erhalten wurden
[Der ursprüngliche Titel "Ähnlichkeitsmessung für hierarchische Clusterbäume" wurde später von @ttnphns geändert, um das Thema besser widerzuspiegeln.] Ich führe eine Reihe von hierarchischen Clusteranalysen für einen Datenrahmen von Patientenakten durch (z. B. ähnlich wie http://www.biomedcentral.com/1471-2105/5/126/figure/F1?highres=y ). Ich experimentiere mit verschiedenen Distanzmaßen , verschiedenen Parametergewichten und verschiedenen hierarchischen Methoden , um …

3
Wie erhält man einen "gesamten" p-Wert und eine Effektgröße für einen kategorialen Faktor in einem gemischten Modell (lme4)?
Ich möchte einen p-Wert und eine Effektgröße einer unabhängigen kategorialen Variablen (mit mehreren Ebenen) erhalten - das ist "insgesamt" und nicht für jede Ebene separat, wie es die normale Ausgabe von lme4in R ist. Es ist genau wie das, was die Leute berichten, wenn sie eine ANOVA betreiben. Wie kann …

3
Was bedeutet "unabhängige Beobachtung"?
Ich versuche zu verstehen, was die Annahme unabhängiger Beobachtungen bedeutet. Einige Definitionen sind: "Zwei Ereignisse sind genau dann unabhängig, wenn ." ( Statistisches Wörterbuch )P(a∩b)=P(a)∗P(b)P(a∩b)=P(a)∗P(b)P(a \cap b) = P(a) * P(b) "Das Eintreten eines Ereignisses ändert nicht die Wahrscheinlichkeit für ein anderes" ( Wikipedia ). "Die Auswahl einer Beobachtung hat …


1
Maximum-Likelihood-Schätzer für eine abgeschnittene Verteilung
Man betrachte unabhängige Stichproben die aus einer Zufallsvariablen , von der angenommen wird, dass sie einer abgeschnittenen Verteilung (z. B. einer abgeschnittenen Normalverteilung ) bekannter (endlicher) Minimal- und Maximalwerte und aber unbekannter Parameter und folgen . Wenn einer nicht abgeschnittenen Verteilung folgt, wären die Maximum-Likelihood-Schätzer und für und aus der …

7
Statistikkonzept, um zu erklären, warum es weniger wahrscheinlich ist, dass Sie die gleiche Anzahl von Köpfen und Schwänzen umdrehen, wenn die Anzahl der Umdrehungen zunimmt?
Ich arbeite daran, Wahrscheinlichkeit und Statistik zu lernen, indem ich ein paar Bücher lese und Code schreibe, und während ich Münzwürfe simuliere, bemerke ich etwas, das meiner naiven Intuition leicht widerspricht. Wenn Sie mal eine faire Münze werfen, konvergiert das Verhältnis von Kopf zu Zahl gegen 1, wenn zunimmt, genau …

1
XGBoost Loss Funktion Approximation mit Taylor Expansion
Nehmen Sie als Beispiel die objektive Funktion des XGBoost-Modells in der ttt -ten Iteration: L(t)=∑i=1nℓ(yi,y^(t−1)i+ft(xi))+Ω(ft)L(t)=∑i=1nℓ(yi,y^i(t−1)+ft(xi))+Ω(ft)\mathcal{L}^{(t)}=\sum_{i=1}^n\ell(y_i,\hat{y}_i^{(t-1)}+f_t(\mathbf{x}_i))+\Omega(f_t) where ℓℓ\ell is the loss function, ftftf_t is the ttt'th tree output and ΩΩ\Omega is the regularization. One of the (many) key steps for fast calculation is the approximation: L(t)≈∑i=1nℓ(yi,y^(t−1)i)+gtft(xi)+12hif2t(xi)+Ω(ft),L(t)≈∑i=1nℓ(yi,y^i(t−1))+gtft(xi)+12hift2(xi)+Ω(ft),\mathcal{L}^{(t)}\approx \sum_{i=1}^n\ell(y_i,\hat{y}_i^{(t-1)})+g_tf_t(\mathbf{x}_i)+\frac{1}{2}h_if_t^2(\mathbf{x}_i)+\Omega(f_t), where gigig_i and hihih_i …

3
Was sind einige illustrative Anwendungen der empirischen Wahrscheinlichkeit?
Ich habe von Owens empirischer Wahrscheinlichkeit gehört, habe sie aber bis vor kurzem nicht beachtet, bis ich auf sie in einem Papier von Interesse gestoßen bin ( Mengersen et al. 2012 ). Um es zu verstehen, habe ich herausgefunden, dass die Wahrscheinlichkeit der beobachteten Daten als , wobei und .L=∏ipi=∏iP(Xi=x)=∏iP(Xi≤x)−P(Xi<x)L=∏ipi=∏iP(Xi=x)=∏iP(Xi≤x)−P(Xi<x)L …

7
Warum und wann ein R-Paket erstellen?
Ich verstehe, dass diese Frage recht weit gefasst ist, aber ich frage mich, was die entscheidenden Punkte für die Entscheidung sein sollten, ein neues Paket für R zu erstellen (oder nicht). Um genauer zu sein, möchte ich hinzufügen, dass es bei der Frage nicht um die Gründe geht Verwenden Sie …
28 r  software 





4
Selbststudium gegen eine unterrichtete Ausbildung?
Es gibt eine Frage mit ähnlicher Absicht für Programmierer . Diese Frage hat einige recht gute Antworten, aber das allgemeine Thema scheint zu sein, dass man ohne Selbststudium nirgendwo hinkommt. Offensichtlich gibt es einen großen Unterschied zwischen Programmieren und Statistik - beim Programmieren lernt man eigentlich nur eine grundlegende Logik …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.