Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Vergleich von Ranglisten
Angenommen, zwei Gruppen, bestehend aus und jeweils einen Satz von 25 Elementen von den wichtigsten bis zu den unwichtigsten. Wie lassen sich diese Rankings am besten vergleichen?n 2n1n1n_1n2n2n_2 Natürlich ist es möglich, 25 Mann-Whitney-U-Tests durchzuführen, aber dies würde zu 25 zu interpretierenden Testergebnissen führen, was zu viel sein kann (und …

1
Entfernungskorrelation versus gegenseitige Information
Ich habe einige Zeit mit der gegenseitigen Information gearbeitet. Aber ich habe in der "Korrelationswelt" ein sehr neues Maß gefunden, das auch zur Messung der Verteilungsunabhängigkeit verwendet werden kann, die sogenannte "Distanzkorrelation" (auch Brownsche Korrelation genannt): http://en.wikipedia.org/wiki/Brownian_covariance . Ich habe die Papiere überprüft, in denen diese Maßnahme eingeführt wurde, ohne …

2
Warum ist der Mann-Whitney-U-Test signifikant, wenn die Mediane gleich sind?
Ich habe Ergebnisse aus einem Mann-Whitney-Rangtest erhalten, die ich nicht verstehe. Der Median der 2 Populationen ist identisch (6.9). Die oberen und unteren Quantile jeder Population sind: 6,64 & 7,2 6,60 & 7,1 Der aus dem Vergleich dieser Populationen resultierende p-Wert beträgt 0,007. Wie können diese Populationen signifikant unterschiedlich sein? …


1
Was sind die schärfsten bekannten Schwanzgrenzen für
Sei eine Chi-Quadrat-verteilte Zufallsvariable mit k Freiheitsgraden. Was sind die schärfsten bekannten Grenzen für die folgenden Wahrscheinlichkeiten?X~ χ2kX∼χk2X \sim \chi^2_kkkk P [X&gt; t ] ≤ 1 - δ1( t , k )P[X&gt;t]≤1-δ1(t,k) \mathbb{P}[X > t] \leq 1 - \delta_1(t, k) und P [X&lt; z]≤1−δ2(z,k)P[X&lt;z]≤1−δ2(z,k) \mathbb{P}[X < z] \leq 1 - …




2
Warum müssen Sie Daten in KNN skalieren?
Könnte mir bitte jemand erklären, warum Sie Daten normalisieren müssen, wenn Sie K nächste Nachbarn verwenden. Ich habe versucht, dies nachzuschlagen, aber ich kann es immer noch nicht verstehen. Ich habe folgenden Link gefunden: https://discuss.analyticsvidhya.com/t/why-it-is-necessary-to-normalize-in-knn/2715 Aber in dieser Erklärung verstehe ich nicht, warum ein größerer Bereich in einem der Merkmale …

5
Erklärung der Yolo-Loss-Funktion
Ich versuche die Yolo v2-Verlustfunktion zu verstehen: λc o o r d∑i = 0S2∑j = 0B1o b jich j[ ( xich- x^ich)2+ ( yich−y^i)2]+λcoord∑i=0S2∑j=0B1objij[(wi−−√−w^i−−√)2+(hi−−√−h^i−−√)2]+∑i=0S2∑j=0B1objij(Ci−C^i)2+λnoobj∑i=0S2∑j=0B1noobjij(Ci−C^i)2+∑i=0S21obji∑c∈classes(pi(c)−p^i(c))2λcoord∑i=0S2∑j=0B1ijobj[(xi−x^i)2+(yi−y^i)2]+λcoord∑i=0S2∑j=0B1ijobj[(wi−w^i)2+(hi−h^i)2]+∑i=0S2∑j=0B1ijobj(Ci−C^i)2+λnoobj∑i=0S2∑j=0B1ijnoobj(Ci−C^i)2+∑i=0S21iobj∑c∈classes(pi(c)−p^i(c))2\begin{align} &\lambda_{coord} \sum_{i=0}^{S^2}\sum_{j=0}^B \mathbb{1}_{ij}^{obj}[(x_i-\hat{x}_i)^2 + (y_i-\hat{y}_i)^2 ] \\&+ \lambda_{coord} \sum_{i=0}^{S^2}\sum_{j=0}^B \mathbb{1}_{ij}^{obj}[(\sqrt{w_i}-\sqrt{\hat{w}_i})^2 +(\sqrt{h_i}-\sqrt{\hat{h}_i})^2 ]\\ &+ \sum_{i=0}^{S^2}\sum_{j=0}^B \mathbb{1}_{ij}^{obj}(C_i - \hat{C}_i)^2 + \lambda_{noobj}\sum_{i=0}^{S^2}\sum_{j=0}^B \mathbb{1}_{ij}^{noobj}(C_i - \hat{C}_i)^2 \\ &+ \sum_{i=0}^{S^2} \mathbb{1}_{i}^{obj}\sum_{c …

3
Keine überhöhten Verteilungen, was sind sie wirklich?
Ich habe Mühe, keine überhöhten Verteilungen zu verstehen. Was sind Sie? Was ist der Sinn? Wenn ich Daten mit vielen Nullen habe, könnte ich eine logistische Regression anpassen, zuerst die Wahrscheinlichkeit von Nullen berechnen und dann alle Nullen entfernen und dann eine reguläre Regression mithilfe meiner Verteilungswahl anpassen (Poisson z. …



1
Wirkt sich der Fluch der Dimensionalität auf einige Modelle stärker aus als auf andere?
Die Stellen, die ich über den Fluch der Dimensionalität gelesen habe, erklären ihn hauptsächlich in Verbindung mit kNN und linearen Modellen im Allgemeinen. Ich sehe regelmäßig Spitzenreiter in Kaggle, die Tausende von Funktionen in einem Datensatz verwenden, der kaum 100.000 Datenpunkte enthält. Sie verwenden unter anderem hauptsächlich Boosted-Bäume und NN. …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.