Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Was ist die Geschichte der Box-Plots und wie hat sich das Design von „Box and Whiskers“ entwickelt?
Viele Quellen datieren das klassische „Box - Plot“ Design John Tukey und seine „schematische Handlung“ von 1970. Das Design relativ statisch geblieben zu sein scheint seither mit Edward Tufte des abgespeckte Version des Box - Plot Fehlern zu fangen, während Geigenhandlungen - obwohl eine informativere Variante der Boxhandlung - sind …

4
Warum verbessert das Erhöhen der Stichprobengröße der Münzwürfe nicht die normale Kurvenannäherung?
Ich lese das Statistikbuch (Freeman, Pisani, Purves) und versuche, ein Beispiel zu reproduzieren, in dem eine Münze etwa 50 Mal geworfen wird, die Anzahl der Köpfe gezählt wird und dies etwa 1.000 Mal wiederholt wird. Zuerst habe ich die Anzahl der Würfe (Stichprobengröße) bei 1000 gehalten und die Wiederholungen erhöht. …

2
Warum führt die Minimierung der MAE zur Vorhersage des Medians und nicht des Mittelwerts?
Aus dem Lehrbuch „ Forecasting: Principles and Practice“ von Rob J. Hyndman und George Athanasopoulos , insbesondere der Abschnitt zur Genauigkeitsmessung : Eine Prognosemethode, die den MAE minimiert, führt zu Prognosen des Medians, während die Minimierung des RMSE zu Prognosen des Mittelwerts führt Kann jemand intuitiv erklären, warum die Minimierung …
19 forecasting  mean  median  rms  mae 



4
Beziehungen zwischen Korrelation und Kausalität
Aus der Wikipedia-Seite mit dem Titel Korrelation impliziert nicht Kausalität , Für zwei beliebige korrelierte Ereignisse, A und B, umfassen die verschiedenen möglichen Beziehungen: A verursacht B (direkte Ursache); B verursacht A (umgekehrte Ursache); A und B sind Konsequenzen einer gemeinsamen Ursache, verursachen sich aber nicht gegenseitig; A und B …


1
Nicht parametrischer Test, wenn zwei Proben aus derselben Verteilung gezogen wurden
Ich möchte die Hypothese testen, dass zwei Stichproben aus derselben Grundgesamtheit stammen, ohne Annahmen über die Verteilung der Stichproben oder der Grundgesamtheit zu treffen. Wie soll ich das machen? Aus Wikipedia ist mein Eindruck, dass der Mann Whitney U-Test geeignet sein sollte, aber er scheint in der Praxis nicht für …


5
Wenn der zentrale Grenzwertsatz und das Gesetz der großen Zahlen nicht übereinstimmen
Dies ist im Wesentlichen eine Replikation einer Frage, die ich bei math.se gefunden habe und die nicht die Antworten bekam, auf die ich gehofft hatte. Sei eine Folge von unabhängigen, identisch verteilten Zufallsvariablen mit und .{Xi}i∈N{Xi}i∈N\{ X_i \}_{i \in \mathbb{N}}E[Xi]=1E[Xi]=1\mathbb{E}[X_i] = 1V[Xi]=1V[Xi]=1\mathbb{V}[X_i] = 1 Betrachten Sie die Bewertung von limn→∞P(1n−−√∑i=1nXi≤n−−√)limn→∞P(1n∑i=1nXi≤n) …


4
Unterschied zwischen RNN und LSTM / GRU
Ich versuche, verschiedene RNN-Architekturen (Recurrent Neural Network) zu verstehen, die auf Zeitreihendaten angewendet werden sollen, und bin etwas verwirrt mit den verschiedenen Namen, die häufig bei der Beschreibung von RNNs verwendet werden. Ist die Struktur von Langzeitspeicher (LSTM) und Gated Recurrent Unit (GRU) im Wesentlichen ein RNN mit einer Rückkopplungsschleife?

3
Wie ist
Die kartesischen Koordinaten eines zufälligen Punktes seien st .x,yx,yx,y(x,y)∼U(−10,10)×U(−10,10)(x,y)∼U(−10,10)×U(−10,10)(x,y) \sim U(-10,10) \times U(-10,10) Somit ist der Radius, , nicht gleichmäßig verteilt , wie angedeutet durch ‚s pdf .ρ=x2+y2−−−−−−√ρ=x2+y2\rho = \sqrt{x^2 + y^2}ρρ\rho Trotzdem würde ich erwarten, dass nahezu einheitlich ist, ohne Artefakte aufgrund der 4 Reste an den Rändern:θ=arctanyxθ=arctan⁡yx\theta = …

2
Multilabel-Klassifizierungsmetriken für Scikit
Ich versuche, einen Multi-Label-Klassifikator zu erstellen, um vorhandenen Dokumenten mithilfe von Scikit Themen zuzuweisen Ich bearbeite meine Dokumente, indem ich sie über TfidfVectorizerdie Etiketten durch die MultiLabelBinarizerund OneVsRestClassifiermit einerSGDClassifier als Schätzer erstellte. Beim Testen meines Klassifikators erhalte ich jedoch nur Punkte bis zu 0,29 , was nach meiner Lektüre für …

3
Ist ein Entscheidungsstumpf ein lineares Modell?
Entscheidungsstumpf ist ein Entscheidungsbaum mit nur einer Teilung. Es kann auch als stückweise Funktion geschrieben werden. Angenommen, ist ein Vektor und ist die erste Komponente von . Bei der Regressionseinstellung kann es sich um einen Entscheidungsstumpf handelnx 1 xxxxx1x1x_1xxx f( x ) = { 35x1≤ 2x1> 2f(x)={3x1≤25x1>2f(x)= \begin{cases} 3& x_1\leq …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.