Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Ist die Aufteilung der Daten in Test- und Trainingssätze eine reine Statistiksache?
Ich bin ein Physikstudent, der maschinelles Lernen / Datenwissenschaft studiert, daher meine ich nicht, dass diese Frage Konflikte auslöst :) Ein großer Teil eines Physik-Bachelor-Programms besteht jedoch darin, Labore / Experimente durchzuführen, was eine Menge Daten bedeutet Verarbeitung und statistische Analyse. Ich bemerke jedoch einen starken Unterschied zwischen der Art …

2
Gegenseitige Information als Wahrscheinlichkeit
Könnte die gegenseitige Information über die Gelenkentropie: 0≤I(X,Y)H(X,Y)≤10≤I(X,Y)H(X,Y)≤1 0 \leq \frac{I(X,Y)}{H(X,Y)} \leq 1 definiert werden als: "Die Wahrscheinlichkeit, eine Information von X nach Y zu übermitteln"? Es tut mir leid, dass ich so naiv bin, aber ich habe noch nie Informationstheorie studiert, und ich versuche nur, einige Konzepte davon zu …

1
RandomForest- und Klassengewichte
Frage in einem Satz: Weiß jemand, wie man gute Klassengewichte für einen zufälligen Wald bestimmt? Erläuterung: Ich spiele mit unausgeglichenen Datensätzen herum. Ich möchte das RPaket randomForestverwenden, um ein Modell auf einem sehr verzerrten Datensatz mit nur wenigen positiven und vielen negativen Beispielen zu trainieren. Ich weiß, es gibt andere …
11 r  random-forest 

1
Warum sollte Netflix von seinem Fünf-Sterne-Bewertungssystem zu einem Like / Dislike-System wechseln?
Netflix stützte seine Vorschläge auf die von einem Benutzer eingereichten Bewertungen anderer Filme / Shows. Dieses Bewertungssystem hatte fünf Sterne. Mit Netflix können Benutzer jetzt Filme / Shows mögen / nicht mögen (Daumen hoch / Daumen runter). Sie behaupten, es sei einfacher, Filme zu bewerten. Wäre diese 2-Wege-Klassifizierung nicht statistisch …



2
Sollte ich nicht signifikante Ergebnisse melden?
Ich habe einen Kruskal-Wallis-Test durchgeführt, und für einige der Fragen ist der p-Wert nicht signifikant. Würde ich dies auf die gleiche Weise melden, als ob es signifikant wäre, unter Angabe von df, Teststatistik und p-Wert? Es wäre also so etwas wie ein Kruskal-Wallis-Test, aber es wurde festgestellt, dass die Ergebnisse …

2
Das geometrische Mittel ist ein unvoreingenommener Schätzer für den Mittelwert welcher kontinuierlichen Verteilung?
Gibt es eine kontinuierliche Verteilung, die in geschlossener Form ausgedrückt werden kann und deren Mittelwert so ist, dass der geometrische Mittelwert der Stichproben ein unverzerrter Schätzer für diesen Mittelwert ist? Update: Ich habe gerade festgestellt, dass meine Stichproben positiv sein müssen (sonst existiert das geometrische Mittel möglicherweise nicht), sodass Kontinuierlich …

1
Wie man die Ergebnisse interpretiert, wenn sowohl Grat als auch Lasso getrennt gut abschneiden, aber unterschiedliche Koeffizienten erzeugen
Ich führe sowohl mit Lasso als auch mit Ridge ein Regressionsmodell durch (um eine diskrete Ergebnisvariable im Bereich von 0 bis 5 vorherzusagen). Bevor ich das Modell ausführe, verwende ich die SelectKBestMethode scikit-learn, um den Funktionsumfang von 250 auf 25 zu reduzieren . Ohne eine anfängliche Merkmalsauswahl ergeben sowohl Lasso …

2
Wie aktualisiert der Minibatch-Gradientenabstieg die Gewichte für jedes Beispiel in einem Stapel?
Wenn wir beispielsweise 10 Beispiele in einem Stapel verarbeiten, können wir meines Erachtens den Verlust für jedes Beispiel summieren. Wie funktioniert die Rückausbreitung in Bezug auf die Aktualisierung der Gewichte für jedes Beispiel? Beispielsweise: Beispiel 1 -> Verlust = 2 Beispiel 2 -> Verlust = -2 Dies führt zu einem …


2
Lesen von Box-and-Whisker-Plots: Möglich, signifikante Unterschiede zwischen Gruppen festzustellen?
Angenommen, wir sehen uns diese Box-and-Whisker-Handlung an: Ich denke, zwischen Donnerstag und Freitag sind sich die meisten einig, dass es einen signifikanten Unterschied in der Schlafenszeit zu geben scheint. Ist das aber eine statistisch gültige Vermutung? Können wir signifikante Unterschiede feststellen, da sich keiner der Bereiche des inneren Quartils zwischen …


2
Wenn die Schrumpfung auf clevere Weise angewendet wird, funktioniert sie für effizientere Schätzer immer besser?
Angenommen , ich habe zwei Schätzern ß 1 und β 2 , die konsistente Schätzer des gleichen Parameters β 0 und so , dass √βˆ1β^1\widehat{\beta}_1βˆ2β^2\widehat{\beta}_2β0β0\beta_0n−−√(βˆ1−β0)→dN(0,V1),n−−√(βˆ2−β0)→dN(0,V2)n(β^1−β0)→dN(0,V1),n(β^2−β0)→dN(0,V2)\sqrt{n}(\widehat{\beta}_1 -\beta_0) \stackrel{d}\rightarrow \mathcal{N}(0, V_1), \quad \sqrt{n}(\widehat{\beta}_2 -\beta_0) \stackrel{d}\rightarrow \mathcal{N}(0, V_2) mitV1≤V2V1≤V2V_1 \leq V_2in dem psd Sinne. Somit asymptotisch β 1ist effizienter als β 2. Diese …

1
Generalisierungsgrenzen für SVM
Ich interessiere mich für theoretische Ergebnisse für die Verallgemeinerungsfähigkeit von Support Vector Machines, z. B. Grenzen der Wahrscheinlichkeit von Klassifizierungsfehlern und der Vapnik-Chervonenkis (VC) -Dimension dieser Maschinen. Beim Lesen der Literatur hatte ich jedoch den Eindruck, dass sich einige ähnliche wiederkehrende Ergebnisse von Autor zu Autor geringfügig unterscheiden, insbesondere in …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.