Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren



4
Akzeptanz der Nullhypothese
Dies ist eine Diskussionsfrage zum Schnittpunkt von Statistik und anderen Wissenschaften. Ich stehe oft vor dem gleichen Problem: Forscher auf meinem Gebiet neigen dazu zu sagen, dass es keinen Effekt gibt, wenn der p-Wert nicht unter dem Signifikanzniveau liegt. Anfangs habe ich oft geantwortet, dass dies nicht die Funktionsweise von …

2
Was ist Bayes Error beim maschinellen Lernen?
http://www.deeplearningbook.org/contents/ml.html In diesem Abschnitt wird der Bayes-Fehler wie folgt erläutert Das ideale Modell ist ein Orakel, das einfach die wahre Wahrscheinlichkeitsverteilung kennt, die die Daten erzeugt. Sogar ein solches Modell wird bei vielen Problemen immer noch Fehler verursachen, da möglicherweise immer noch Rauschen in der Verteilung vorhanden ist. Im Fall …


2
Was ist "Grundlinie" in der Präzisionsrückrufkurve
Ich versuche, die Genauigkeits-Rückrufkurve zu verstehen. Ich verstehe, was Präzision und Rückruf sind, aber das, was ich nicht verstehe, ist der "Grundlinien" -Wert. Ich habe diesen Link gelesen https://classeval.wordpress.com/introduction/introduction-to-the-precision-recall-plot/ und ich verstehe den in "Eine Präzisions-Rückruf-Kurve eines perfekten Klassifikators" gezeigten Grundlinienteil nicht. Was macht es? und wie berechnen wir das? …

3
Wie schätzt "predict.randomForest" Klassenwahrscheinlichkeiten?
Wie randomForestschätzt das Paket Klassenwahrscheinlichkeiten, wenn ich verwende predict(model, data, type = "prob")? Ich habe rangerzufällige Gesamtstrukturen mit dem probability = TArgument trainiert , um Wahrscheinlichkeiten vorherzusagen. rangerIn der Dokumentation heißt es: Bauen Sie einen Wahrscheinlichkeitswald wie in Malley et al. (2012). Ich habe einige Daten simuliert und beide Pakete …

1
Welche Mehrfachvergleichsmethode kann für ein älteres Modell verwendet werden: lsmeans oder glht?
Ich analysiere einen Datensatz unter Verwendung eines gemischten Effektmodells mit einem festen Effekt (Bedingung) und zwei zufälligen Effekten (Teilnehmer aufgrund des innerhalb des Motivs und des Paares). Das Modell wurde mit dem erzeugten lme4Paket: exp.model<-lmer(outcome~condition+(1|participant)+(1|pair),data=exp). Als nächstes führte ich einen Likelihood-Ratio-Test dieses Modells gegen das Modell ohne festen Effekt (Bedingung) …


2
Durchschnittlicher ROC für die wiederholte 10-fache Kreuzvalidierung mit Wahrscheinlichkeitsschätzungen
Ich plane, eine wiederholte (10-mal) geschichtete 10-fache Kreuzvalidierung für etwa 10.000 Fälle mithilfe eines Algorithmus für maschinelles Lernen durchzuführen. Jedes Mal wird die Wiederholung mit verschiedenen zufälligen Samen durchgeführt. In diesem Prozess erstelle ich 10 Instanzen von Wahrscheinlichkeitsschätzungen für jeden Fall. 1 Instanz der Wahrscheinlichkeitsschätzung für jede der 10 Wiederholungen …
15 roc 

1
Zufälliges Parameterproblem
Ich bemühe mich immer, die wahre Essenz des Problems der zufälligen Parameter zu finden. Ich habe mehrmals gelesen, dass die Fixeffektschätzer von nichtlinearen Paneldatenmodellen aufgrund des "bekannten" zufälligen Parameterproblems stark verzerrt sein können. Wenn ich nach einer klaren Erklärung für dieses Problem frage, lautet die typische Antwort: Angenommen, die Paneldaten …


1
Was ist "Zielgerichtete maximale Wahrscheinlichkeitserwartung"?
Ich versuche einige Artikel von Mark van der Laan zu verstehen. Er ist ein theoretischer Statistiker in Berkeley, der an Problemen arbeitet, die sich erheblich mit maschinellem Lernen überschneiden. Ein Problem für mich (neben der tiefen Mathematik) ist, dass er häufig bekannte Ansätze des maschinellen Lernens mit einer völlig anderen …


2
Warum ist die Skalierung für die lineare SVM-Klassifizierung wichtig?
Bei der Durchführung der linearen SVM-Klassifizierung ist es häufig hilfreich, die Trainingsdaten zu normalisieren, indem beispielsweise der Mittelwert subtrahiert und durch die Standardabweichung dividiert wird, und anschließend die Testdaten mit dem Mittelwert und der Standardabweichung der Trainingsdaten zu skalieren. Warum ändert dieser Prozess die Klassifizierungsleistung dramatisch?

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.