Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Ausreißer basierend auf dem 2,5-fachen des RMSE fallen lassen
In Kahneman und Deaton (2010) † schreiben die Autoren Folgendes:††^\dagger Diese Regression erklärt 37% der Varianz mit einem quadratischen mittleren Fehler (RMSE) von 0,67852. Um Ausreißer und unplausible Einkommensberichte zu eliminieren, haben wir Beobachtungen fallen gelassen, bei denen der absolute Wert der Differenz zwischen dem Log-Einkommen und seiner Vorhersage das …


5
Philosophische Frage zur logistischen Regression: Warum wird der optimale Schwellenwert nicht trainiert?
Normalerweise passen wir in der logistischen Regression ein Modell an und erhalten einige Vorhersagen zum Trainingssatz. Anschließend validieren wir diese Trainingsvorhersagen (so ähnlich wie hier ) und bestimmen den optimalen Schwellenwert auf der Grundlage der ROC-Kurve. Warum integrieren wir die Quervalidierung des Schwellenwerts nicht in das tatsächliche Modell und trainieren …

2
Ist die Entscheidungsschwelle ein Hyperparameter in der logistischen Regression?
Die vorhergesagten Klassen aus der (binären) logistischen Regression werden unter Verwendung eines Schwellenwerts für die Wahrscheinlichkeiten der Klassenmitgliedschaft bestimmt, die vom Modell generiert werden. Soweit ich weiß, wird standardmäßig 0,5 verwendet. Das Variieren des Schwellenwerts ändert jedoch die vorhergesagten Klassifizierungen. Bedeutet dies, dass die Schwelle ein Hyperparameter ist? Wenn ja, …

4
Was ist der Sinn einer univariaten Regression vor einer multivariaten Regression?
Ich arbeite derzeit an einem Problem, bei dem es sich um einen kleinen Datensatz handelt und bei dem der Kausalitätseffekt einer Behandlung auf das Ergebnis von Interesse ist. Mein Berater hat mich angewiesen, eine univariate Regression für jeden Prädiktor mit dem Ergebnis als Antwort und dann der Behandlungszuweisung als Antwort …

1
Warum ist MLE sinnvoll, wenn die Wahrscheinlichkeit einer einzelnen Stichprobe 0 ist?
Dies ist ein seltsamer Gedanke, den ich hatte, als ich einige alte Statistiken durchgesehen habe, und aus irgendeinem Grund kann ich mir die Antwort nicht vorstellen. Ein fortlaufendes PDF zeigt die Dichte der beobachteten Werte in einem bestimmten Bereich an. Wenn beispielsweise X∼N(μ,σ2)X∼N(μ,σ2)X \sim N(\mu,\sigma^2) ist, dann ist die Wahrscheinlichkeit, …

8
Wie behandelt man unlogische Umfrageantworten?
Ich habe eine Umfrage bei einer Auswahl von Künstlern eingereicht. Eine der Fragen bestand darin, den Prozentsatz des Einkommens anzugeben, der sich ergibt aus: künstlerischer Tätigkeit, staatlicher Unterstützung, privater Rente, Tätigkeiten, die nicht mit Kunst zu tun haben. Ungefähr 65% der Personen haben geantwortet, so dass die Summe des Prozentsatzes …
13 survey  bias 

3
Wann sollte ein GAM vs GLM verwendet werden?
Mir ist klar, dass dies eine potenziell breite Frage ist, aber ich habe mich gefragt, ob es verallgemeinerbare Annahmen gibt, die auf die Verwendung eines GAM (Generalized Additive Model) gegenüber einem GLM (Generalized Linear Model) hinweisen. Jemand sagte mir kürzlich, dass GAMs nur verwendet werden sollten, wenn ich annehme, dass …


3
Entsprechen die Testergebnisse wirklich einer Normalverteilung?
Ich habe versucht zu lernen, welche Distributionen in GLMs verwendet werden sollen, und ich bin ein wenig verwirrt, wann ich die normale Distribution verwenden soll. In einem Teil meines Lehrbuchs heißt es, dass eine Normalverteilung gut für die Modellierung von Prüfungsergebnissen geeignet sein könnte. Im nächsten Teil wird gefragt, welche …


2
Warum wird die Auswahl der besten Teilmenge im Vergleich zu Lasso nicht bevorzugt?
Ich lese über die Auswahl der besten Teilmengen im Buch Elemente des statistischen Lernens. Wenn ich 3 Prädiktoren , erstelle ich 2 3 = 8 Teilmengen:x1,x2,x3x1,x2,x3x_1,x_2,x_323=823=82^3=8 Teilmenge ohne Prädiktoren Teilmenge mit Prädiktor x1x1x_1 Teilmenge mit Prädiktor x2x2x_2 Teilmenge mit Prädiktor x3x3x_3 Teilmenge mit Prädiktoren x1,x2x1,x2x_1,x_2 Teilmenge mit Prädiktoren x1,x3x1,x3x_1,x_3 Teilmenge …


1
Wenn wir Gruppen von Kontrollvariablen vergleichen, sollten wir Äquivalenztests verwenden?
In vielen Veröffentlichungen, die sich mit Behandlungen und Ergebnissen befassen, sehe ich Tabellen (normalerweise "Tabelle 1") von so genannten Störgrößen (häufig demografische Daten, manchmal medizinische Bedingungen) mit Signifikanz- und Texttests wie "Die Gruppen waren sich dort weitgehend ähnlich" waren keine signifikanten Unterschiede zu XXXXX, siehe Tabelle ". Das klare Ziel …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.