Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

4
Was ist ein guter Protokollverlust?
Ich versuche, den Protokollverlust und seine Funktionsweise besser zu verstehen, aber eine Sache, die ich nicht zu finden scheine, ist, die Protokollverlustnummer in einen Kontext zu setzen. Wenn mein Modell einen log-Verlust von 0,5 hat, ist das gut? Was ist ein gutes und ein schlechtes Ergebnis? Wie verändern sich diese …

5
Wie übertreffen Ensemble-Methoden alle ihre Bestandteile?
Ich bin ein bisschen verwirrt über das Lernen von Ensembles. Kurz gesagt, es werden k Modelle ausgeführt und der Durchschnitt dieser k Modelle ermittelt. Wie kann garantiert werden, dass der Durchschnitt der k Modelle besser ist als jeder der Modelle für sich? Ich verstehe, dass die Tendenz "ausgebreitet" oder "gemittelt" …

3
Was ist ein Nullmodell in der Regression und wie hängt es mit der Nullhypothese zusammen?
Was ist ein Nullmodell in der Regression und in welcher Beziehung steht das Nullmodell zur Nullhypothese? Für mein Verständnis bedeutet es Verwenden Sie "Durchschnitt der Antwortvariablen", um eine kontinuierliche Antwortvariable vorherzusagen? Verwendung der "Etikettenverteilung" zur Vorhersage diskreter Antwortvariablen? Wenn dies der Fall ist, scheinen die Verbindungen zwischen der Nullhypothese zu …

2
Was passiert hier, wenn ich bei der Einstellung der logistischen Regression den quadratischen Verlust verwende?
Ich versuche, einen quadratischen Verlust zu verwenden, um eine binäre Klassifizierung für einen Spielzeugdatensatz durchzuführen. Ich verwende einen mtcarsDatensatz, verwende Meile pro Gallone und Gewicht, um die Übertragungsart vorherzusagen. Das folgende Diagramm zeigt die zwei Arten von Übertragungstypdaten in verschiedenen Farben und die Entscheidungsgrenze, die durch verschiedene Verlustfunktionen erzeugt werden. …

7
Warum werden verzerrte Daten für die Modellierung nicht bevorzugt?
In den meisten Fällen, in denen von Variablentransformationen gesprochen wird (sowohl für Prädiktor- als auch für Antwortvariablen), werden Möglichkeiten zur Behandlung von Datenfehlern (wie Protokolltransformation, Box- und Cox-Transformation usw.) erörtert. Was ich nicht verstehen kann, ist, warum das Entfernen von Versatz als eine solche gängige Best Practice angesehen wird? Wie …

1
Welche Kausaltheorien sollte ich kennen?
Welche theoretischen Herangehensweisen an die Kausalität sollte ich als angewandter Statistiker / Ökonometriker kennen? Ich kenne die (ein bisschen) Neyman-Rubin-Kausalmodell (und Roy , Haavelmo usw.) Pearl's Arbeit über Kausalität Granger-Kausalität (wenn auch weniger behandlungsorientiert) Welche Konzepte vermisse ich oder sollte ich darauf achten? Verwandte: Welche Theorien sind Grundlagen für Kausalität …

1
Maximale Lücke zwischen Proben, die ersatzlos aus einer diskreten Gleichverteilung gezogen wurden
Dieses Problem hängt mit der Erforschung der Roboterabdeckung in meinem Labor zusammen: Zeichne zufällig Zahlen aus der Menge ohne Ersetzung und sortiere die Zahlen in aufsteigender Reihenfolge. .nnn{1,2,…,m}{1,2,…,m}\{1,2,\ldots,m\}1≤n≤m1≤n≤m1\le n\le m Aus dieser sortierten Liste von Zahlen wird die Differenz zwischen aufeinanderfolgenden Zahlen und den Grenzen erzeugt: . Dies ergibt Lücken.g …





3
Wie erhält man Hyperparameter in einer verschachtelten Kreuzvalidierung?
Ich habe die folgenden Beiträge zur geschachtelten Kreuzvalidierung gelesen und bin mir immer noch nicht 100% sicher, was ich mit der Modellauswahl mit geschachtelter Kreuzvalidierung tun soll: Verschachtelte Kreuzvalidierung für die Modellauswahl Modellauswahl und Kreuzvalidierung: Der richtige Weg Lassen Sie mich, um meine Verwirrung zu erklären, Schritt für Schritt durch …

2
Reststandardfehlerdifferenz zwischen optim und glm
Ich versuche, mit optimden Ergebnissen einer einfachen linearen Regression mit zu reproduzierenglm oder sogar nlsR-Funktionen ausgestattet ist. Die Parameterschätzungen sind die gleichen, aber die Restvarianzschätzung und die Standardfehler der anderen Parameter sind nicht die gleichen, insbesondere wenn die Stichprobengröße niedrig ist. Ich nehme an, dass dies auf Unterschiede in der …



Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.