Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Auf der Suche nach dem 'Ellbogen' in Daten
Die Subitisierung ist die schnelle und genaue Aufzählung von Anzeigen mit geringer Anzahl, die sich von der Zählung durch eine scharfe Nichtlinearität in der Darstellung der Antwortzeiten unterscheidet. Unten ist eine repräsentative Darstellung von Watson, DG, Maylor, EA und Bruce, LAM (2007). Beachten Sie, dass die mittleren Aufzählungszeiten für die …

1
Warum muss die Log-Wahrscheinlichkeit auf minus unendlich gehen, wenn sich der Parameter der Grenze des Parameterraums nähert?
In einer kürzlich gehaltenen Vorlesung wurde mir gesagt, dass die Log-Wahrscheinlichkeit auf minus unendlich gehen muss, damit die maximale Wahrscheinlichkeitsschätzung gültig ist, wenn der Parameter an die Grenze des Parameterraums geht. Aber ich verstehe nicht, warum das wichtig ist. Angenommen, die Log-Wahrscheinlichkeit geht auf eine Art Asymptote über. Dann ist …

1
Warum Bayesglm verwenden?
Meine allgemeine Frage lautet: Warum bayesglmanstelle anderer Klassifizierungsmethoden verwenden? Hinweis: Ich interessiere mich nur für Vorhersage. Ich habe eine anständige Datenmenge (~ 100.000 obs). Ich bin der Meinung, dass die Stichprobengröße groß genug ist, um die Parameter einer regulären logistischen Regression normal zu verteilen (CLT). Was würde ich durch die …



2
Annäherung der relativen Mengen an Münzen in Kanada
Wäre es möglich, die relativen Mengen an im Umlauf befindlichen Loonies , Twoonies , Vierteln, Groschen, Nickeln (und möglicherweise dem abgekündigten Penny) genau zu approximieren , wenn man im täglichen Gebrauch einfach eine ausreichend große Münzprobe erhält? Im täglichen Gebrauch beziehe ich mich auf die Münzen, die Sie zurückbekommen, wenn …


3
Auswählen einer Klassifizierungsleistungsmetrik für die Modellauswahl, Merkmalsauswahl und Veröffentlichung
Ich habe einen kleinen, unausgeglichenen Datensatz (70 positiv, 30 negativ) und habe mit der Modellauswahl für SVM-Parameter unter Verwendung von BAC (ausgeglichene Genauigkeit) und AUC (Bereich unter der Kurve) herumgespielt. Ich habe verschiedene Klassengewichte für den C-Parameter in libSVM verwendet, um die unausgeglichenen Daten gemäß den hier angegebenen Anweisungen auszugleichen …

2
Generieren von kausal abhängigen Zufallsvariablen
Ich versuche, Sätze von kausal verbundenen Zufallsvariablen zu generieren und habe dies mit einem Monte-Carlo-Ansatz begonnen. Die Basislinie ist ein zweidimensional gemessenes Histogramm, aus dem ich zufällige Werte ziehe. In meinen konkreten Beispielen sind diese Variablen Beschleunigung und Geschwindigkeit - also muss offensichtlich gelten.v v i + 1 = v …


3
Wie führe ich eine unbeaufsichtigte Random Forest-Klassifizierung mit Breimans Code durch?
Ich arbeite mit Breimans zufälligem Waldcode ( http://stat-www.berkeley.edu/users/breiman/RandomForests/cc_manual.htm#c2 ) zur Klassifizierung von Satellitendaten (überwachtes Lernen). Ich verwende einen Trainings- und Testdatensatz mit einer Stichprobengröße von 2000 und einer Variablengröße von 10. Die Daten werden in zwei Klassen, A und B, klassifiziert. Im überwachten Lernmodus arbeitet der Algorithmus mit einem sehr …

1
Kann ich ein Konfidenzintervall des Poisson-Mittelwerts für seine Varianz verwenden?
In einer Poisson-Verteilung entspricht der Mittelwert der Varianz. Ich möchte ein Konfidenzintervall der Varianz finden. Ist meine Argumentation unten richtig? Unter Verwendung des zentralen Grenzwertsatzes konstruiere ich ein 95% -Konfidenzintervall für den Mittelwert Daher scheint mir , dass die Ungleichung sollte wie jede andere Ungleichung in der Mathematik funktionieren, aber …

3
Ideen zur Ausgabe einer Vorhersagegleichung für zufällige Wälder
Ich habe die folgenden Beiträge gelesen, die die Frage beantwortet haben, die ich stellen wollte: Verwenden Sie das Random Forest-Modell, um Vorhersagen aus Sensordaten zu treffen Entscheidungsbaum für die Ausgabevorhersage Folgendes habe ich bisher getan: Ich habe die logistische Regression mit zufälligen Wäldern verglichen und RF hat die logistische Leistung …

1
Sind glaubwürdige Intervalle bei Rückschlüssen auf Gruppenmittelwerte empfindlich gegenüber Abweichungen innerhalb des Subjekts, während dies bei Konfidenzintervallen nicht der Fall ist?
Dies ist ein Nebeneffekt dieser Frage: Wie kann man zwei Gruppen mit mehreren Messungen für jedes Individuum mit R vergleichen? In den Antworten dort (wenn ich richtig verstanden habe) habe ich gelernt, dass die Varianz innerhalb des Subjekts keine Rückschlüsse auf Gruppenmittelwerte hat, und es ist in Ordnung, einfach die …

2
Umgang mit guten Leistungen bei Trainings- und Validierungsdaten, aber sehr schlechten Leistungen bei Testdaten
Ich habe ein Regressionsproblem mit 5-6k Variablen. Ich teile meine Daten in 3 nicht überlappende Sätze ein: Training, Validierung und Testen. Ich trainiere nur mit dem Trainingssatz und generiere viele verschiedene lineare Regressionsmodelle, indem ich für jedes Modell einen anderen Satz von 200 Variablen auswähle (ich versuche ungefähr 100.000 solcher …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.