Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

5
Was ist der richtige Weg, um die Signifikanz von Klassifizierungsergebnissen zu testen?
Es gibt viele Situationen, in denen Sie möglicherweise mehrere verschiedene Klassifizierer trainieren oder verschiedene Methoden zum Extrahieren von Features verwenden. In der Literatur geben Autoren häufig den mittleren Klassifizierungsfehler über eine Reihe von zufälligen Teilungen der Daten an (dh nach einer doppelt verschachtelten Kreuzvalidierung) und geben manchmal auch Abweichungen über …

6
Beispiele für Probleme mit versteckten Markov-Modellen?
Ich habe eine Menge versteckter Markov-Modelle gelesen und konnte selbst eine ziemlich einfache Version davon programmieren. Aber es gibt zwei Möglichkeiten, die ich zu lernen scheine. Zum einen muss es gelesen und in Code implementiert werden (was getan wird), und zum anderen muss verstanden werden, wie es in verschiedenen Situationen …

3
Regression vs. ANOVA-Diskrepanz (aov vs lm in R)
Ich hatte immer den Eindruck, dass die Regression nur eine allgemeinere Form der ANOVA ist und die Ergebnisse identisch wären. In letzter Zeit habe ich jedoch sowohl eine Regression als auch eine ANOVA mit denselben Daten durchgeführt, und die Ergebnisse unterscheiden sich erheblich. Das heißt, im Regressionsmodell sind sowohl die …
21 r  regression  anova 

4
Was bedeutet "Unparteilichkeit"?
Was bedeutet es zu sagen, dass "die Varianz ein verzerrter Schätzer ist"? Was bedeutet es, eine voreingenommene Schätzung durch eine einfache Formel in eine unvoreingenommene Schätzung umzuwandeln? Was genau macht diese Konvertierung? Was ist der praktische Nutzen dieser Konvertierung? Konvertieren Sie diese Werte, wenn Sie bestimmte Arten von Statistiken verwenden?

3
Warum sollten wir uns für ein schnelles Mischen in MCMC-Ketten interessieren?
Wenn wir mit der Markov-Kette Monte Carlo arbeiten, um Rückschlüsse zu ziehen, brauchen wir eine Kette, die sich schnell mischt, dh die Unterstützung der hinteren Verteilung schnell durchwandert. Aber ich verstehe nicht, warum wir diese Eigenschaft brauchen, denn nach meinem Verständnis sollten und werden sich die akzeptierten Kandidatenzeichnungen auf den …
21 mcmc 

3
Wie kann ich die Fehlerquote in einem NPS-Ergebnis (Net Promoter Score) berechnen?
Ich werde Wikipedia erklären lassen, wie NPS berechnet wird: Der Net Promoter Score wird erhalten, indem Kunden auf einer Bewertungsskala von 0 bis 10 eine einzelne Frage gestellt werden, wobei 10 "äußerst wahrscheinlich" und 0 "überhaupt nicht wahrscheinlich" ist: "Wie wahrscheinlich ist es, dass Sie unser Unternehmen einem empfehlen würden …


1
Effiziente Berechnung der inversen Matrix in R
Ich muss die inverse Matrix berechnen und habe die solveFunktion verwendet. Während es bei kleinen Matrizen gut funktioniert solve, ist es bei großen Matrizen tendenziell sehr langsam. Ich habe mich gefragt, ob es eine andere Funktion oder Kombination von Funktionen gibt (über SVD, QR, LU oder andere Zerlegungsfunktionen), die mir …

4
Was ist der Fluch der Dimensionalität?
Konkret suche ich Referenzen (Papiere, Bücher), die den Fluch der Dimensionalität konsequent aufzeigen und erklären. Diese Frage stellte sich, nachdem ich dieses Whitepaper von Lafferty und Wasserman gelesen hatte . Im dritten Absatz erwähnen sie eine "bekannte" Gleichung, die impliziert, dass die beste Konvergenzrate ; Wenn jemand darauf eingehen kann …
21 theory 


1
Logistische Regression für Zeitreihen
Ich möchte ein binäres logistisches Regressionsmodell im Kontext von Streaming-Daten (mehrdimensionale Zeitreihen) verwenden, um den Wert der abhängigen Variablen der Daten (dh der Zeile), die gerade angekommen sind, unter Berücksichtigung der bisherigen Beobachtungen vorherzusagen. Soweit mir bekannt ist, wird die logistische Regression traditionell für die postmortale Analyse verwendet, bei der …

4
Sind Entscheidungsbäume fast immer Binärbäume?
Fast jedes Entscheidungsbaum-Beispiel, auf das ich gestoßen bin, ist zufällig ein Binärbaum. Ist das so ziemlich universell? Unterstützen die meisten Standardalgorithmen (C4.5, CART usw.) nur binäre Bäume? Soweit ich weiß, ist CHAID nicht auf binäre Bäume beschränkt, aber das scheint eine Ausnahme zu sein. Eine Zwei-Wege-Trennung, gefolgt von einer weiteren …


3
Auto.arima mit täglichen Daten: Wie erfasst man die Saisonalität / Periodizität?
Ich rüste eine tägliche Zeitreihe mit einem ARIMA-Modell aus. Die Daten werden täglich vom 01.02.2010 bis zum 30.07.2011 erhoben und beziehen sich auf den Zeitungsverkauf. Da ein wöchentliches Verkaufsmuster festgestellt werden kann (die tägliche durchschnittliche Anzahl der verkauften Exemplare ist normalerweise von Montag bis Freitag gleich und steigt dann am …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.