Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Regressionskoeffizienten nach verschiedenen Differenzen interpretieren
Es gibt nur wenige Erklärungen, die beschreiben, wie lineare Regressionskoeffizienten nach Differenzierung einer Zeitreihe interpretiert werden (um eine Einheitswurzel zu eliminieren). Ist es so einfach, dass es nicht nötig ist, es formell zu formulieren? (Ich bin mir dieser Frage bewusst , war mir aber nicht sicher, wie allgemein die Antwort …

4
Die Rolle der Varianz im zentralen Grenzwertsatz
Ich habe irgendwo gelesen, dass der Grund, warum wir die Differenzen quadrieren, anstatt absolute Werte bei der Berechnung der Varianz zu verwenden, darin besteht, dass die Varianz, die auf die übliche Weise mit Quadraten im Nominator definiert wird, im zentralen Grenzwertsatz eine einzigartige Rolle spielt. Was genau ist dann die …



3
Rechte Zensur und linke Zensur
Wikipedia gibt folgende Definitionen: Richtige Zensur : Ein Datenpunkt liegt über einem bestimmten Wert, aber es ist nicht bekannt, um wie viel. Linke Zensur : Ein Datenpunkt liegt unter einem bestimmten Wert, aber es ist nicht bekannt, um wie viel. Was ist in diesen Definitionen gemeint mit: "Datenpunkt" "bestimmter Wert" …


4
Wird der Mittelwert eines Satzes von Mitteln immer der gleiche sein wie der Mittelwert, der aus dem gesamten Satz von Rohdaten erhalten wird?
Wenn ich den Mittelwert für 4 Datensätze (die unterschiedliche Stichprobengrößen haben) berechnet habe, kann ich dann einen "Gesamtmittelwert" erhalten, indem ich den "Mittelwert der Mittelwerte" berechne? Wenn ja, ist dieser "Mittelwert der Mittelwerte" derselbe, als hätte ich die Daten aus allen 4 Sätzen kombiniert und dann den Mittelwert berechnet?

3
k-bedeutet vs k-bedeutet ++
Soweit ich weiß, wählt k-means die Anfangszentren zufällig aus. Da sie auf purem Glück basieren, können sie wirklich schlecht ausgewählt werden. Der K-means ++ Algorithmus versucht, dieses Problem zu lösen, indem er die Anfangszentren gleichmäßig verteilt. Garantieren die beiden Algorithmen die gleichen Ergebnisse? Oder es ist möglich, dass die schlecht …
10 k-means 


2
Normalisierter RMSE
Ich habe mehrere Zeitreihen in einem VAR (1) und möchte, da einige von ihnen nicht dieselbe Maßeinheit haben, den RMSE in Prozent schätzen. Ich weiß, dass dies auf verschiedene Arten geschehen kann (siehe unten), aber ich weiß nicht genau, welches besser zu einem Prognosebewertungsproblem passt. Ich hoffe du konntest mir …
10 time-series  mse  rms 

2
lmer mit mehrfach unterstellten Daten
Wie kann ich nach mehrfacher Imputation gepoolte Zufallseffekte für lmer erhalten? Ich benutze Mäuse, um einen Datenrahmen mehrfach zu unterstellen. Und lme4 für ein gemischtes Modell mit zufälligem Achsenabschnitt und zufälliger Steigung. Das Pooling von lmer ist in Ordnung, außer dass die zufälligen Effekte nicht gepoolt werden. Ich habe viel …

2
Interpretation der CCF-Korrelation in R.
Ich benutze ccf, um eine Korrelation zwischen 2 Zeitreihen zu finden. Ich bekomme eine Handlung, die so aussieht: Beachten Sie, dass ich hauptsächlich an der Korrelation für die Verzögerung = 0 interessiert bin. Fragen: Interpretieren Sie es richtig, dass es eine Kreuzkorrelation für die Verzögerung = 0 gibt, da für …

2
Wie vergleiche ich den Unterschied zwischen zwei Zeitreihen?
Ich arbeite an meiner Diplomarbeit, in der ich untersuche, wie stark Menschen bei verschiedenen Ereignissen Emotionen zeigen. Mein Problem ist (1), dass ich SEHR wenig Erfahrung mit Statistik und Mathematik habe, daher bin ich mit allen verschiedenen Methoden irgendwie verloren und würde mich sehr freuen, wenn eine "einfache" Antwort gegeben …

1
Warum berechnen wir den Informationswert?
Ich habe die Daten mit kategorialen Variablen und kontinuierlichen Variablen, aber es ist notwendig, den Informationswert in der erklärenden Datenanalyse zu finden. Geben Sie einfach den Grund an, warum wir zu Beginn der Datenanalyse den Informationswert für jede Variable berechnen, und geben Sie den Grenzwert für den INFORMATIONSWERT an, um …

2
Verwendung des Chi-Quadrat-Tests, um festzustellen, ob die Daten der Poisson-Verteilung folgen
Die folgende Abbildung (Abbildung 1 aus S. 646 dieses Papiers ) vergleicht die beobachteten Werte mit den erwarteten Werten unter der Poisson-Verteilung. Anschließend wird ein Chi-Quadrat-Test durchgeführt, um festzustellen, ob die beobachteten Werte von den erwarteten Werten unter der Poisson-Verteilung abweichen. Wie ist es mit R möglich, erwartete Werte unter …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.