Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

5
Wie entspricht die Stichprobenverteilung der Stichprobenmittelwerte dem Bevölkerungsmittelwert?
Ich versuche, Statistiken zu lernen, weil ich feststelle, dass sie so verbreitet sind, dass ich einige Dinge nicht lernen kann, wenn ich sie nicht richtig verstehe. Ich habe Probleme, diesen Begriff einer Stichprobenverteilung der Stichprobenmittel zu verstehen. Ich kann nicht verstehen, wie es einige Bücher und Websites erklärt haben. Ich …

1
Bedeutung der Ausgabebegriffe im gbm-Paket?
Ich benutze das gbm-Paket zur Klassifizierung. Wie erwartet ist das Ergebnis gut. Aber ich versuche die Ausgabe des Klassifikators zu verstehen. Die Ausgabe enthält fünf Begriffe. `Iter TrainDeviance ValidDeviance StepSize Improve` Könnte jemand die Bedeutung jeden Begriff, vor allem die Bedeutung erklärt zu verbessern .

2
Angabe einer Kovarianzstruktur: Vor- und Nachteile
Was sind die Vorteile der Angabe einer Kovarianzstruktur in einer GLM (anstatt alle nicht diagonalen Einträge in der Kovarianzmatrix als Null zu behandeln)? Abgesehen davon, was man über die Daten weiß, macht man es auch Passform verbessern? Verbesserung der Vorhersagegenauigkeit für ausgelagerte Daten? Lassen Sie uns das Ausmaß der Kovarianz …

3
Warum sollte ein bestimmtes Maß für den Prognosefehler (z. B. MAD) im Gegensatz zu einem anderen (z. B. MSE) verwendet werden?
MAD = Mittlere absolute Abweichung MSE = Mittlerer quadratischer Fehler Ich habe Vorschläge von verschiedenen Stellen gesehen, dass MSE trotz einiger unerwünschter Eigenschaften verwendet wird (z. B. http://www.stat.nus.edu.sg/~staxyc/T12.pdf , das auf Seite 8 heißt. "Es wird allgemein angenommen, dass MAD ist ein besseres Kriterium als MSE. Mathematisch ist MSE jedoch …
15 forecasting  error  mse  mae 

1
Visualisierung gemischter Modellergebnisse
Eines der Probleme, die ich bei gemischten Modellen immer hatte, ist das Herausfinden von Datenvisualisierungen, wie sie auf einem Papier oder Poster landen können, sobald die Ergebnisse vorliegen. Im Moment arbeite ich an einem Poisson-Mischeffektmodell mit einer Formel, die ungefähr so ​​aussieht: a <- glmer(counts ~ X + Y + …

7
Zufälliger Wald ist überpassend
Ich versuche, Random Forest Regression zum Erlernen von Scikits zu verwenden. Das Problem ist, dass ich einen sehr hohen Testfehler erhalte: train MSE, 4.64, test MSE: 252.25. So sehen meine Daten aus: (blau: echte Daten, grün: vorhergesagt): Ich benutze 90% für das Training und 10% für den Test. Dies ist …


3
Einige Fragen zur statistischen Zufälligkeit
Aus der statistischen Zufälligkeit von Wikipedia : Globaler Zufall und lokaler Zufall sind unterschiedlich. Die meisten philosophischen Vorstellungen von Zufälligkeit sind global - denn sie basieren auf der Idee, dass eine Sequenz "auf lange Sicht" wirklich zufällig aussieht, auch wenn bestimmte Teilsequenzen nicht zufällig aussehen würden. Beispielsweise ist es in …


2
Gilt das Prinzip der Gleichgültigkeit für das Borel-Kolmogorov-Paradoxon?
Betrachten Sie Jaynes 'Lösung des Bertrand-Paradoxons nach dem Prinzip der Gleichgültigkeit . Warum trifft ein ähnliches Argument auf das Borel-Kolmogorov-Paradoxon nicht zu ? Ist etwas falsch daran zu argumentieren, dass das Drehen der Kugel die resultierende Verteilung, die durch den gewählten Begrenzungsprozess erreicht wird, nicht beeinflussen sollte, da das Problem …
15 theory  paradox 

3
Welche Optionen stehen im proportionalen Hazard-Regressionsmodell zur Verfügung, wenn Schönfeld-Residuen nicht gut sind?
Ich mache eine Cox-proportionale Hazards-Regression mit R coxph, die viele Variablen enthält. Die Martingale-Residuen sehen großartig aus, und die Schönfeld-Residuen sind für FAST alle Variablen großartig. Es gibt drei Variablen, deren Schönfeld-Residuen nicht flach sind, und die Variablen sind so beschaffen, dass es sinnvoll ist, sie mit der Zeit zu …

3
Was ist Datenmischung?
Dieser Begriff kommt häufig in methodenbezogenen Threads vor . Ist das Mischen eine bestimmte Methode für Data Mining und statistisches Lernen? Ich kann kein relevantes Ergebnis von Google erhalten. Es scheint, dass das Mischen die Ergebnisse vieler Modelle verwechselt und zu einem besseren Ergebnis führt. Gibt es eine Ressource, die …


11
Beispiele für Prozesse, die nicht Poisson sind?
Ich suche einige gute Beispiele für Situationen, die für das Modellieren mit einer Poisson-Verteilung ungeeignet sind, um den Schülern die Erklärung der Poisson-Verteilung zu erleichtern. Üblicherweise wird die Anzahl der Kunden, die in einem Zeitintervall in einem Geschäft eintreffen, als Beispiel verwendet, das durch eine Poisson-Verteilung modelliert werden kann. Ich …

3
Automatisiertes Verfahren zur Auswahl einer Teilmenge von Datenpunkten mit der stärksten Korrelation?
Gibt es ein Standardverfahren (so dass man es als Referenz anführen könnte), um die Teilmenge der Datenpunkte aus einem größeren Pool mit der stärksten Korrelation (entlang nur zwei Dimensionen) auszuwählen? Angenommen, Sie haben 100 Datenpunkte. Sie möchten eine Teilmenge von 40 Punkten mit der größtmöglichen Korrelation entlang der X- und …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.