Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

4
Wie kann ich meine Analyse der Auswirkungen der Reputation auf die Stimmabgabe verbessern?
Kürzlich hatte ich einige Analysen über die Auswirkungen von Reputation auf Upvotes durchgeführt (siehe Blog-Post ) und anschließend einige Fragen zu möglicherweise aufschlussreicheren (oder angemesseneren) Analysen und Grafiken. Also ein paar Fragen (und zögern Sie nicht, auf irgendjemanden zu antworten und die anderen zu ignorieren): In seiner aktuellen Inkarnation habe …


8
So verwenden Sie keine Statistiken
Dies ist eine Art offene Frage, aber ich möchte klar sein. Bei einer ausreichenden Bevölkerungszahl können Sie möglicherweise etwas lernen (dies ist der offene Teil), aber was auch immer Sie über Ihre Bevölkerungszahl erfahren, wann ist dies jemals auf ein Mitglied der Bevölkerung anwendbar? Soweit ich die Statistik verstehe, ist …


1
Wie kann man überprüfen, welches Modell in der Zustandsraum-Zeitreihenanalyse besser ist?
Ich mache eine Zeitreihendatenanalyse nach Zustandsraummethoden. Mit meinen Daten hat das stochastische Modell auf lokaler Ebene das deterministische Modell völlig übertroffen. Das deterministische Pegel- und Steigungsmodell liefert jedoch bessere Ergebnisse als mit dem stochastischen Pegel und der stochastisch / deterministischen Steigung. Ist das etwas übliches? Alle Methoden in R erfordern …

3
Ist es in Ordnung, Manhattan-Distanz mit der Cluster-Verknüpfung von Ward in hierarchischen Clustern zu verwenden?
Ich verwende hierarchisches Clustering, um Zeitreihendaten zu analysieren. Mein Code wird mit der Mathematica- Funktion implementiert DirectAgglomerate[...], die unter Berücksichtigung der folgenden Eingaben hierarchische Cluster generiert: eine Distanzmatrix D Der Name der Methode, die zur Bestimmung der Cluster-Verknüpfung verwendet wird. Ich habe die Distanzmatrix D mit Manhattan-Distanz berechnet: d( x …

1
Änderungspunktanalyse mit Rs nls ()
Ich versuche, eine "Änderungspunkt" -Analyse oder eine mehrphasige Regression mit nls()in R zu implementieren . Hier sind einige gefälschte Daten, die ich gemacht habe . Die Formel, die ich verwenden möchte, um die Daten anzupassen, lautet: y= β0+ β1x + β2max ( 0 , x - δ)y=β0+β1x+β2max(0,x-δ)y = \beta_0 + …


2
Der Zusammenhang zwischen Bayes'scher Statistik und generativer Modellierung
Kann mich jemand auf eine gute Referenz verweisen, die den Zusammenhang zwischen Bayes-Statistiken und generativen Modellierungstechniken erklärt? Warum verwenden wir normalerweise generative Modelle mit Bayes'schen Techniken? Warum ist es besonders attraktiv, Bayes-Statistiken zu verwenden, wenn keine vollständigen Daten vorliegen, wenn überhaupt? Beachten Sie, dass ich aus einer eher maschinell lernorientierten …

3
Gute Einführungen in Zeitreihen (mit R)
Ich sammle zurzeit Daten für ein Experiment zu psychosozialen Merkmalen, die mit dem Erleben von Schmerz verbunden sind. Im Rahmen dessen sammle ich von meinen Teilnehmern elektronisch GSR- und BP-Messungen sowie verschiedene Selbstberichte und implizite Maßnahmen. Ich habe einen psychologischen Hintergrund und bin mit Faktorenanalyse, linearen Modellen und experimenteller Analyse …

3
Tutorials zur objektorientierten Programmierung in R [geschlossen]
Geschlossen. Diese Frage ist nicht zum Thema . Derzeit werden keine Antworten akzeptiert. Geschlossen vor 4 Jahren . Verschlossen . Diese Frage und ihre Antworten sind gesperrt, da die Frage nicht zum Thema gehört, aber von historischer Bedeutung ist. Derzeit werden keine neuen Antworten oder Interaktionen akzeptiert. Gibt es gute …
15 r 

5
Unterschied zwischen den Begriffen "gemeinsame Verteilung" und "multivariate Verteilung"?
Ich schreibe über die Verwendung einer "gemeinsamen Wahrscheinlichkeitsverteilung" für ein Publikum, das mit größerer Wahrscheinlichkeit die "multivariate Verteilung" verstehen würde, und überlege daher, die spätere zu verwenden. Dabei möchte ich aber nicht den Sinn verlieren. Wikipedia scheint darauf hinzuweisen, dass es sich um Synonyme handelt. Sind sie? Wenn nein, warum …

2
Exponentiell gewichtete Bewegungsschiefe / Kurtosis
Es gibt bekannte Online-Formeln zur Berechnung von exponentiell gewichteten gleitenden Durchschnitten und Standardabweichungen eines Prozesses . Für den Mittelwert,(xn)n=0,1,2,…(xn)n=0,1,2,…(x_n)_{n=0,1,2,\dots} μn=(1−α)μn−1+αxnμn=(1−α)μn−1+αxn\mu_n = (1-\alpha) \mu_{n-1} + \alpha x_n und für die Varianz σ2n=(1−α)σ2n−1+α(xn−μn−1)(xn−μn)σn2=(1−α)σn−12+α(xn−μn−1)(xn−μn)\sigma_n^2 = (1-\alpha) \sigma_{n-1}^2 + \alpha(x_n - \mu_{n-1})(x_n - \mu_n) woraus Sie die Standardabweichung berechnen können. Gibt es ähnliche Formeln …



Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.