Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


1
Visualisierung aufeinanderfolgender Proportionen
Ich versuche, einige Verbraucherdaten zu visualisieren, die 4 Kategorien haben. Benutzer können zwischen verschiedenen Kategorien wechseln. Ich möchte die letzten drei oder vier Schalter für jede Person visualisieren. Wir würden also mit einem Diagramm mit einer Spalte mit 4 gestapelten Proportionen beginnen. Danach hätten wir 16, da jede Kategorie in …


1
Log-Likelihood-Verhältnis in der Dokumentzusammenfassung
Ich habe dies anfangs beim Stapelüberlauf gefragt und wurde auf diese Site verwiesen. Ich implementiere einige unbeaufsichtigte Methoden zur Zusammenfassung von Dokumenten, die auf der Auswahl / Extraktion von Inhalten basieren, und bin verwirrt darüber, was mein Lehrbuch als "Log-Likelihood-Verhältnis" bezeichnet. Das Buch Speech and Language Processing von Jurafsky & …

2
Kreuzvalidierung für gemischte Modelle?
Mein Kollege und ich passen eine Reihe von linearen und nichtlinearen Mischeffektmodellen in R an. Wir werden gebeten, eine Kreuzvalidierung der angepassten Modelle durchzuführen, damit überprüft werden kann, ob die beobachteten Effekte relativ verallgemeinerbar sind. Dies ist normalerweise eine triviale Aufgabe, aber in unserem Fall müssen wir die gesamten Daten …


1
PACF manuelle Berechnung
Ich versuche, die Berechnung zu replizieren, die SAS und SPSS für die partielle Autokorrelationsfunktion (PACF) durchführen. In SAS wird es durch Proc Arima hergestellt. Die PACF-Werte sind die Koeffizienten einer Autoregression der interessierenden Reihe auf verzögerte Werte der Reihe. Meine interessierende Variable ist der Umsatz, daher berechne ich lag1, lag2 …


3
Ein Schätzproblem bei der GPS-Verfolgung
Problem: Betrachten Sie zwei Autos (als Punktobjekte betrachtet) mit dem Namen Leader und Follower , die beide mit GPS-Geräten ausgestattet sind, die miteinander kommunizieren. Das Ziel von ist es, so genau wie möglich zu folgen , da sich dieser willkürlich in der Ebene bewegt. Vorausgesetzt, alle GPS-Geräte haben eine CEP-Fehlerverteilung …

4
Finden Sie Wahrscheinlichkeitsdichteintervalle
Ich habe den Vektor x <- c(1,2,3,4,5,5,5,6,6,6,6, 7,7,7,7,7,7,7,7,7,7,7,7,7,7,7,7,7,7,7, 7,7,7,7,7,7,7,7,8,8,8,8,9,9,9,10) (mein tatsächlicher Vektor hat eine Länge von> 10.000) und ich möchte die Intervalle finden, in denen 90% der Dichte liegen. Ist quantile(x, probs=c(0.05,0.95), type=5)das am besten geeignet oder gibt es einen anderen Weg?
9 r 


1
Berechnung der Interrater-Zuverlässigkeit in R mit variabler Anzahl von Bewertungen?
Wikipedia schlägt vor, dass eine Möglichkeit, die Zuverlässigkeit zwischen Bewertern zu untersuchen, darin besteht, ein Zufallseffektmodell zur Berechnung der Korrelation zwischen Klassen zu verwenden . Das Beispiel der Intraclass-Korrelation spricht vom Betrachten σ2ασ2α+σ2ϵσα2σα2+σϵ2\frac{\sigma_\alpha^2}{\sigma_\alpha^2+\sigma_\epsilon^2} von einem Modell Yij=μ+αi+ϵijYij=μ+αi+ϵijY_{ij} = \mu + \alpha_i + \epsilon_{ij} "wobei Y ij die j- te Beobachtung …


1
Gestrichelte Linien im ACF-Diagramm in R.
Ich gehe das Buch 'Introductory Time Series with R' von Cowpertwait und Metcalfe durch. Auf Seite 36 heißt es, dass die Zeilen bei: . Ich habe hier im R-Forum gelesen, dass die Zeilen bei . - 1 / n ± 2 / n- -- -√- -1/.n±2/.n-1/n \pm 2/\sqrt{n}± 1,96 / …
9 r  time-series 


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.