Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Quadratsummen vom Typ III
Ich habe ein lineares Regressionsmodell mit einer kategorischen Variable (männlich und weiblich) und einer kontinuierlichen Variable .AAABBB Ich habe Kontrastcodes in R mit eingerichtet options(contrasts=c("contr.sum","contr.poly")). Und jetzt habe ich Quadratsummen vom Typ III für , und deren Interaktion (A: B) mit .AAABBBdrop1(model, .~., test="F") Ich bleibe dabei, wie die Quadratsummen …

2
Mann-Whitney-Nullhypothese bei ungleicher Varianz
Ich bin nur neugierig auf die Nullhypothese eines Mann-Whitney-U-Tests. Ich sehe oft, dass die Nullhypothese lautet, dass zwei Populationen gleiche Verteilungen haben. Aber ich denke - wenn ich zwei normale Populationen mit dem gleichen Mittelwert, aber einer extrem ungleichen Varianz hätte, würde der Mann-Whitney-Test diesen Unterschied wahrscheinlich nicht erkennen. Ich …

1
EFA unterstützt eindeutig einen Faktor, die Maßnahme ist intern konsistent, aber CFA passt schlecht?
Ich untersuche die psychometrischen Eigenschaften einer 10-Punkte-Selbstberichtsmaßnahme. Ich habe ungefähr 400 Fälle in zwei unabhängigen Proben. Die Gegenstände werden auf 4-Punkte-Likert-Skalen vervollständigt. Eine EFA unterstützt eindeutig eine Ein-Faktor-Lösung (z. B. erster Eigenwert über 6, alle anderen unter 1) und Cronbachs Alpha ist gut (z. B. 0,90). Kein Artikel hat eine …


2
Robuste mittlere Schätzung mit O (1) -Updateeffizienz
Ich suche eine robuste Schätzung des Mittelwerts, der eine bestimmte Eigenschaft hat. Ich habe eine Reihe von Elementen, für die ich diese Statistik berechnen möchte. Dann füge ich nacheinander neue Elemente hinzu und möchte für jedes weitere Element die Statistik neu berechnen (auch als Online-Algorithmus bezeichnet). Ich möchte, dass diese …


1
Bestimmen Sie eine unbekannte Anzahl realer Standorte aus GPS-basierten Berichten
Ich arbeite an einer Software, die anhand mehrerer GPS-basierter Berichte reale Standorte (z. B. Geschwindigkeitskameras) ermitteln soll . Ein Benutzer fährt, wenn er einen Ort meldet, daher sind die Meldungen sehr ungenau. Um dieses Problem zu lösen, muss ich Berichte über denselben Standort gruppieren und einen Durchschnitt berechnen. Meine Frage …


2
Macht Stan vorausschauende Posterioren?
Verfügt Stan (insbesondere Rstan) über integrierte Einrichtungen zur Erzeugung prädiktiver posteriorer Verteilungen? Es ist nicht schwer, die Verteilung aus der Stan-Passform zu generieren, aber ich möchte das Rad lieber nicht neu erfinden.

2
Doanes Formel für das Histogramm-Binning
Ich implementiere verschiedene Algorithmen, um die beste Anzahl von Bins für Histogramme zu schätzen. Die meisten von mir implementierten sind auf der Wikipedia-Seite "Histogramm" im Abschnitt " Anzahl der Fächer und Breite " * beschrieben. Ich habe ein Problem mit Doanes Formel: 1 + log(n) + log(1 + kurtosis(data) * …

1
Dynamisches Time Warping und Normalisierung
Ich verwende Dynamic Time Warping, um eine "Abfrage" - und eine "Vorlagen" -Kurve abzugleichen, und habe bisher vernünftigen Erfolg, aber ich habe einige grundlegende Fragen: Ich bewerte eine "Übereinstimmung", indem ich bewerte, ob das DTW-Ergebnis unter einem von mir heuristisch ermittelten Schwellenwert liegt. Ist dies der allgemeine Ansatz zur Bestimmung …

2
Erstellen von Demodaten aus realen Daten: Verkleidung ohne Entstellung
(Ich habe keine wirkliche Ahnung, womit ich das markieren soll, da ich kein Statistiker bin und nicht weiß, in welches Feld dies fällt. Sie können gerne weitere geeignete Tags hinzufügen.) Ich arbeite für ein Unternehmen, das Datenanalyse-Software herstellt, und wir benötigen einen anständigen Datensatz, um unser neuestes Produkt mit zu …


1
Wie wird eine Kontrastmatrix (in R) für die Differenz zwischen einer Ebene und einem Durchschnitt der anderen angegeben?
Ich habe ein Regressionsmodell, das so aussieht:Y=β0+β1X1+β2X2+β3X3+β12X1X2+β13X1X3+β123X1X2X3Y=β0+β1X1+β2X2+β3X3+β12X1X2+β13X1X3+β123X1X2X3Y = \beta_0+\beta_1X_1 + \beta_2X_2 + \beta_3X_3 +\beta_{12}X_1X_2+\beta_{13}X_1X_3+\beta_{123}X_1X_2X_3 ... oder in R-Notation: y ~ x1 + x2 + x3 + x1:x2 + x1:x3 + x1:x2:x3 , und sind kategoriale Variablen und ist numerisch. Die Komplikation ist, dass drei Ebenen und anstelle von Standardkontrasten muss …
9 r  contrasts 

3
Äquivalenztests für nicht normale Daten?
Ich habe einige Daten, von denen ich nicht unbedingt annehmen kann, dass sie aus Normalverteilungen stammen, und ich möchte Äquivalenztests zwischen Gruppen durchführen. Für normale Daten gibt es Techniken wie TOST (zwei einseitige T-Tests). Gibt es etwas Analoges zu TOST für nicht normale Daten?

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.