Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren



4
Verteilung der Vorschläge für die Kovarianzmatrix
In einer MCMC-Implementierung hierarchischer Modelle mit normalen Zufallseffekten und einem Wishart-Prior für ihre Kovarianzmatrix wird typischerweise die Gibbs-Abtastung verwendet. Wenn wir jedoch die Verteilung der zufälligen Effekte ändern (z. B. auf Student's-t oder einen anderen), geht die Konjugation verloren. Was wäre in diesem Fall eine geeignete (dh leicht einstellbare) Angebotsverteilung …

2
Matrixfaktorisierungsmodell für Empfehlungssysteme Wie kann die Anzahl der latenten Merkmale bestimmt werden?
Ich versuche, eine Matrixfaktorisierungstechnik für ein einfaches Bewertungsempfehlungssystem für Benutzerelemente zu entwerfen. Ich habe 2 Fragen dazu. Zuerst in einer einfachen Implementierung, die ich von der Matrixfaktorisierungstechnik für die Filmempfehlung gesehen habe, hat der Autor gerade die Dimensionen der latenten Merkmale initialisiert. Nennen wir es K der beiden latenten Merkmalsbenutzer- …

4
Wie wähle ich die Aufteilung in Random Forest für kategoriale Prädiktoren (Features) aus?
Ich verstehe, wie die beste Aufteilung für zufällige Gesamtstrukturen für numerische Prädiktoren (Merkmale) gewählt wird. Numerische Prädiktoren werden dann sortiert, dann wird für jeden Wert eine Gini-Verunreinigung oder Entropie berechnet und ein Schwellenwert ausgewählt, der die beste Aufteilung ergibt. Aber wie wird die beste Aufteilung für den kategorialen Prädiktor gewählt, …


2
Wenn n zunimmt, steigt der t-Wert in einem Hypothesentest an, aber die t-Tabelle ist genau das Gegenteil. Warum?
Die Formel für in einem Hypothesentest lautet: t = ˉ X - μtttt = X.¯- μσ^/ n- -- -√.t=X¯−μσ^/n. t=\frac{\bar{X}-\mu}{\hat \sigma/\sqrt{n}}. Wenn zunimmt, steigt der Wert gemäß der obigen Formel an. Aber warum nimmt der kritische Wert in der Tabelle ab, wenn (was eine Funktion von ) zunimmt?t t t …


2
Kombinieren von p-Werten aus verschiedenen statistischen Tests, die auf dieselben Daten angewendet wurden
Obwohl der Titel der Frage trivial erscheint, möchte ich erklären, dass er nicht so trivial ist, dass er sich von der Frage unterscheidet, denselben statistischen Test in ähnlichen Datensätzen anzuwenden, um ihn gegen eine Nullhypothese zu testen (Metaanalyse, zB unter Verwendung der Fisher-Methode zum Kombinieren von p-Werten). Was ich suche, …

2
Beispiele für eine Klasse SVM in R.
Ich versuche, SVM in einer Klasse in R auszuführen. Ich habe versucht, das Kernlab-Paket e1071 / ksvm zu verwenden. Aber ich bin mir nicht sicher, ob ich es richtig mache. Gibt es ein funktionierendes Beispiel für SVM einer Klasse in R? Ebenfalls, Ich gebe eine große Matrix von Prädiktoren als …
8 r  svm 

3
So testen Sie, ob die Varianz zweier Verteilungen unterschiedlich ist, wenn die Verteilungen nicht normal sind
Ich untersuche zwei geografisch isolierte Populationen derselben Art. Wenn ich die Verteilungen betrachte, sehe ich, dass beide bimodal sind (es gibt eine gewisse Saisonalität für ihr Auftreten), aber die Peaks in einer Population sind viel höher und viel schmaler (dh die Varianz der lokalen Peaks ist kleiner). Welche Art von …

1
Visualisierung von Längsschnittdaten mit binärem Ergebnis
Für Längsschnittdaten mit einem numerischen Ergebnis kann ich Spaghetti-Diagramme verwenden, um die Daten zu visualisieren. Zum Beispiel so etwas (entnommen aus der UCLA Stats-Site): tolerance<-read.table("http://www.ats.ucla.edu/stat/r/faq/tolpp.csv",sep=",", header=T) head(tolerance, n=10) interaction.plot(tolerance$time, tolerance$id, tolerance$tolerance, xlab="time", ylab="Tolerance", legend=F) Aber was ist, wenn mein Ergebnis binär 0 oder 1 ist? Zum Beispiel zeigt in den …

1
Selbstorganisierende Karten gegen Kernel k-means
Für eine Anwendung möchte ich Daten (möglicherweise hochdimensional) gruppieren und die Wahrscheinlichkeit der Zugehörigkeit zu einem Cluster extrahieren. Ich denke im Moment über selbstorganisierende Karten oder Kernel-K-Mittel nach, um die Arbeit zu erledigen. Was sind die Vor- und Nachteile jedes Klassifikators für diese Aufgabe? Vermisse ich andere Clustering-Algorithmen, die in …

1
Welche Methode simuliert p-Werte aus der erneuten Abtastung aus den Daten?
Vor einiger Zeit stellte ich eine Frage zu Korrelationszeiten zwischen Zeitstempeln und erhielt eine Antwort von Peter Ellis, dass ich mittlere Entfernungen zwischen Codes berechnen könnte ... Dies gibt Ihnen bereits einen Eindruck davon, welche Verhaltensweisen zusammengefasst sind, aber Sie sollten auch überprüfen, ob dies nicht nur zufällig plausibel ist. …

3
Demonstration der Stichprobenquantilvorspannung
Während einiger Simulationen wurde mir klar, dass das Probenquantil ein voreingenommener Schätzer des wahren Quantils ist. Und nach meinen Simulationen eine möglicherweise sehr voreingenommene. Ich war von diesem Ergebnis überrascht, da die empirische CDF nicht voreingenommen ist, aber nach einigen Internetrecherchen stellte ich fest, dass es wahr ist . Ich …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.