Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Behoben gegen zufällige Effekte
Ich habe vor kurzem angefangen, etwas über verallgemeinerte lineare gemischte Modelle zu lernen, und habe R verwendet, um herauszufinden, welchen Unterschied es macht, die Gruppenmitgliedschaft entweder als festen oder als zufälligen Effekt zu behandeln. Insbesondere betrachte ich den hier diskutierten Beispieldatensatz: http://www.ats.ucla.edu/stat/mult_pkg/glmm.htm http://www.ats.ucla.edu/stat/r/dae/melogit.htm Wie in diesem Tutorial beschrieben, ist der …

1
Welches ist genauer glm oder glmnet?
R glm und glmnet verwenden unterschiedliche Algorithmen. Ich bemerke nicht triviale Unterschiede zwischen den geschätzten Koeffizienten, wenn ich beide verwende. Ich bin daran interessiert, wann eines genauer ist als das andere und wann die Zeit zum Lösen / zur Genauigkeit abgewogen wird. Insbesondere beziehe ich mich auf den Fall, in …

2
Welche Beziehung besteht zwischen kausaler Folgerung und Vorhersage?
Welche Beziehungen und Unterschiede bestehen zwischen kausaler Inferenz und Vorhersage (sowohl Klassifikation als auch Regression)? Im Vorhersagekontext haben wir die Prädiktor- / Eingangsvariablen und die Antwort- / Ausgangsvariablen. Bedeutet das, dass es einen kausalen Zusammenhang zwischen Eingabe- und Ausgabevariablen gibt? Gehört Vorhersage also zur kausalen Folgerung? Wenn ich das richtig …

1
Wie wählt LASSO unter kollinearen Prädiktoren aus?
Ich suche nach einer intuitiven Antwort, warum ein GLM LASSO-Modell einen bestimmten Prädiktor aus einer Gruppe stark korrelierter auswählt und warum dies anders ist als die Auswahl der besten Teilmengenfunktionen. Aus der in Abb. 2 in Tibshirani 1996 gezeigten Geometrie des LASSO gehe ich davon aus, dass LASSO den Prädiktor …




1
Diskrete Zeitrisikomodelle (Cloglog) in R.
Das survivalPaket in Rscheint sich auf kontinuierliche zeitliche Überlebensmodelle zu konzentrieren. Ich bin daran interessiert, eine zeitdiskrete Version eines proportionalen Gefährdungsmodells, des komplementären Log-Log-Modells, zu schätzen. Ich habe ein ziemlich einfaches Überlebensmodell mit einfacher richtiger Zensur. Ich weiß, dass eine Möglichkeit, dieses Modell zu schätzen, darin besteht, einen Datensatz zu …
10 r  survival 





3
Zeitlinienanalyse
Ich untersuche die Beziehung zwischen der Geburtsordnung einer Person und dem späteren Risiko von Fettleibigkeit anhand von Daten aus mehreren 1-Jahres-Geburtskohorten (z . B. http://www.ncbi.nlm.nih.gov/pmc/articles/PMC2908417/ ). Eine zentrale Herausforderung besteht darin, dass die Reihenfolge der Geburt mit anderen Merkmalen wie dem Alter der Mutter, der Anzahl der jüngeren und / …
10 timelines 

3
Visualisierung der Bayes'schen Anpassungsgüte für die logistische Regression
Für ein Bayes'sches logistisches Regressionsproblem habe ich eine posteriore prädiktive Verteilung erstellt. Ich nehme eine Stichprobe aus der Vorhersageverteilung und erhalte für jede meiner Beobachtungen Tausende von Stichproben von (0,1). Die Visualisierung der Anpassungsgüte ist weniger als interessant, zum Beispiel: Dieses Diagramm zeigt die 10 000 Proben + den beobachteten …

3
Zuweisen von Klassenbezeichnungen zu k-means-Clustern
Ich habe eine sehr grundlegende Frage zum Clustering. Wie interpretiere ich die Klassen der Datenpunkte, die ich geclustert habe (nachdem ich jedem Cluster aussagekräftige Klassenbezeichnungen zugewiesen habe), nachdem ich k Cluster mit ihren Schwerpunkten gefunden habe? Ich spreche nicht von der Validierung der gefundenen Cluster. Kann dies bei einem kleinen …
10 k-means 

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.