Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Zufällige Gesamtstruktur für gruppierte Daten
Ich verwende zufällige Gesamtstruktur für hochdimensionale gruppierte Daten (50 numerische Eingabevariablen), die eine hierachische Struktur haben. Die Daten wurden mit 6 Replikationen an 30 Positionen von 70 verschiedenen Objekten gesammelt, was zu 12600 Datenpunkten führte, die nicht unabhängig sind. Es scheint, dass eine zufällige Gesamtstruktur die Daten überpasst, da der …

1
Einwände gegen die Randomisierung
In klinischen Studien - eine methodologische Perspektive , schreibt Steven Piantadosi (Kap. 13, S. 334): In Kapitel 2 habe ich die Einwände von Abel und Koch (1997) und Urbach (1993) gegen die Randomisierung zur Kenntnis genommen und darauf hingewiesen, dass es sich lohnt, ihre Bedenken und wahrscheinlichen Fehler zu untersuchen. …



1
vcovHC, vcovHAC, NeweyWest - welche Funktion soll verwendet werden?
Ich versuche, mein lm () -basiertes Modell zu aktualisieren, um korrekte Standardfehler und -tests zu erhalten. Ich bin wirklich verwirrt, welche VC-Matrix ich verwenden soll. Die sandwichPaketangebote vcovHC, vcovHACund NeweyWest. Während erstere nur die Heteroskedastizität erklären, erklären die beiden letzteren sowohl die serielle Korrelation als auch die Heteroskedastizität. Die Dokumentation …

1
Kalman-Filter vs. Glättungskeile
F: Für welche Daten ist es geeignet, Zustandsraummodellierung und Kalman-Filterung zu verwenden, anstatt Splines zu glätten und umgekehrt? Gibt es eine Äquivalenzbeziehung zwischen den beiden? Ich versuche ein umfassendes Verständnis dafür zu bekommen, wie diese Methoden zusammenpassen. Ich habe Johnstones neue Gaußsche Schätzung durchgesehen : Sequenz- und Multiresolution-Modelle . Es …

1
Können wir Korrelationen zwischen Gruppen vergleichen, indem wir Regressionssteigungen vergleichen?
In dieser Frage fragen sie, wie Pearson r für zwei unabhängige Gruppen (wie Männer gegen Frauen) verglichen werden kann. Antworten und Kommentare schlugen zwei Möglichkeiten vor: Verwenden Sie die bekannte Formel von Fisher unter Verwendung der "z-Transformation" von r; Verwenden Sie den Vergleich von Steigungen (Regressionskoeffizienten). Letzteres könnte einfach über …

3
Lineare Regression mit Faktoren in R.
Ich versuche zu verstehen, wie genau Faktoren in R funktionieren. Angenommen, ich möchte eine Regression mit einigen Beispieldaten in R ausführen: > data(CO2) > colnames(CO2) [1] "Plant" "Type" "Treatment" "conc" "uptake" > levels(CO2$Type) [1] "Quebec" "Mississippi" > levels(CO2$Treatment) [1] "nonchilled" "chilled" > lm(uptake ~ Type + Treatment, data = CO2) …




1
Wie generieren Sie ROC-Kurven für eine einmalige Kreuzvalidierung?
Bei der Durchführung einer 5-fachen Kreuzvalidierung (zum Beispiel) ist es typisch, eine separate ROC-Kurve für jede der 5-fachen und häufig eine mittlere ROC-Kurve mit Standard zu berechnen. dev. als Kurvendicke dargestellt. Für die LOO-Kreuzvalidierung, bei der nur ein einziger Testdatenpunkt in jeder Falte vorhanden ist, erscheint es jedoch nicht sinnvoll, …

4
Gutes Buch über den theoretischen Ansatz zur Statistik
Als ich vor 10 Jahren als Student Kurse in theoretischer Statistik belegte, verwendeten wir Modern Mathematical Statistics von Dudewicz und Mishra. Ich beziehe mich jetzt auf das Buch und werde daran erinnert, dass einige der Codebeispiele für eine IBM 370 in Montage sind. Ich bin zwar urig, aber ich kann …
10 references 

2
Gibt an, ob ein Offset in einer Poisson-Regression verwendet werden soll, wenn die von Hockeyspielern erzielten Karriereziele insgesamt prognostiziert werden
Ich habe eine Frage, ob ich einen Offset verwenden soll oder nicht. Nehmen Sie ein sehr einfaches Modell an, in dem Sie die (Gesamt-) Anzahl der Tore im Hockey beschreiben möchten. Sie haben also Tore, die Anzahl der gespielten Spiele und eine Dummy-Variable "Stürmer", die gleich 1 ist, wenn der …

2
Links schief gegen symmetrische Verteilung beobachtet
Das ist für mich ziemlich schwer zu beschreiben, aber ich werde versuchen, mein Problem verständlich zu machen. Zuerst muss man wissen, dass ich bisher eine sehr einfache lineare Regression durchgeführt habe. Bevor ich den Koeffizienten schätzte, beobachtete ich die Verteilung meines . Es ist schwer links schief. Nachdem ich das …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.