Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Erklären von Kalman-Filtern in Zustandsraummodellen
Welche Schritte sind bei der Verwendung von Kalman-Filtern in Zustandsraummodellen erforderlich? Ich habe einige verschiedene Formulierungen gesehen, bin mir aber über die Details nicht sicher. Zum Beispiel beginnt Cowpertwait mit diesem Satz von Gleichungen: yt=F′tθt+vtyt=Ft′θt+vty_{t} = F^{'}_{t}\theta_{t}+v_{t} θt=Gtθt−1+wtθt=Gtθt−1+wt\theta_{t} = G_{t}\theta_{t-1}+w_{t} wobei und , sind unsere unbekannten Schätzungen und sind die …

1
Sollte ich die ungefähren Freiheitsgrade von Welch (1947) oder die von Satterthwaite (1946) verwenden?
Ich bin verwirrt über die richtige Formel für ungefähre Freiheitsgrade für den Welch-T-Test. Die Formel von Satterthwaite (1946) ist die am häufigsten zitierte Formel, aber Welch gab 1947 eine Alternative. Ich bin mir nicht sicher, welche vorzuziehen ist (oder von den meisten statistischen Programmen verwendet wird). Satterthwaites Formel: (s2x/nx+s2y/ny)2(s2x/nx)2/(nx−1)+(s2y/ny)2/(ny−1)(sx2/nx+sy2/ny)2(sx2/nx)2/(nx−1)+(sy2/ny)2/(ny−1)\frac{\left(s_x^2/n_x +s_y^2/n_y\right)^2}{(s_x^2/n_x …

3
Wie interpretiert man eine Hazard Ratio aus einer kontinuierlichen Variablen - Differenzeinheit?
Ich lese einen Artikel, der Hazard Ratios für kontinuierliche Variablen zeigt, bin mir aber nicht sicher, wie ich die angegebenen Werte interpretieren soll. Mein derzeitiges Verständnis der Gefährdungsquoten ist, dass die Zahl die relative Wahrscheinlichkeit von [Ereignis] unter bestimmten Bedingungen darstellt. Beispiel: Wenn die Hazard Ratio für den Tod durch …

2
Ist eine Zwei-Wege-ANOVA angemessen?
Dies ist die Beschreibung meiner Studie. Ich experimentiere mit drei Pflanzen: A, B und C. Diese Pflanzen sollen den Blutzucker bei Diabetikern senken. Ich möchte feststellen, welche dieser drei Pflanzen nach einmaliger Verabreichung an Mäuse einen längeren Einfluss auf die Blutzuckersenkung hat. Dies erfolgt durch Messung des Blutzuckers von Mäusen …

2
Fehlerausbreitung SD vs SE
Ich habe 3 bis 5 Maße eines Merkmals pro Person unter zwei verschiedenen Bedingungen (A und B). Ich Plotten der Durchschnitt für jedes einzelne in jedem Zustand und I verwenden , um die Standardfehler ( dh , , wobei = Anzahl der Messungen) als Fehlerbalken. N.SD/N−−√SD/NSD/\sqrt{N}NNN Jetzt möchte ich die …

2
Ist es sinnvoll, Konfidenzintervalle zu berechnen und Hypothesen zu testen, wenn Daten aus der gesamten Bevölkerung verfügbar sind?
Ist es sinnvoll, Konfidenzintervalle zu berechnen und Hypothesen zu testen, wenn Daten aus der gesamten Bevölkerung verfügbar sind? Meiner Meinung nach lautet die Antwort nein, da wir die wahren Werte der Parameter genau berechnen können. Aber wie hoch ist dann der maximale Anteil an Daten aus der ursprünglichen Population, der …


6
Flexible und unflexible Modelle beim maschinellen Lernen
Ich stieß auf eine einfache Frage zum Vergleich flexibler Modelle (dh Splines) mit unflexiblen Modellen (z. B. lineare Regression) unter verschiedenen Szenarien. Die Frage ist: Erwarten wir im Allgemeinen, dass die Leistung einer flexiblen statistischen Lernmethode besser oder schlechter abschneidet als eine unflexible Methode, wenn: Die Anzahl der Prädiktoren ppp …


2
Fit-Test: Frage zum Anderson-Darling-Test und zum Cramér-von-Mises-Kriterium
Ich lese Webseiten für gute Anpassungstests, als ich zum Anderson-Darling-Test und zum Cramér-von-Mises-Kriterium kam . Bisher habe ich verstanden; es scheint, dass der Anderson-Darling-Test und das Cramér-von-Mises-Kriterium ähnlich sind, nur basierend auf einer anderen Gewichtungsfunktion . Es gibt auch eine Variante des Cramér-von-Mises-Kriteriums namens Watson-Test .www Grundsätzlich habe ich hier …

3
Verwirrung in Bezug auf elastisches Netz
Ich habe diesen Artikel über elastisches Netz gelesen. Sie sagen, dass sie ein elastisches Netz verwenden, denn wenn wir nur Lasso verwenden, wird tendenziell nur ein Prädiktor unter den Prädiktoren ausgewählt, die stark korreliert sind. Aber wollen wir das nicht? Ich meine, es erspart uns die Mühe der Multikollinearität, nicht …

1
Warum verwenden Statistiker gegenseitige Informationen nicht als Maß für die Assoziation?
Ich habe ein paar Gespräche von Nicht-Statistikern gesehen, in denen sie Korrelationsmaße offenbar neu erfinden, indem sie gegenseitige Informationen anstelle von Regression (oder gleichwertigen / eng verwandten statistischen Tests) verwenden. Ich nehme an, es gibt einen guten Grund, warum Statistiker diesen Ansatz nicht verfolgen. Mein Laie versteht, dass Schätzer von …




Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.