Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren



1
Beispiele dafür, wann Konfidenzintervall und glaubwürdiges Intervall zusammenfallen
In dem Wikipedia-Artikel über glaubwürdiges Intervall heißt es: Für den Fall eines einzelnen Parameters und von Daten, die in einer einzigen ausreichenden Statistik zusammengefasst werden können, kann gezeigt werden, dass das glaubwürdige Intervall und das Konfidenzintervall zusammenfallen, wenn der unbekannte Parameter ein Standortparameter ist (dh die Vorwärtswahrscheinlichkeitsfunktion hat die Form …


1
Welche Art von Residuen und Cooks Abstand werden für GLM verwendet?
Weiß jemand, wie die Formel für Cooks Distanz lautet? Die ursprüngliche Cook-Distanzformel verwendet studentisierte Residuen, aber warum verwendet R std. Pearson-Residuen bei der Berechnung des Entfernungsdiagramms des Cook für ein GLM. Ich weiß, dass studentisierte Residuen nicht für GLMs definiert sind, aber wie sieht die Formel zur Berechnung der Entfernung …

1
Welche grafischen Methoden sind nützlich, um zu visualisieren, wie sich Unsicherheiten aggregieren?
Ich habe eine Reihe von Systemen, in denen sich Unsicherheiten ansammeln. Diese sind nicht immer rein additiv - manchmal sind sie es, manchmal nicht. Ich hatte einige Erfolge bei der Verwendung von Fan-Charts, Balkendiagrammen mit Konfidenzintervallen und Box-Plots für die Kommunikation einzelner Elemente. Aber wie kann ich zeigen, wie sich …


1
Simulation von ARIMA (1,1,0) -Serien
Ich habe die ARIMA-Modelle an die ursprüngliche Zeitreihe angepasst, und das beste Modell ist ARIMA (1,1,0). Jetzt möchte ich die Serie von diesem Modell simulieren. Ich habe das einfache AR (1) -Modell geschrieben, konnte aber nicht verstehen, wie der Unterschied innerhalb des ARI-Modells (1,1,0) angepasst werden kann. Der folgende R-Code …
11 r  time-series  arima 

2
Varianz zweier gewichteter Zufallsvariablen
Lassen: Standardabweichung der ZufallsvariablenA=σ1=5A=σ1=5A =\sigma_{1}=5 Standardabweichung der ZufallsvariablenB=σ2=4B=σ2=4B=\sigma_{2}=4 Dann ist die Varianz von A + B: Var(w1A+w2B)=w21σ21+w22σ22+2w1w2p1,2σ1σ2Var(w1A+w2B)=w12σ12+w22σ22+2w1w2p1,2σ1σ2Var(w_{1}A+w_{2}B)= w_{1}^{2}\sigma_{1}^{2}+w_{2}^{2}\sigma_{2}^{2} +2w_{1}w_{2}p_{1,2}\sigma_{1}\sigma_{2} Wo: p1,2p1,2p_{1,2} ist die Korrelation zwischen den beiden Zufallsvariablen. w1w1w_{1} ist das Gewicht der Zufallsvariablen A. w2w2w_{2} ist das Gewicht der Zufallsvariablen B. w1+w2=1w1+w2=1w_{1}+w_{2}=1 Die folgende Abbildung zeigt die Varianz von …

4
Wie testest du eine Implementierung von k-means?
Haftungsausschluss: Ich habe diese Frage auf Stackoverflow gepostet, dachte aber, dass dies möglicherweise besser für diese Plattform geeignet ist. Wie testen Sie Ihre eigene k-means-Implementierung für mehrdimensionale Datensätze? Ich dachte daran, eine bereits vorhandene Implementierung (dh Matlab) für die Daten auszuführen und die Ergebnisse mit meinem Algorithmus zu vergleichen. Dies …

3
Wie führe ich einen T-Test mit großen Proben durch?
Ich habe zwei Populationen, eine mit N = 38.704 (Anzahl der Beobachtungen) und eine mit N = 1.313.662. Diese Datensätze haben ~ 25 Variablen, alle kontinuierlich. Ich nahm jeweils den Mittelwert in jedem Datensatz und berechnete die Teststatistik unter Verwendung der Formel t = mittlere Differenz / Standardfehler Das Problem …
11 t-test 

1
Warum die Cornish-Fisher-Erweiterung anstelle des Probenquantils verwenden?
Die Cornish-Fisher-Erweiterung bietet eine Möglichkeit, die Quantile einer Verteilung basierend auf Momenten abzuschätzen. (In diesem Sinne sehe ich es als Ergänzung zur Edgeworth-Erweiterung , die eine Schätzung der kumulativen Verteilung basierend auf Momenten liefert.) Ich würde gerne wissen, in welchen Situationen man die Cornish-Fisher-Erweiterung für empirische Arbeiten der vorziehen würde …

5
Wie kann gezeigt werden, dass zwei Analysemethoden gleichwertig sind?
Ich habe zwei verschiedene Analysemethoden, mit denen die Konzentration eines bestimmten Moleküls in einer Matrix gemessen werden kann (z. B. die Salzmenge in Wasser). Die beiden Methoden sind unterschiedlich und jede hat ihren eigenen Fehler. Welche Möglichkeiten es gibt, die beiden Methoden zu zeigen, ist äquivalent (oder nicht). Ich denke, …

2
Soft-Thresholding gegen Lasso-Bestrafung
Ich versuche, das, was ich bisher in der bestraften multivariaten Analyse verstanden habe, mit hochdimensionalen Datensätzen zusammenzufassen, und ich habe immer noch Schwierigkeiten, eine korrekte Definition von Soft-Thresholding vs. Lasso- Bestrafung (oder Bestrafung) zu erhalten.L1L1L_1 Genauer gesagt habe ich die spärliche PLS-Regression verwendet, um die 2-Block-Datenstruktur einschließlich genomischer Daten ( …

1
Wie unterschiedlich sind eingeschränkte kubische Splines und bestrafte Splines?
Ich lese viel über die Verwendung von Splines bei verschiedenen Regressionsproblemen. Einige Bücher (z. B. Hodges Richly Parrameterized Linear Models ) empfehlen bestrafte Splines. Andere (z. B. Harrell- Regressionsmodellierungsstrategien ) entscheiden sich für eingeschränkte kubische Splines. Wie unterschiedlich sind diese in der Praxis? Würden Sie oft wesentlich andere Ergebnisse erzielen, …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.