Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


1
Interpretation des Hartigans-Dip-Tests
Ich möchte einen Weg finden, um die Intensität der Bimodalität einiger Verteilungen zu quantifizieren, die ich empirisch erhalten habe. Nach allem, was ich gelesen habe, gibt es immer noch eine Debatte darüber, wie die Bimodalität quantifiziert werden kann. Ich habe mich für den Hartigans-Dip-Test entschieden, der der einzige auf R …
18 r  distributions 

1
Nachweis der LOOCV-Formel
Aus einer Einführung in das statistische Lernen von James et al. Geht hervor, dass die LOOCV-Schätzung (Leave-One-Out-Cross-Validation) durch wobei .CV(n)=1n∑i=1nMSEiCV(n)=1n∑i=1nMSEi\text{CV}_{(n)} = \dfrac{1}{n}\sum\limits_{i=1}^{n}\text{MSE}_iMSEi=(yi−y^i)2MSEi=(yi−y^i)2\text{MSE}_i = (y_i-\hat{y}_i)^2 Ohne Beweis besagt Gleichung (5.2), dass für eine Regression der kleinsten Quadrate oder des Polynoms (ob dies für die Regression nur einer Variablen gilt, ist mir …

2
Glätten - wann und wann nicht?
Auf William Briggs 'Blog gibt es einen ziemlich alten Beitrag , der sich mit den Fallstricken befasst, Daten zu glätten und diese geglätteten Daten zur Analyse zu bringen. Das Hauptargument ist nämlich: Wenn Sie in einem Moment des Wahnsinns Zeitreihendaten glätten und diese als Eingabe für andere Analysen verwenden, erhöhen …

5
Warum Extremwerttheorie verwenden?
Ich komme aus dem Bauingenieurwesen, in dem wir die Extremwerttheorie wie die GEV-Verteilung verwenden, um den Wert bestimmter Ereignisse vorherzusagen, z. B. Die größte Windgeschwindigkeit , dh den Wert, auf den 98,5% der Windgeschwindigkeit abfallen würden. Meine Frage ist, warum so eine Extremwertverteilung verwenden ? Wäre es nicht einfacher, wenn …

1
Positionieren der Pfeile auf einem PCA-Biplot
Ich möchte einen Biplot für die Hauptkomponentenanalyse (PCA) in JavaScript implementieren. Meine Frage ist, wie ermittle ich die Koordinaten der Pfeile aus dem U,V,DU,V,DU,V,D Ausgang der Singular Vector Decomposition (SVD) der Datenmatrix? Hier ist ein Beispiel-Biplot von R: biplot(prcomp(iris[,1:4])) Ich habe versucht, es im Wikipedia-Artikel über Biplot nachzuschlagen, aber es …
18 pca  svd  biplot 

3
Warum deutet die Lückenstatistik für k-means auf einen Cluster hin, obwohl es offensichtlich zwei davon gibt?
Ich verwende K-means, um meine Daten zu gruppieren, und suche nach einer Möglichkeit, eine "optimale" Clusternummer vorzuschlagen. Gap-Statistiken scheinen ein gängiger Weg zu sein, um eine gute Clusternummer zu finden. Aus irgendeinem Grund gibt es 1 als optimale Clusternummer zurück, aber wenn ich mir die Daten anschaue, ist es offensichtlich, …



1
Klartextbedeutung von "abhängigen" und "unabhängigen" Tests in der Literatur zu Mehrfachvergleichen?
Sowohl in der Literatur zur familienbezogenen Fehlerrate (FWER) als auch zur Falschentdeckungsrate (FDR) gelten bestimmte Methoden zur Steuerung von FWER oder FDR als geeignet für abhängige oder unabhängige Tests. Zum Beispiel schrieb Holm 1979 in dem Aufsatz "Ein einfaches sequentiell rejektives Mehrfachtestverfahren", um seine Step-up-Šidák-Methode mit seiner Step-up-Bonferroni-Kontrollmethode zu vergleichen: …

2
P-Wert in einem Two-Tail-Test mit asymmetrischer Nullverteilung
Meine Situation ist wie folgt: Ich möchte durch eine Monte-Carlo-Studie ppp Werte von zwei verschiedenen Tests auf statistische Signifikanz eines geschätzten Parameters vergleichen (null ist "kein Effekt - Parameter ist Null", und die implizierte Alternative ist " Parameter ist nicht Null "). Test A ist der standardmäßige "unabhängige t-Test mit …

5
Erkennen von Änderungen in Zeitreihen (R-Beispiel)
Ich möchte Änderungen in Zeitreihendaten erkennen, die normalerweise die gleiche Form haben. Bisher habe ich mit dem changepointPaket für R und den Funktionen cpt.mean(), cpt.var()und gearbeitet cpt.meanvar(). cpt.mean()mit der PELT-Methode funktioniert gut, wenn die Daten normalerweise auf einer Ebene bleiben. Änderungen möchte ich aber auch bei Abfahrten feststellen. Ein Beispiel …

3
Zum genauen Test von Fisher: Welcher Test wäre angebracht gewesen, wenn die Dame die Anzahl der ersten Tassen nicht gewusst hätte?
In dem berühmten Dame-Verkostungstee- Experiment von RA Fisher wird die Dame darüber informiert, wie viele Milch- / Tee-erste-Tassen es gibt (4 für jede von 8 Tassen). Dies respektiert die festgelegte marginale Gesamtannahme von Fischers genauem Test. Ich stellte mir vor, diesen Test mit meinem Freund zu machen, aber der Gedanke …

1
Blindquellentrennung von konvexem Gemisch?
Angenommen, ich habe unabhängige Quellen, und ich beobachte konvexe Gemische: X 1 , X 2 , . . . , X n m Y 1nnnX1, X2, . . . , XnX1,X2,...,XnX_1, X_2, ..., X_nmmmY.1. . .Y.m= a11X1+ a12X2+ ⋯ + a1 nXn= am 1X1+ am 2X2+ ⋯ +am nXnY1=a11X1+a12X2+⋯+a1nXn...Ym=am1X1+am2X2+⋯+amnXn\begin{align} Y_1 …
18 pca  ica 

1
Verwenden von Bootstrap unter H0, um einen Test auf die Differenz zweier Mittel durchzuführen: Ersetzen innerhalb der Gruppen oder innerhalb der gepoolten Probe
Angenommen, ich habe Daten mit zwei unabhängigen Gruppen: g1.lengths <- c (112.64, 97.10, 84.18, 106.96, 98.42, 101.66) g2.lengths <- c (84.44, 82.10, 83.26, 81.02, 81.86, 86.80, 85.84, 97.08, 79.64, 83.32, 91.04, 85.92, 73.52, 85.58, 97.70, 89.72, 88.92, 103.72, 105.02, 99.48, 89.50, 81.74) group = rep (c ("g1", "g2"), c (length …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.