Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Unterschied zwischen PCA und spektraler Clusterbildung für einen kleinen Satz von Booleschen Merkmalen
Ich habe einen Datensatz von 50 Proben. Jede Stichprobe besteht aus 11 (möglicherweise korrelierten) Booleschen Merkmalen. Ich möchte einige Beispiele für die Visualisierung dieser Beispiele in einem 2D-Diagramm geben und untersuchen, ob sich unter den 50 Beispielen Cluster / Gruppierungen befinden. Ich habe die folgenden zwei Ansätze ausprobiert: (a) Führen …


2
Mittelwertunterschied vs. mittlerer Unterschied
Wenn wir zwei unabhängige Stichprobenmittel untersuchen, wird uns gesagt, dass wir den "Unterschied zweier Mittel" betrachten. Dies bedeutet, dass wir den Mittelwert von Population 1 ( ) nehmen und den Mittelwert von Population 2 ( ) davon subtrahieren . Unsere "Differenz zweier Mittel" ist also ( - ).y¯1y¯1\bar y_1y¯2y¯2\bar y_2y¯1y¯1\bar …

3
Eine Normale geteilt durch
sei und .Z∼N(0,1)Z∼N(0,1)Z \sim N(0,1)W∼χ2(s)W∼χ2(s)W \sim \chi^2(s) Wenn und unabhängig voneinander verteilt sind, folgt die Variable einer Verteilung mit Freiheitsgraden .W Y = Z.ZZZWWW tsY=ZW/s√Y=ZW/sY = \frac{Z}{\sqrt{W/s}}tttsss Ich suche einen Beweis für diese Tatsache, eine Referenz ist gut genug, wenn Sie nicht das vollständige Argument aufschreiben möchten.


2
Gute Beispiele für Statistikabschnitte in angewandten wissenschaftlichen Zeitschriftenartikeln
Ich bin ein Biostatistiker, der in einem angewandten Bereich arbeitet, und ich bin dafür verantwortlich, den Abschnitt über statistische Methoden für die Arbeiten zu schreiben, an denen ich zusammenarbeite. Beim Lesen vieler akademischer Arbeiten bin ich auf viele Beispiele für schlecht geschriebene Statistikabschnitte gestoßen (meistens sind sie langweilig, nicht informativ …

2
Bewerten Sie die posteriore prädiktive Verteilung in der Bayes'schen linearen Regression
Ich bin verwirrt darüber, wie die posteriore prädiktive Verteilung für die Bayes'sche lineare Regression nach dem hier auf Seite 3 beschriebenen und unten kopierten Grundfall bewertet werden soll. p ( y~∣ y)=∫p(y~∣β,σ2)p(β,σ2∣y)p(y~∣y)=∫p(y~∣β,σ2)p(β,σ2∣y) p(\tilde y \mid y) = \int p(\tilde y \mid \beta, \sigma^2) p(\beta, \sigma^2 \mid y) Der Grundfall ist …

2
Können Sie die Leistung eines Kolmogorov-Smirnov-Tests in R berechnen?
Ist es möglich, eine Leistungsanalyse für einen zweiseitigen Kolmogorov-Smirnov-Test in R durchzuführen? Ich teste mit ks.test (), ob sich zwei empirische Verteilungen unterscheiden, und möchte eine Leistungsanalyse hinzufügen. Ich konnte in R keine integrierten Leistungsanalysen für KS-Tests finden. Irgendwelche Vorschläge? Bearbeiten : Dies sind zufällig generierte Verteilungen, die meinen Daten …

1
Fast sichere Konvergenz bedeutet keine vollständige Konvergenz
Wir sagen, konvergieren vollständig zu wenn für jedes .X1,X2,…X1,X2,…X_1, X_2, \ldotsXXXϵ&gt;0ϵ&gt;0\epsilon>0 ∑∞n=1P(|Xn−X|&gt;ϵ)&lt;∞∑n=1∞P(|Xn−X|&gt;ϵ)&lt;∞\sum_{n=1}^\infty \text{P}\left(|X_n-X|>\epsilon\right) <\infty Mit Borel Cantellis Lemma ist es einfach zu beweisen, dass vollständige Konvergenz eine fast sichere Konvergenz impliziert. Ich suche ein Beispiel, bei dem die Konvergenz mit Borel Cantelli fast nicht nachgewiesen werden kann. Dies ist eine …

1
Die Formel für Bayes'sche A / B-Tests macht keinen Sinn
Ich verwende die Formel aus dem Bayes'schen Ab-Test , um die Ergebnisse des AB-Tests nach der Bayes'schen Methode zu berechnen. Pr(pB&gt;pA)=∑i=0αB−1B(αA+i,βB+βA)(βB+i)B(1+i,βB)B(αA,βA)Pr(pB&gt;pA)=∑i=0αB−1B(αA+i,βB+βA)(βB+i)B(1+i,βB)B(αA,βA) \Pr(p_B > p_A) = \sum^{\alpha_B-1}_{i=0} \frac{B(\alpha_A+i,\beta_B+\beta_A)}{(\beta_B+i)B(1+i,\beta_B)B(\alpha_A, \beta_A)} wo αAαA\alpha_A in eins plus die Anzahl der Erfolge für A. βAβA\beta_A in eins plus die Anzahl der Fehler für A. αBαB\alpha_B …
10 r  bayesian  ab-test 

2
Implementierung einer verschachtelten Kreuzvalidierung
Ich versuche herauszufinden, ob mein Verständnis der verschachtelten Kreuzvalidierung korrekt ist. Deshalb habe ich dieses Spielzeugbeispiel geschrieben, um zu sehen, ob ich Recht habe: import operator import numpy as np from sklearn import cross_validation from sklearn import ensemble from sklearn.datasets import load_boston # set random state state = 1 # …

3
Wie klassifiziere ich einen unausgeglichenen Datensatz nach Convolutional Neural Networks (CNN)?
Ich habe einen unausgeglichenen Datensatz in einer binären Klassifizierungsaufgabe, bei der die positive Menge gegenüber der negativen Menge 0,3% gegenüber 99,7% beträgt. Die Kluft zwischen Positiven und Negativen ist groß. Wenn ich ein CNN mit der im MNIST-Problem verwendeten Struktur trainiere, zeigt das Testergebnis eine hohe False Negative Rate. Außerdem …

1
Was ist die asymptotische Kovarianzmatrix?
Stimmt es, dass die asymptotische Kovarianzmatrix gleich der Kovarianzmatrix der Parameterschätzungen ist? Wenn nicht, was ist das? Und was ist in diesem Fall der Unterschied zwischen der Kovarianzmatrix und der asymptotischen Kovarianzmatrix? Danke im Voraus!


1
Ist eine geschlossene Menge eine Konvention beim Testen von Hypothesen?
Beim Testen statistischer Hypothesen hat die Nullhypothese häufig die Form (zumindest in den Büchern, die ich gelesen habe): oder H0H0H_0H0:H0:θ=θ0θ≤θ0H0:θ=θ0H0:θ≤θ0 \begin{align*} H_0:&\theta=\theta_0\\ H_0:&\theta\le\theta_0 \end{align*} H0:θ1≤θ≤θ2H0:θ1≤θ≤θ2 H_0:\theta_1\le\theta\le\theta_2 Ist es nur eine Konvention, dass die Mengen in H0H0H_0 geschlossen sind? Oder gibt es noch andere Gründe?

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.