Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


1
Erwarteter Wert und Varianz der Stichprobenkorrelation
Ich habe nach einem Ausdruck für den erwarteten Wert und die Varianz des Stichproben-Korrelationskoeffizienten gesucht. Die meisten Quellen, die ich gefunden habe, führen als Varianz des Stichproben-Korrelationskoeffizienten auf, dies setzt jedoch voraus und folgen einer bivariaten Normalverteilung.Var(Cor(X,Y))≈1−ρ2n−2,Var(Cor(X,Y))≈1−ρ2n−2, Var(Cor(X, Y)) \approx \frac{1-\rho^2}{n-2}, XXXYYY Es scheint auch verschiedene Ansätze zur Reihenerweiterung der …

1
Wie identifiziere ich Ausreißer und führe eine Modelldiagnose für ein lme4-Modell durch?
Ich muss Ausreißer und hohe Hebelpunkte identifizieren und eine Modelldiagnose in einem lme4Modell durchführen. Für Ausreißer und hohe Hebelpunkte wäre es schön, einfach ein Diagramm zur visuellen Inspektion zu erstellen, das jedoch nicht ausreicht. Ich habe 10.800 Datenpunkte und muss jeden Punkt über einen Analyse- oder Computertest entweder als Ausreißer …

4
Zeitreihenanalyse: Da die Volatilität von der Zeit abhängt, warum sind die Renditen stationär?
Ich führe einen Dickey Fuller-Test durch, um festzustellen, ob die Aktienrenditen stationär sind. Ich verstehe, egal welche Bestandsaufnahme ich mache, seine Rückkehr ist stationär. Ich weiß nicht, warum ich dieses Ergebnis erhalte, da klar ist, dass die Volatilität von der Zeit abhängt (daher sind die Renditen nicht stationär, da ihre …

1
KDE für zensierte Daten
Ich habe eine Stichprobe von Beobachtungen, bei denen etwa der Beobachtungen rechtszensiert sind. Ich möchte einen Kernel-Dichteschätzer an diese Stichprobe anpassen, habe jedoch keine Standardmethode dafür gefunden. Gibt es eine allgemein anerkannte Methode zur Anpassung eines KDE bei zensierten Beobachtungen?30%30%30\%

2
Reicht die logarithmische Transformation aus, um jede Verteilung zu zähmen?
Heute habe ich eine ziemlich bekannte Tatsache erkannt. Die logTransformation einer Zufallsvariablen, die aus einer Fettschwanzverteilung gezogen wird, wird in eine exponentielle Schwanzverteilung abgebildet . Meine Frage ist sehr einfach: Reicht der Logarithmus aus, um jede Verteilung zu zähmen? Ich kenne keine Distributionen, die extremer sind als die Pareto-Distribution, dann …

4
Was ist die mathematisch strenge Definition von klobigen Daten?
Bestimmte Messgeräte unterliegen am Arbeitsplatz einer unterschiedlichen numerischen Genauigkeit. In einigen Fällen kann die Genauigkeit ziemlich schwach sein (dh nur auf einen oder zwei signifikante Werte). Anstelle von Datensätzen wie diesen: wobei jeder der Werte eindeutig ist, erhalten wir einen Datensatz, der wie aussieht: Auf einem einzelnen Bewegungsbereichsdiagramm grafisch dargestellt, …

2
Warum ist die Multiplikation im Frequenzbereich gleich der Faltung im Zeitbereich?
Diese Frage wurde im Zusammenhang mit dem Verständnis gestellt, wie eine Verteilung einer Summe von zwei iid-Zufallsvariablen erhalten werden kann. Ich arbeite an der besten Antwort auf diese Frage. Betrachten Sie die Summe von Gleichverteilungen auf oder . Warum verschwindet die Spitze im PDF von für ? nnn[0,1][0,1][0,1]ZnZnZ_nZnZnZ_nn≥3n≥3n \geq 3und …



2
Kombinieren von binomialen Zufallsvariablen
(Haftungsausschluss: Dies ist keine Hausaufgabenfrage). Ich versuche, mir selbst eine elementare Wahrscheinlichkeit beizubringen, und ich dachte an das folgende Beispiel: Stellen Sie sich vor, Sie spielen ein Spiel mit zwei Münzen. Um das Spiel zu gewinnen, müssen Sie die Köpfe vor Ihrem Gegner drehen. Das heißt, wenn sie zuerst den …

1
Beziehung zwischen Eigenvektoren von und im Kontext von PCA
In Christopher Bishops Buch Pattern Recognition and Machine Learning enthält der Abschnitt über PCA Folgendes: Bei einer zentrierten Datenmatrix mit der Kovarianzmatrix lautet die Eigenvektorgleichung:XX\mathbf{X}N−1XTXN−1XTXN^{-1}\mathbf{X}^T\mathbf{X} N−1XTXui=λiui.N−1XTXui=λiui.N^{-1}\mathbf{X}^T\mathbf{X} \mathbf{u}_i = \lambda_i \mathbf{u}_i. Bishop definiert und behauptet, wenn und eine Einheitslänge haben, dann:vi=Xuivi=Xui\mathbf{v}_i = \mathbf{X} \mathbf{u}_iuiui\mathbf{u}_ivivi\mathbf{v}_i ui=1(Nλi)12XTvi.ui=1(Nλi)12XTvi.\mathbf{u}_i = \frac{1}{(N\lambda_i)^{\frac{1}{2}}}\mathbf{X}^T\mathbf{v}_i. Woher kommt die Quadratwurzel? …



1
Wann sollten RBF-Netzwerke anstelle von mehrschichtigem Perzeptron verwendet werden?
Ich verstehe, dass ein neuronales Netzwerk mit radialer Basisfunktion (RBF) normalerweise eine verborgene Schicht hat und sich von einem mehrschichtigen Perzeptron (MLP) unter anderem durch seine Aktivierungs- und Kombinationsfunktionen unterscheidet, aber wie entscheide ich, wann ein Datensatz / Problem ist besser für einen RBF anstelle eines MLP geeignet? Muss ich …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.