Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Erwartete Wurzel des quadratischen Zufallspolynoms
Angenommen, sind iid Zufallsvariablen mit gleichmäßiger Verteilung auf . Ich interessiere mich für die erwarteten Wurzeln des Polynoms , die komplexe Zufallsvariablen sind, die durch und A,B,CA,B,CA,B,C[−1,1][−1,1][-1,1]Ax2+Bx+CAx2+Bx+CAx^2 + Bx + CZ1=−B+B2−4AC−−−−−−−−√2AZ1=−B+B2−4AC2AZ_1 = \frac{-B+\sqrt{B^2-4AC}}{2A}Z2=−B−B2−4AC−−−−−−−−√2A.Z2=−B−B2−4AC2A.Z_2 = \frac{-B-\sqrt{B^2-4AC}}{2A}. Bei Simulationen berechnete ich und E[Z1]≈0.3559+0.0005iE[Z1]≈0.3559+0.0005iE[Z_1] \approx 0.3559 + 0.0005iE[Z2]≈−0.6421−0.0005i.E[Z2]≈−0.6421−0.0005i.E[Z_2] \approx -0.6421 - 0.0005i. Um …

1
Nichtparametrische nichtlineare Regression mit Vorhersageunsicherheit (neben Gaußschen Prozessen)
Was sind die neuesten Alternativen zu Gaußschen Prozessen (GP) für nichtparametrische nichtlineare Regression mit Vorhersageunsicherheit, wenn die Größe des Trainingssatzes für Vanille-Allgemeinmediziner unerschwinglich wird, aber immer noch nicht sehr groß ist? Details meines Problems sind: Der Eingaberaum ist niedrigdimensional (X⊆RdX⊆Rd\mathcal{X} \subseteq \mathbb{R}^dmit 2≤d≤202≤d≤202\le d \le 20) Ausgabe ist reellwertig (Y⊆RY⊆R\mathcal{Y} …

3
Was ist falsch an der Korrektur mehrerer Tests im Vergleich zu gemeinsamen Tests?
Ich frage mich, warum gesagt wird, dass mehrere Testkorrekturen "willkürlich" sind und dass sie auf einer inkohärenten Philosophie beruhen, die Die Richtigkeit einer Aussage hängt davon ab, welche anderen Hypothesen unterhalten werden siehe zB Antworten und Kommentare zu Was stimmt nicht mit Bonferroni-Anpassungen? und insbesondere die Diskussion zwischen @FrankHarrell und …

1
Wahrscheinlichkeit, ein Ereignis dreimal zu überleben
Bei einer Wahrscheinlichkeit von 60%, dass etwas passiert (z. B. Tod aufgrund einer medizinischen Diagnose), wie hoch ist die Wahrscheinlichkeit, dass die Person dies dreimal überleben kann? Zum Beispiel werden 40% der Menschen es überleben. Wie viele werden es dreimal überleben? Bin ich mit folgendem richtig? Total Outcomes: 300 (60 …


2
Bedeutet die Bestimmung des Mittelwerts und der SD den Verlust von einem oder zwei Freiheitsgraden?
Ich habe einige Zweifel daran, wie Freiheitsgrade in Verteilungen berücksichtigt werden. Insbesondere beziehen wir uns auf die Variable Studentttt t=x−x¯s^=x−x¯∑(xi−x¯)2N−1−−−−−−−√(1)(1)t=x−x¯s^=x−x¯∑(xi−x¯)2N−1t=\frac{x-\bar{x}}{\hat{s}}=\frac{x-\bar{x}}{\sqrt{\frac{\sum(x_i-\bar{x})^2}{N-1}}}\tag{1} Wo eine Gaußsche Variable ist, ist der Mittelwert, ist , die Standardabweichung von den Daten.xxxx¯x¯\bar{x}s^=∑(xi−x¯)2N−1−−−−−−−√s^=∑(xi−x¯)2N−1\hat{s}=\sqrt{\frac{\sum(x_i-\bar{x})^2}{N-1}} Die Schülerwahrscheinlichkeitsdichtefunktion istf(t)=C(1+t2ν)−ν+12(2)(2)f(t)=C(1+t2ν)−ν+12f(t)=C (1+\frac{t^2}{\nu})^{-\frac{\nu+1}{2}}\tag{2} Und in meinem Lehrbuch finde ich ν=N−1ν=N−1\nu=N-1 "weil in (1)(1)(1) der …

4
Funktioniert die ReLU-Schicht gut für ein flaches Netzwerk?
Ich arbeite derzeit am Training eines 5-Schicht-Neuronalen Netzwerks, habe einige Probleme mit der Tanh-Schicht und möchte die ReLU-Schicht ausprobieren. Aber ich fand, dass es für die ReLU-Schicht noch schlimmer wird. Ich frage mich, ob es daran liegt, dass ich nicht die besten Parameter gefunden habe oder einfach daran, dass ReLU …

1
Ungefährer Metropolis-Algorithmus - macht das Sinn?
Vor einiger Zeit fragte Xi'an, was das Äquivalent für cdfs von MCMC für pdfs ist. Die naive Antwort wäre, den "ungefähren" Metropolis-Algorithmus in Form zu verwenden Gegeben 1. Erzeuge 2. nimmX(t)=x(t)X(t)=x(t)X^{(t)} = x^{(t)}Y∼q(y|x(t))Y∼q(y|x(t))Y \sim q(y|x^{(t)})X(t+1)={Yx(t) with probability otherwise.min(F(Y+ε)−F(Y−ε)F(x(t)+ε)−F(x(t)−ε),1)X(t+1)={Y with probability min(F(Y+ε)−F(Y−ε)F(x(t)+ε)−F(x(t)−ε),1)x(t) otherwise. X^{(t+1)} = \begin{cases} Y & \text{ with probability …


4
Rolle der Dirac-Funktion in Partikelfiltern
Partikelnäherungen an Wahrscheinlichkeitsdichten werden häufig als gewichtete Summe von Dirac-Funktionen eingeführt p(x)≈∑i=1Nωiδ(x−xi)p(x)≈∑i=1Nωiδ(x−xi)p(x) \approx \sum_{i=1}^N \omega^i \delta(x-x^i) mit den Gewichten ωi∝p(xi)q(xi)ωi∝p(xi)q(xi)\omega^i \propto \frac{p(x^i)}{q(x^i)} normalisiert, so dass sie zur Einheit summieren; Dabei ist die Wichtigkeitsdichte. Ich verstehe , daß die Dirac - Funktion an einem Punkt unendlich groß wird , dh und …


2
Warum werden bei der Implementierung von t-SNE in R standardmäßig Duplikate entfernt?
Insbesondere hat die R-Implementierung von t-SNE im Rtsne-Paket das Argument "check_duplicates", und die Dokumentation schlägt vor, dass "es am besten ist, sicherzustellen, dass keine Duplikate vorhanden sind, und diese Option auf FALSE zu setzen, insbesondere für große Datenmengen". Wenn Sie versuchen, t-SNE für ein Dataset in R auszuführen, das Duplikate …
7 tsne 

1
Sind spektrale Zerlegungen von Zeitreihen für die Modellierung / Vorhersage nützlich oder eher ein Werkzeug zur Analyse?
Dies ist eine theoretische Frage. Ich bin auch neu in der Zeitreihenanalyse und versuche schnell zu lernen. Entschuldigung, wenn ein Teil meiner Terminologie nicht stimmt. Sie können Methoden zur Analyse und Modellierung von Zeitreihen lose in Zeitbereichs- und Frequenzbereichsansätze einteilen. Im Zeitbereich prognostizieren Modelle wie ARIMA basierend auf den jüngsten …


1
Varianz des Mittelwerts korrelierter und nicht korrelierter Daten
Ich habe diesen Absatz in James et al., Einführung in das statistische Lernen , S. 183-184 [1] gelesen: Da der Mittelwert vieler stark korrelierter Größen eine höhere Varianz aufweist als der Mittelwert vieler nicht so stark korrelierter Größen, weist die aus LOOCV resultierende Testfehlerschätzung tendenziell eine höhere Varianz auf als …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.