Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


1
Analytische Lösung der Probenahme mit oder ohne Ersatz nach Poisson / Negativ-Binomial
Kurzfassung Ich versuche, die zusammengesetzte Wahrscheinlichkeit, die sich aus unabhängigen Poisson-Ziehungen und weiteren Stichproben mit oder ohne Ersatz ergibt, analytisch zu lösen / zu approximieren (es ist mir eigentlich egal, welche). Ich möchte die Wahrscheinlichkeit mit MCMC (Stan) verwenden, daher benötige ich die Lösung nur bis zu einer konstanten Laufzeit. …

1
Wie heißt die Verteilungsfamilie mit PDF proportional zu ?
Betrachten Sie eine Familie von Verteilungen mit PDF (bis zu einer Proportionalitätskonstante), die durch Wie heißt es? Wenn es keinen Namen hat, wie würden Sie es nennen?p(x)∼1(1+αx2)1/α.p(x)∼1(1+αx2)1/α.p(x)\sim \frac{1}{(1+\alpha x^2)^{1/\alpha}}. Es sieht der Familie der Verteilungen mit PDF, das proportional zu ziemlich ähnlichp ( x ) ≤ 1tttp(x)∼1(1+1νx2)(ν+1)/2.p(x)∼1(1+1νx2)(ν+1)/2.p(x)\sim \frac{1}{(1+\frac{1}{\nu} x^2)^{(\nu+1)/2}}. Wenn …

1
Intuitive Erklärung / Motivation der stationären Verteilung eines Prozesses
In der Literatur waren Autoren häufig daran interessiert, die stationäre Verteilung eines Zeitreihenprozesses zu finden. Betrachten Sie beispielsweise den folgenden einfachen AR ( ) -Prozess : wobei .111{Xt}{Xt}\{X_t\}Xt=αXt−1+et,Xt=αXt−1+et,X_t = \alpha X_{t-1} + e_t, et∼iidfet∼iidfe_t\stackrel{iid}{\thicksim} f Was könnte möglicherweise die Motivation (en) sein, die stationäre Verteilung eines stochastischen Prozesses zu finden? …

1
Bayesianische Optimierung für nicht-Gaußsches Rauschen
Eine Black-Box-Funktion , die punktweise unter Berücksichtigung des Gaußschen Rauschens ausgewertet wird, dh kann mithilfe der Bayes'schen Optimierung minimiert werden, wobei ein Gaußscher Prozess als verrauschtes Funktionsmodell verwendet wird.f: R.n→ R.f::R.n→R.f: \mathbb{R}^n \rightarrow \mathbb{R}f( x ) + N.( μ ( x ) , σ(x )2)f(x)+N.(μ(x),σ(x)2)f(x) + \mathcal{N}(\mu(x),\sigma(x)^2) Wie kann die …

2
Was sind die jüngsten Arbeiten und Forschungsbereiche im Bereich der asymptotischen Inferenz (Theorie großer Stichproben)?
Was sind einige aktuelle bedeutende theoretische Arbeiten, die auf dem Gebiet der asymptotischen Inferenz / Theorie großer Stichproben durchgeführt wurden? Was ist der aktuelle Forschungsumfang in diesem Bereich? Gibt es ein offenes Problem oder bestimmte Bereiche, in denen sich die Theorie in jüngster Zeit entwickelt? Oder ist es ein totes …

1
Intuition (geometrisch oder anders) von
Betrachten Sie in einer anderen Folge von Intuitionen für Identitäten in der Wahrscheinlichkeit das elementare Identitätsgesetz der Gesamtvarianz V a r (X.)=E [ V a r (X | Y)]+ V a r (E[X | Y])V.einr(X.)=E.[V.einr(X.|Y.)]]+V.einr(E.[X.|Y.]]) \begin{eqnarray} \rm{Var}(X) &=&\rm{E}[\rm{Var}(X|Y)] + \rm{Var}(E[X|Y]) \end{eqnarray} Es ist eine einfache, unkomplizierte algebraische Manipulation der Definition …

1
Vergleichen von Gruppen in FE-Modellen mit wiederholten Messungen mit einer verschachtelten Fehlerkomponente, geschätzt unter Verwendung von plm
Ich habe einige Modelle mit festen Effekten und wiederholten Messungen mit einer verschachtelten Fehlerkomponente geschätzt, die auf Gruppierungsvariablen basieren, dh nicht verschachtelten Modellen, die plm verwenden . Ich bin jetzt interessiert daran Testen Sie, ob die vollständigen Modelle signifikant unterschiedlich sind, dh wobei das vollständige Modell für und das vollständige …

2
Ein Beispiel für die Verwendung der Genauigkeit als Ergebnismaß führt zu einer falschen Schlussfolgerung
Ich untersuche verschiedene Leistungsmessungen für Vorhersagemodelle. Es wurde viel über Probleme bei der Verwendung von Genauigkeit geschrieben, anstatt über etwas Kontinuierlicheres, um die Modellleistung zu bewerten. Frank Harrell http://www.fharrell.com/post/class-damage/ liefert ein Beispiel, wenn das Hinzufügen einer informativen Variablen zu einem Modell zu einem Rückgang der Genauigkeit, einer eindeutig eingängigen und …


4
Beweisen Sie, dass als
Statistische Probleme mit Konfidenzintervallen für einen Populationsmittelwert können anhand der folgenden Gewichtungsfunktion dargestellt werden : w(α,n)≡tn−1,α/2n−−√for 0&lt;α&lt;1 and n&gt;1.w(α,n)≡tn−1,α/2nfor 0&lt;α&lt;1 and n&gt;1.w(\alpha, n) \equiv \frac{t_{n-1,\alpha/2}}{\sqrt{n}} \quad \quad \quad \quad \text{for } 0<\alpha<1 \text{ and } n > 1. Zum Beispiel kann das Standard- Konfidenzintervall der klassischen Ebene für den Mittelwert …

2
Frau A wählt zufällig eine Zahl aus der Gleichverteilung auf . Dann zeichnet Herr B wiederholt und unabhängig Zahlen
Frau A wählt zufällig eine Zahl aus der Gleichverteilung auf . Dann zieht Herr B wiederholt und unabhängig die Zahlen aus der Gleichverteilung auf , bis er eine Zahl größer als erhält , und stoppt dann. Die erwartete Summe der Zahl, die Herr B bei zieht, ist gleich?XXX[0,1][0,1][0, 1]Y1,Y2,...Y1,Y2,...Y_1, Y_2, …

1
Zufällige Gesamtstruktur in einer Big Data-Einstellung
Ich habe einen Datensatz mit 5.818.446 Zeilen und 51 Spalten, von denen 50 Prädiktoren sind. Meine Antwort ist quantitativ, daher interessiere ich mich für ein Regressionsmodell. Ich versuche, mithilfe des Caret-Pakets einen zufälligen Wald an meine Daten anzupassen. Ich habe jedoch nicht genug RAM, um dies zu tun. Ich habe …


1
Definition der Softmax-Funktion
Diese Frage wird unter stats.stackexchange.com/q/233658 beantwortet Das logistische Regressionsmodell für die Klassen {0, 1} lautet P(y=1|x)=exp(wTx)1+exp(wTx)P(y=0|x)=11+exp(wTx)P(y=1|x)=exp⁡(wTx)1+exp⁡(wTx)P(y=0|x)=11+exp⁡(wTx) \mathbb{P} (y = 1 \;|\; x) = \frac{\exp(w^T x)}{1 + \exp(w^T x)} \\ \mathbb{P} (y = 0 \;|\; x) = \frac{1}{1 + \exp(w^T x)} Diese Wahrscheinlichkeiten summieren sich eindeutig zu 1. Durch Setzen von …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.