Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Voraussichtliche Häufigkeit, die Sie in einem Zustand einer absorbierenden Markov-Kette verbracht haben, angesichts des möglichen absorbierenden Zustands
Es ist bekannt, dass, wenn die Matrix der Übergangswahrscheinlichkeiten für den Übergangszustand ist und dann N_ {ij} beschreibt die erwartete Häufigkeit, mit der sich die Kette im Zustand j befindet , vorausgesetzt, sie beginnt im Zustand i . (Quelle: Wiki absorbierende Markov-Kette).QQQN=∑n=0∞Qn=(I−Q)−1N=∑n=0∞Qn=(I−Q)−1 N = \sum_{n=0}^{\infty} Q^n = (I - Q)^{-1}NijNijN_{ij}jjjiii …

1
Berry-Esseen für die Binomialverteilung gebunden
Aus dem Berry-Essen-Theorem kann ich ableiten supx ∈ R.∣∣∣P.(B ( p , n ) - n pn p q- -- -- -√≤ x ) - Φ ( x )∣∣∣≤C.(p2+q2)n p q- -- -- -√supx∈R.|P.(B.(p,n)- -npnpq≤x)- -Φ(x)|≤C.(p2+q2)npq\sup_{x\in\mathbb R}\left|P\left(\frac{B(p,n)-np}{\sqrt{npq}} \le x\right) - \Phi(x)\right| \le \frac{C(p^2+q^2)}{\sqrt{npq}} mit .C.≤ 0,4748C.≤0,4748C \le 0.4748 Meine Frage: …

1
Die verschiedenen Formulierungen für SVM verstehen
Ich arbeite kernlabjetzt seit mehr als einem Jahr mit, aber ich habe mich bei der C-svcKlassifizierung immer an die Vanilla cost ( ) -Formulierung gehalten . kernlabEnthält natürlich einige andere Formulierungen. Im Handbuch werden einige Klassifizierungsformulierungen kurz zitiert. Ich bin ziemlich vertraut mit Vanille Cost Svms. Zum Beispiel kenne ich …

1
Vowpal Wabbit: Beste Strategie für kurze Textdaten wie Titel und Kewords
Ich verwende Vowpal Wabbit 7.10.0 (VW), um Kategorien für Textdaten zu lernen und vorherzusagen. Meine Textdaten für jeden Datensatz ähneln jedoch nicht einem Artikel oder einem anderen Textdokument mit anständiger Größe, sondern einigen Sätzen wie Titel, Untertitel und Schlüsselwörtern. Ich habe ungefähr 10.000 beschriftete Datensätze, die ich für die Validierung, …

1
Sollte die Vorhersagegenauigkeit oder alternativ die Minimierung der MSE überdacht werden?
Seit Breiman ist die Maximierung der Vorhersagegenauigkeit zu einer Art Goldstandard für die prädiktive Modellierung geworden . Dass es sich zu diesem Status entwickelt hat, ist verständlich: Es kann "optimiert" werden, lässt sich leicht über k-fache Proben kalibrieren und ist größtenteils eine konsistente Statistik für die interne Modellvalidierung. Allzu oft …

1
Passen Sie das Regressionsmodell aus einer fächerförmigen Beziehung in R an
Ich erhalte ein fächerförmiges Streudiagramm der Beziehung zwischen zwei verschiedenen quantitativen Variablen: Ich versuche, ein lineares Modell für diese Beziehung anzupassen. Ich denke, ich sollte eine Art Transformation auf die Variablen anwenden, um die Aufstiegsvarianz in der Beziehung zu vereinheitlichen, bevor ich ein lineares Regressionsmodell anpasse, aber ich kann den …


3
Vergrößerung einer Zufallsstichprobe
In unserem Projekt haben wir eine Bevölkerung von mehr als 1000 Personen. Wir haben eine Zufallsstichprobe von 107 Personen ausgewählt, aber dann haben wir festgestellt, dass wir mehr Präzision benötigen. Deshalb möchten wir jetzt eine größere Stichprobe haben. Das Problem ist, dass die Stichprobe in unserem Fall teuer ist. Daher …


3
Bedingter erwarteter Wert des Produkts der Normal- und Log-Normalverteilung
Könnte jemand bitte die Antwort und die Schritte zur Lösung dieses Ausdrucks geben? E[(eXY+k)∣∣(eXY+k)&gt;0]E[(eXY+k)|(eXY+k)&gt;0]\begin{eqnarray*} E\left[\left.\left(e^{X}Y+k\right)\right|\left.\left(e^{X}Y+k\right)>0\right]\right. \end{eqnarray*} EEE ist der Erwartungsoperator. X∼N(μX,σ2X);Y∼N(μY,σ2Y);Xand Y are independent. Also, k&lt;0X∼N(μX,σX2);Y∼N(μY,σY2);Xand Y are independent. Also, k&lt;0\begin{eqnarray*} X\sim N\left(\mu_{X},\sigma_{X}^{2}\right);Y\sim N\left(\mu_{Y},\sigma_{Y}^{2}\right);X\;\text{and }Y\text{ are independent. Also, }k<0 \end{eqnarray*} KEY MISSING LINK Der obige Ausdruck hängt davon ab, ob …

1
Ausreichende Statistik für nicht exponentielle Familienverteilung
Frage: Sei eine iid-Stichprobe aus . Ich möchte zeigen, dass dieses Modell kein Mitglied der Exponentialfamilie ist, und eine ausreichende Statistik fürX1,X2,…,XnX1,X2,…,XnX_1,X_2,\ldots,X_nN(θ,4θ2)N(θ,4θ2)N(\theta , 4 \theta^2 )θθ\theta Versuch : f( x–– ;θ)=∏i=1n18πθ2−−−−√exp(−18θ2∑i=1n(xi−θ)2)=exp(ln(8πθ2)−n/2−18θ2∑i=1nx2i+14θ∑i=1nxi−n8)f( x_ ;θ)=∏i=1n18πθ2exp⁡(−18θ2∑i=1n(xi−θ)2)=exp⁡(ln⁡(8πθ2)−n/2−18θ2∑i=1nxi2+14θ∑i=1nxi−n8)\begin{align*} f(~\underline{x}~;\theta) &= \prod_{i=1}^n \frac{1}{\sqrt{8 \pi \theta^2}} \exp\left(\frac{-1}{8 \theta^2} \sum_{i=1}^n (x_i - \theta)^2\right)\\ &=\exp \left(\ln(8\pi \theta^2)^{-n/2}- \frac{1}{8 \theta^2}\sum_{i=1}^n …


2
Simulieren Sie aus einer dynamischen Mischung von Verteilungen
Ich muss aus der folgenden Mischung von zwei Verteilungen probieren: hβ⃗ (r)=c(β⃗ )[(1−wm,τ(r))fβ0→(r)+wm,τ(r)gϵ,σ(r)]hβ→(r)=c(β→)[(1−wm,τ(r))fβ0→(r)+wm,τ(r)gϵ,σ(r)]h_{\vec{\beta}}(r)=c(\vec{\beta})[(1-w_{m,\tau}(r))f_{\vec{\beta_{0}}}(r)+w_{m,\tau}(r)g_{\epsilon,\sigma}(r)] Dabei ist eine Normalisierungskonstante, die Gamma-Verteilung , die verallgemeinerte Pareto-Verteilung und ist die CDF der Cauchy-Verteilung : , die hier als Gewichts- / Mischfunktion fungiert und einen reibungslosen Übergang zwischen Gamma und Pareto ermöglicht (daher das Adjektiv …

1
Korrelation zwischen Hauptkomponenten
Ich habe zwei Matrizen a, b mit Dimensionen (100x500), (100x15000) und versuche, Assoziationen zwischen Variablensätzen in beiden Matrizen zu finden. Wenn ich eine Hauptkomponentenanalyse für Matrix a durchführe, entsprechen die höchsten Belastungen der ersten Hauptkomponente einer Reihe von Variablen, die zum größten Anteil der Variabilität in diesem Datensatz beitragen. Diese …

2
Wie berechnet R Vorhersageintervalle im Prognosepaket?
Ich habe einen großen Datensatz mit verschiedenen Faktoren, die ich für die Zukunft prognostizieren möchte. Diese Vorhersagen werde ich später als Input für eine Monte-Carlo-Simulation verwenden. Meine Idee wäre, die Arima-Vorhersage für die verschiedenen Variablen zu verwenden. Anschließend würde ich das resultierende Vorhersageintervall als Eingabe für die Monte-Carlo-Simulation verwenden. Mit …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.