Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Welche früheren Verteilungen könnten / sollten für die Varianz in einem hierarchischen Bayesisan-Modell verwendet werden, wenn die mittlere Varianz von Interesse ist?
In seiner viel zitierten Arbeit Prior-Verteilungen für Varianzparameter in hierarchischen Modellen (916 Zitate in Google Scholar) Gelman schlägt vor, dass gute, nicht informative Vorverteilungen für die Varianz in einem hierarchischen Bayes'schen Modell die Gleichverteilung und die Halb-t-Verteilung sind. Wenn ich die Dinge richtig verstehe, funktioniert dies gut, wenn der Standortparameter …

2
Komplexitätsparameter in CART auswählen
In der Routine rpart () zum Erstellen von CART-Modellen geben Sie den Komplexitätsparameter an, auf den Sie Ihren Baum beschneiden möchten. Ich habe zwei verschiedene Empfehlungen für die Auswahl des Komplexitätsparameters gesehen: Wählen Sie den Komplexitätsparameter aus, der mit dem minimal möglichen quervalidierten Fehler verknüpft ist. Diese Methode wird von …
16 r  cart  rpart 


2
Welche Prozesse könnten Laplace-verteilte (doppelt exponentielle) Daten oder Parameter erzeugen?
Viele Distributionen haben "Ursprungsmythen" oder Beispiele für physikalische Prozesse, die sie gut beschreiben: Sie können normalverteilte Daten aus Summen unkorrelierter Fehler über den zentralen Grenzwertsatz erhalten Sie können binomial verteilte Daten von unabhängigen Münzwürfen oder Poisson-verteilte Variablen von einer Grenze dieses Prozesses erhalten Sie können exponentiell verteilte Daten aus Wartezeiten …

3
Optionale Stoppregeln, die nicht in Lehrbüchern enthalten sind
Stoppregeln wirken sich auf die Beziehung zwischen P-Werten und den Fehlerraten aus, die mit Entscheidungen verbunden sind. Ein kürzlich veröffentlichter Aufsatz von Simmons et al. 2011 prägt den Begriff Forscherfreiheitsgrade , um eine Sammlung von Verhaltensweisen zu beschreiben, die sie für viele der Berichte in der psychologischen Literatur verantwortlich machen, …

4
Festlegung der negativen Binomialverteilung für die DNA-Sequenzierung
Die negative Binomialverteilung hat sich in der Bioinformatik zu einem beliebten Modell für Zähldaten (insbesondere die erwartete Anzahl von Sequenzierungslesevorgängen innerhalb einer bestimmten Region des Genoms aus einem bestimmten Experiment) entwickelt. Erklärungen variieren: Einige erklären es als etwas, das wie die Poisson-Verteilung funktioniert, aber einen zusätzlichen Parameter hat, der mehr …

1
Wie simuliert man eine Gaußsche Kopula?
Angenommen, ich habe zwei univariate Randverteilungen, sagen wir und , die ich simulieren kann. Konstruieren Sie nun ihre gemeinsame Verteilung mit einer Gaußschen Kopula , die mit . Alle Parameter sind bekannt.G C ( F , G ; Σ )FFFGGGC( F, G ; Σ )C(F,G;Σ)C(F,G;\Sigma) Gibt es eine Nicht-MCMC-Methode zum …

3
Poisson ist zu exponentiell wie Gamma-Poisson zu was?
Eine Poisson-Verteilung kann Ereignisse pro Zeiteinheit messen, und der Parameter ist . Die Exponentialverteilung misst die Zeit bis zum nächsten Ereignis mit dem Parameter . Man kann eine Distribution in die andere konvertieren, je nachdem, ob es einfacher ist, Ereignisse oder Zeiten zu modellieren.1λλ\lambda1λ1λ\frac{1}{\lambda} Nun ist ein Gamma-Poisson ein "gedehntes" …

3
Schätzen der Markov-Übergangswahrscheinlichkeiten aus Sequenzdaten
Ich habe einen vollständigen Satz von Sequenzen (um genau zu sein 432 Beobachtungen) von 4 Zuständen : zA−DA−DA-D Y=⎛⎝⎜⎜⎜⎜AB⋮BCA⋮CDA⋮ADC⋮DBA⋮AA−⋮BC−⋮A⎞⎠⎟⎟⎟⎟Y=(ACDDBACBAACA−−⋮⋮⋮⋮⋮⋮⋮BCADABA)Y=\left(\begin{array}{c c c c c c c} A& C& D&D & B & A &C\\ B& A& A&C & A&- &-\\ \vdots&\vdots&\vdots&\vdots&\vdots&\vdots&\vdots\\ B& C& A&D & A & B & A\\ \end{array}\right) …

2
Beobachtete Informationsmatrix ist ein konsistenter Schätzer der erwarteten Informationsmatrix?
Ich versuche zu beweisen, dass die beobachtete Informationsmatrix, die beim schwach konsistenten Maximum Likelihood Estimator (MLE) ausgewertet wird, ein schwach konsistenter Schätzer der erwarteten Informationsmatrix ist. Dies ist ein viel zitiertes Ergebnis, aber niemand gibt einen Hinweis oder einen Beweis (ich denke, die ersten 20 Seiten der Google-Ergebnisse und meine …

1
Gemischtes Modell vs. Pooling von Standardfehlern für Studien mit mehreren Standorten - Warum ist ein gemischtes Modell so viel effizienter?
Ich habe einen Datensatz, der aus einer Reihe von monatlichen Fallzählungen für "kaputte Stöcke" von einer Handvoll Websites besteht. Ich versuche, eine einzige zusammenfassende Schätzung aus zwei verschiedenen Techniken zu erhalten: Technik 1: Passen Sie einen "gebrochenen Stab" mit einem Poisson-GLM mit einer 0/1-Indikatorvariablen an und verwenden Sie eine Zeit- …

3
Eine unvoreingenommene Schätzung des Medians
Angenommen, wir haben eine Zufallsvariable XXX die von [0,1][0,1][0,1] aus der wir Stichproben ziehen können. Wie können wir eine unvoreingenommene Schätzung des Medians von XXX erstellen? Wir können natürlich einige Stichproben generieren und den Stichprobenmedian nehmen, aber ich verstehe, dass dies im Allgemeinen nicht unvoreingenommen sein wird. Hinweis: Diese Frage …
16 sampling 


1
Konstruktion der Dirichlet-Verteilung mit Gamma-Verteilung
Sei X1,…,Xk+1X1,…,Xk+1X_1,\dots,X_{k+1} voneinander unabhängige Zufallsvariablen mit jeweils einer Gammaverteilung mit Parametern αi,i=1,2,…,k+1αi,i=1,2,…,k+1\alpha_i,i=1,2,\dots,k+1 zeige Yi=XiX1+⋯+Xk+1,i=1,…,kYi=XiX1+⋯+Xk+1,i=1,…,kY_i=\frac{X_i}{X_1+\cdots+X_{k+1}},i=1,\dots,k, haben eine gemeinsame Verteilung alsDirichlet(α1,α2,…,αk;αk+1)Dirichlet(α1,α2,…,αk;αk+1)\text{Dirichlet}(\alpha_1,\alpha_2,\dots,\alpha_k;\alpha_{k+1}) Gemeinsames pdf von (X1,…,Xk+1)=e−∑k+1i=1xixα1−11…xαk+1−1k+1Γ(α1)Γ(α2)…Γ(αk+1)(X1,…,Xk+1)=e−∑i=1k+1xix1α1−1…xk+1αk+1−1Γ(α1)Γ(α2)…Γ(αk+1)(X_1,\dots,X_{k+1})=\frac{e^{-\sum_{i=1}^{k+1}x_i}x_1^{\alpha_1-1}\dots x_{k+1}^{\alpha_{k+1}-1}}{\Gamma(\alpha_1)\Gamma(\alpha_2)\dots \Gamma(\alpha_{k+1})} Dann kann ich das gemeinsame pdf von(Y1,…,Yk+1)(Y1,…,Yk+1)(Y_1,\dots,Y_{k+1})nicht finden, dhJ(x1,…,xk+1y1,…,yk+1)J(x1,…,xk+1y1,…,yk+1)J(\frac{x_1,\dots,x_{k+1}}{y_1,\dots,y_{k+1}})

1
Was sind einige Verteilungen über den Wahrscheinlichkeitssimplex?
Sei der Wahrscheinlichkeitssimplex der Dimension , dh ist so, dass und .ΔKΔK\Delta_{K}K- 1K−1K-1x ≤ ΔKx∈ΔKx \in \Delta_{K}xich≥ 0xi≥0x_i \ge 0∑ichxich= 1∑ichxich=1\sum_i x_i = 1 Welche Distributionen, die häufig (oder bekannt oder in der Vergangenheit definiert) über existieren?ΔKΔK\Delta_{K} Natürlich gibt es die Distributionen Dirichlet und Logit-Normal. Gibt es andere Distributionen, die …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.