Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


1
Bootstrap-Filter / Partikelfilter-Algorithmus (Verständnis)
Ich habe wirklich ein Unverständnis darüber, wie der Bootstrap-Filter funktioniert. Ich kenne die Konzepte grob, kann aber bestimmte Details nicht erfassen. Diese Frage ist für mich, um das Durcheinander zu beseitigen. Hier werde ich diesen beliebten Filteralgorithmus aus einer Referenz von Doucet verwenden (bisher denke ich, dass dies die einfachste …

3
Neuronale Architekturen: Datengestütztes automatisches Design
Der jüngste Fortschritt bei neuronalen Netzen wird durch eine Reihe neuer Architekturen zusammengefasst, die sich hauptsächlich durch ihre wachsende Designkomplexität auszeichnen. Von LeNet5 (1994) über AlexNet (2012) bis zu Overfeat (2013) und GoogleLeNet / Inception (2014) und so weiter ... Gibt es einen Versuch, die Maschine in Abhängigkeit von den …

1
MCMC; Können wir sicher sein, dass wir eine "reine" und "groß genug" Probe vom hinteren Teil haben? Wie kann es funktionieren, wenn wir es nicht sind?
Unter Bezugnahme auf diesen Thread: Wie würden Sie einem Laien Markov Chain Monte Carlo (MCMC) erklären? . Ich kann sehen, dass es sich um eine Kombination von Markov-Ketten und Monte Carlo handelt: Eine Markov-Kette wird mit dem posterior als invariante Grenzverteilung erstellt, und dann werden Monte Carlo-Zeichnungen (abhängig) von der …
12 mcmc 

2
Wie vergleiche ich Modelle auf Basis von AIC?
Wir haben zwei Modelle, die dieselbe Methode zur Berechnung der Log-Wahrscheinlichkeit verwenden, und der AIC für eines ist niedriger als das andere. Das mit dem niedrigeren AIC ist jedoch weitaus schwieriger zu interpretieren. Wir haben Schwierigkeiten zu entscheiden, ob es sich lohnt, die Schwierigkeit einzuführen, und wir haben dies anhand …

1
Können Sie eine einfache intuitive Erklärung der IRLS-Methode zum Ermitteln der MLE eines GLM geben?
Hintergrund: Ich versuche, Princetons Überprüfung der MLE-Schätzung für GLM zu folgen . Verstehe ich die Grundlagen der MLE Schätzung: likelihood, score, beobachteten und erwarteten Fisher informationund die Fisher scoringTechnik. Und ich weiß, wie man eine einfache lineare Regression mit einer MLE-Schätzung rechtfertigt . Die Frage: Ich kann nicht einmal die …

1
Konfidenzintervalle für Vorhersagen für ein nichtlineares gemischtes Modell (nlme)
Ich möchte 95% -Konfidenzintervalle für die Vorhersagen eines nichtlinearen gemischten nlmeModells erhalten. Da dies innerhalb von nichts Standardmäßigem vorgesehen ist, habe nlmeich mich gefragt, ob es richtig ist, die Methode der "Bevölkerungsvorhersageintervalle" zu verwenden, die in Ben Bolkers Buchkapitel im Kontext von Modellen beschrieben wird , die auf der Idee …

6
Gibt es eine univariate Distribution, aus der wir keine Stichprobe erstellen können?
Wir haben eine Vielzahl von Methoden zur Zufallsgenerierung aus univariaten Verteilungen (inverse Transformation, Accept-Reject, Metropolis-Hastings usw.) und es scheint, dass wir aus buchstäblich jeder gültigen Verteilung eine Stichprobe erstellen können - stimmt das? Können Sie ein Beispiel für eine univariate Verteilung nennen, aus der sich keine Zufallsgenerierung ergibt? Ich vermute, …

1
Warum verwendet ecdf eine Sprungfunktion und keine lineare Interpolation?
Empirische CDF-Funktionen werden üblicherweise durch eine Sprungfunktion geschätzt. Gibt es einen Grund, warum dies so gemacht wird und nicht durch Verwendung einer linearen Interpolation? Hat die Stufenfunktion interessante theoretische Eigenschaften, die uns bevorzugen? Hier ist ein Beispiel für die beiden: ecdf2 <- function (x) { x <- sort(x) n <- …
12 r  distributions  ecdf 


1
GBM-Paket vs. Caret mit GBM
Ich habe das Modell mit optimiert caret, aber dann das Modell mit dem gbmPaket erneut ausgeführt. Nach meinem Verständnis sollten das verwendete caretPaket gbmund die Ausgabe identisch sein. Nur ein kurzer Testlauf mit data(iris)zeigt jedoch eine Diskrepanz im Modell von etwa 5% unter Verwendung von RMSE und R ^ 2 …


1
Ausreichende Statistik gemeinsam vervollständigen: Uniform (a, b)
Sei X=(x1,x2,…xn)X=(x1,x2,…xn)\mathbf{X}= (x_1, x_2, \dots x_n) eine Zufallsstichprobe aus der Gleichverteilung auf (a,b)(a,b)(a,b) , wobei a&lt;ba&lt;ba < b . Sei Y1Y1Y_1 und YnYnY_n die Statistik der größten und kleinsten Ordnung. Zeigen Sie, dass die Statistik (Y1,Yn)(Y1,Yn)(Y_1, Y_n) eine gemeinsam vollständige ausreichende Statistik für den Parameter θ=(a,b)θ=(a,b)\theta = (a, b). Es …


3
Moderierte Regression: Warum berechnen wir einen * Produktterm * zwischen den Prädiktoren?
Moderierte Regressionsanalysen werden in den Sozialwissenschaften häufig verwendet, um die Interaktion zwischen zwei oder mehr Prädiktoren / Kovariaten zu bewerten. In der Regel wird bei zwei Prädiktorvariablen das folgende Modell angewendet: Y=β0+β1∗X+β2∗M+β3∗XM+eY=β0+β1∗X+β2∗M+β3∗XM+eY = β_0 + β_1*X + β_2*M + β_3*XM + e Beachten Sie, dass der Moderationstest durch den Produktbegriff …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.