Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Google Inception-Modell: Warum gibt es mehrere Softmax?
Die Topologie des Google Inception-Modells finden Sie hier: Google Inception Netowrk Mir ist aufgefallen, dass dieses Modell 3 Softmax-Schichten enthält (Nr. 154, Nr. 152, Nr. 145), von denen 2 eine Art frühes Entkommen dieses Modells darstellen. Soweit ich weiß, ist die Softmax-Ebene für die endgültige Ausgabe vorgesehen. Warum gibt es …


1
Unterschiedliche Wahrscheinlichkeitsdichte-Transformationen aufgrund des Jacobi-Faktors
In Bishops Mustererkennung und maschinellem Lernen las ich Folgendes, unmittelbar nachdem die Wahrscheinlichkeitsdichte eingeführt wurde:p(x∈(a,b))=∫bap(x)dxp(x∈(a,b))=∫abp(x)dxp(x\in(a,b))=\int_a^bp(x)\textrm{d}x Bei einer nichtlinearen Änderung der Variablen transformiert sich eine Wahrscheinlichkeitsdichte aufgrund des Jacobi-Faktors anders als eine einfache Funktion. Wenn wir zum Beispiel eine Änderung der Variablen , wird eine Funktion zu . Betrachten Sie nun …

3
Zufällige Waldregression, die nicht höher als die Trainingsdaten ist
Ich habe festgestellt, dass beim Erstellen zufälliger Waldregressionsmodelle, zumindest in R, der vorhergesagte Wert niemals den in den Trainingsdaten angezeigten Maximalwert der Zielvariablen überschreitet. Ein Beispiel finden Sie im folgenden Code. Ich erstelle ein Regressionsmodell, um mpgbasierend auf den mtcarsDaten Vorhersagen zu treffen . Ich baue OLS- und zufällige Waldmodelle …
12 r  random-forest 

4
Bootstrap gegen Monte Carlo, Fehlerschätzung
Ich lese den Artikel Fehlerausbreitung nach der Monte-Carlo-Methode in geochemischen Berechnungen, Anderson (1976), und es gibt etwas, das ich nicht ganz verstehe. Betrachten Sie einige Messdaten und ein Programm , das sie verarbeitet und einen bestimmten Wert zurückgibt. In dem Artikel wird dieses Programm verwendet, um zuerst den besten Wert …

2
"Krawatten sollten nicht vorhanden sein" im Kolmgorov-Smirnov-Test mit einer Stichprobe in R.
Ich werde den Kolmogorov-Smirnov-Test verwenden, um die Normalität von MYDATA in R zu testen. Dies ist ein Beispiel für meine Arbeit ks.test(MYDATA,"pnorm",mean(MYDATA),sd(MYDATA)) Hier ist das Ergebnis, das R mir gibt: data: MYDATA D = 0.13527, p-value = 0.1721 alternative hypothesis: two-sided Warning message: In ks.test(MYDATA, "pnorm", mean(MYDATA), sd(MYDATA)) : ties …

3
Lasso vs. adaptives Lasso
LASSO und adaptives LASSO sind zwei verschiedene Dinge, richtig? (Für mich sehen die Strafen anders aus, aber ich überprüfe nur, ob ich etwas verpasse.) Wenn Sie allgemein von elastischem Netz sprechen, ist der Sonderfall LASSO oder adaptives LASSO? Welches macht das glmnet-Paket, vorausgesetzt Sie wählen alpha = 1? Adaptive LASSO …

1
Stichprobe aus der Randverteilung unter Verwendung der bedingten Verteilung?
Ich möchte aus einer univariaten Dichte , aber nur die Beziehung:fXfXf_X fX(x)=∫fX|Y(x|y)fY(y)dy.fX(x)=∫fX|Y(x|y)fY(y)dy.f_X(x) = \int f_{X\vert Y}(x\vert y)f_Y(y) dy. Ich möchte die Verwendung von MCMC (direkt auf der Integraldarstellung) vermeiden, und da und leicht sind, habe ich mir überlegt, den folgenden Sampler zu verwenden ::fX|Y(x|y)fX|Y(x|y)f_{X\vert Y}(x\vert y)fY(y)fY(y)f_Y(y) Für .j=1,…,Nj=1,…,Nj=1,\dots, N Beispiel …


3
Der Unterschied besteht in der zusammenfassenden Statistik: Gini-Koeffizient und Standardabweichung
Es gibt mehrere zusammenfassende Statistiken. Wenn Sie die Streuung einer Verteilung beschreiben möchten, können Sie beispielsweise die Standardabweichung oder den Gini-Koeffizienten verwenden . Ich weiß, dass die Standardabweichung auf der zentralen Tendenz basiert, dh der Abweichung vom Mittelwert, und der Gini-Koeffizient eine allgemeine Messung der Dispersion. Ich weiß auch, dass …

1
Bayesianische Modellierung von Zugwartezeiten: Die Modelldefinition
Dies ist mein erster Versuch für jemanden aus dem Frequentistenlager, eine Bayes'sche Datenanalyse durchzuführen. Ich habe eine Reihe von Tutorials und einige Kapitel aus der Bayesian Data Analysis von A. Gelman gelesen. Als erstes mehr oder weniger unabhängiges Beispiel für die Datenanalyse habe ich die Wartezeiten für Züge ausgewählt. Ich …
12 bayesian  pymc 





Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.