Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Wann wurde MCMC alltäglich?
Weiß jemand, in welchem ​​Jahr MCMC alltäglich wurde (dh eine beliebte Methode für Bayes'sche Inferenz)? Ein Link zur Anzahl der im Laufe der Zeit veröffentlichten MCMC (Journal) -Artikel wäre besonders hilfreich.
18 bayesian  mcmc  history 

5
Warum verwenden wir die t-Verteilung nicht, um ein Konfidenzintervall für eine Proportion zu erstellen?
Um das Konfidenzintervall (CI) für den Mittelwert mit unbekannter Populationsstandardabweichung (SD) zu berechnen, schätzen wir die Populationsstandardabweichung unter Verwendung der t-Verteilung. Bemerkenswerterweise ist CI=X¯±Z95%σX¯CI=X¯±Z95%σX¯CI=\bar{X} \pm Z_{95\% }\sigma_{\bar X} wobei σX¯=σn√σX¯=σn\sigma_{\bar X} = \frac{\sigma}{\sqrt n} . Da wir jedoch keine Punktschätzung der Standardabweichung der Grundgesamtheit haben, schätzen wir durch die NäherungCI=X¯±t95%(se)CI=X¯±t95%(se)CI=\bar{X} …



3
Wie wirkt sich die Chargengröße auf die Konvergenz von SGD aus und warum?
Aus vielen Diskussionen habe ich ähnliche Schlussfolgerungen gezogen, dass die Konvergenz von SGD mit zunehmender Minibatch-Größe tatsächlich schwieriger / schlechter wird, zum Beispiel in diesem Artikel und in dieser Antwort . Ich habe auch von Leuten gehört, die im frühen Stadium Tricks wie kleine Lernraten oder Losgrößen einsetzten, um diese …


2
Warum enthält die Exponentialfamilie nicht alle Distributionen?
Ich lese das buch: Bischof, Mustererkennung und maschinelles Lernen (2006) was die Exponentialfamilie als Verteilungen der Form definiert (Gl. 2.194): p(x|η)=h(x)g(η)exp{ηTu(x)}p(x|η)=h(x)g(η)exp⁡{ηTu(x)}p(\mathbf x|\boldsymbol \eta) = h(\mathbf x) g(\boldsymbol \eta) \exp \{\boldsymbol \eta^\mathrm T \mathbf u(\mathbf x)\} Aber ich sehe keine Einschränkungen für oder . Bedeutet das nicht, dass jede Verteilung in …

2
Sollten Trainingsmuster, die zufällig für Mini-Batch-Trainingsnetze gezogen wurden, ersatzlos gezogen werden?
Wir definieren eine Epoche, in der alle verfügbaren Trainingsmuster durchlaufen wurden, und die Mini-Batch-Größe als die Anzahl der Muster, über die wir den Durchschnitt bilden, um die Aktualisierungen der Gewichte / Vorspannungen zu finden, die zum Abstieg des Gradienten erforderlich sind. Meine Frage ist, ob wir aus den Trainingsbeispielen ersatzlos …


2
Vorteile der Partikelschwarmoptimierung gegenüber der Bayes'schen Optimierung für das Hyperparameter-Tuning?
Es gibt umfangreiche aktuelle Forschungen zur Bayesianischen Optimierung (1) zur Optimierung von ML-Hyperparametern. Die treibende Motivation dabei ist, dass eine minimale Anzahl von Datenpunkten erforderlich ist, um fundierte Entscheidungen darüber zu treffen, welche Punkte es wert sind, ausprobiert zu werden (objektive Funktionsaufrufe sind teuer, weniger zu machen ist also besser), …


1
Sollten die Daten vor der Anwendung von t-SNE zentriert und skaliert werden?
Einige Funktionen meiner Daten haben große Werte, während andere Funktionen viel kleinere Werte haben. Müssen die Daten vor dem Anwenden von t-SNE zentriert und skaliert werden, um eine Verzerrung in Richtung der größeren Werte zu vermeiden? Ich verwende die sklearn.manifold.TSNE-Implementierung von Python mit der standardmäßigen euklidischen Distanzmetrik.

2
Kann die Gradientenabsenkung auf nicht konvexe Funktionen angewendet werden?
Ich lerne nur etwas über Optimierung und habe Probleme, den Unterschied zwischen konvexer und nichtkonvexer Optimierung zu verstehen. Nach meinem Verständnis ist eine konvexe Funktion eine, bei der "das Liniensegment zwischen zwei beliebigen Punkten im Diagramm der Funktion über oder im Diagramm liegt". In diesem Fall könnte ein Algorithmus für …

2
Effektgröße nach Wilcoxon Rang Test unterschrieben?
Einige Autoren (z. B. Pallant, 2007, S. 225; siehe Bild unten) schlagen vor, die Effektgröße für einen von Wilcoxon signierten Rangtest zu berechnen, indem die Teststatistik durch die Quadratwurzel der Anzahl der Beobachtungen dividiert wird: r = Znx+ ny√r=Znx+nyr = \frac{Z}{\sqrt{n_x + n_y}} ZGibt die Teststatistik sowohl von SPSS (siehe …

2
REML oder ML, um zwei Modelle mit gemischten Effekten mit unterschiedlichen festen Effekten zu vergleichen, aber mit demselben zufälligen Effekt?
Hintergrund: Hinweis: Mein Datensatz und R-Code sind unter dem Text enthalten Ich möchte AIC verwenden, um zwei Modelle mit gemischten Effekten zu vergleichen, die mit dem lme4-Paket in R erstellt wurden. Jedes Modell hat einen festen und einen zufälligen Effekt. Der festgelegte Effekt unterscheidet sich zwischen den Modellen, der Zufallseffekt …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.