Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren



4
Typisches Set-Konzept
Ich dachte, dass das Konzept einer typischen Menge ziemlich intuitiv ist: Eine Folge der Länge nnn würde zu der typischen Menge wenn die Wahrscheinlichkeit, dass die Folge herauskommt, hoch wäre. Jede mögliche Sequenz, die wahrscheinlich war, würde sich in . (Ich vermeide die formale Definition im Zusammenhang mit Entropie, weil …

3
Modernster Ensemble-Lernalgorithmus für Mustererkennungsaufgaben?
Die Struktur dieser Frage ist wie folgt: Zuerst stelle ich das Konzept des Ensemble-Lernens vor , dann erstelle ich eine Liste der Mustererkennungsaufgaben , dann gebe ich Beispiele für Ensemble-Lernalgorithmen und stelle schließlich meine Frage vor. Diejenigen, die nicht alle ergänzenden Informationen benötigen, sehen sich möglicherweise nur die Überschriften an …


1
So etwas wie eine gewichtete Korrelation?
Ich habe einige interessante Daten über die populärsten gestreamten Musikkünstler, die nach Orten in ungefähr 200 Kongressbezirke unterteilt sind. Ich möchte sehen, ob es möglich ist, eine Person nach ihren musikalischen Vorlieben zu befragen und festzustellen, ob sie "wie ein Demokrat zuhört" oder "wie ein Republikaner zuhört". (Natürlich ist das …

1
Ist der Probenkorrelationskoeffizient ein unverzerrter Schätzer des Populationskorrelationskoeffizienten?
Stimmt es, dass ein unvoreingenommener Schätzer für ? Das heißt, ρ X , Y E [ R X , Y ] = ρ X , Y ?RX,YRX,YR_{X,Y}ρX,YρX,Y\rho_{X,Y}E[RX,Y]=ρX,Y?E[RX,Y]=ρX,Y?\mathbf{E}\left[R_{X,Y}\right]=\rho_{X,Y}? Wenn nicht, was ist ein unvoreingenommener Schätzer für ? (Vielleicht gibt es einen standardmäßigen unverzerrten Schätzer, der verwendet wird. Ist er auch analog …


2
Hamiltonian Monte Carlo
Kann jemand die Grundidee hinter den Hamilton-Monte-Carlo-Methoden erläutern und in welchen Fällen werden bessere Ergebnisse erzielt als mit den Markov-Chain-Monte-Carlo-Methoden?
14 bayesian  mcmc  hmc 

1
Jeffreys Prior für mehrere Parameter
In bestimmten Fällen wird der Jeffreys-Prior für ein vollständiges mehrdimensionales Modell im Allgemeinen als unzureichend angesehen. Dies ist beispielsweise der Fall in: (wobei , mit und unbekannt) in dem vor dem folgenden (in vollen Jeffreys vor bevorzugt wird ): wobei der Jeffreys-Prior ist, der erhalten wird, wenn festgehalten wird (und …

2
Leistungsbenchmarks für MCMC
Wurden groß angelegte Studien zu MCMC-Methoden durchgeführt, in denen die Leistung mehrerer verschiedener Algorithmen für eine Reihe von Testdichten verglichen wurde? Ich denke an etwas, das dem von Rios und Sahinidis (2013) entspricht und einen gründlichen Vergleich einer großen Anzahl derivatfreier Black-Box-Optimierer für verschiedene Klassen von Testfunktionen darstellt. Für MCMC …

4
Warum ist
Anmerkung: SSTSSTSST = Summe der Quadrate insgesamt, SSESSESSE = Summe der quadrierten Fehler und SSRSSRSSR = Regressionssumme der Quadrate. Die Gleichung im Titel wird oft geschrieben als: ∑i=1n(yi−y¯)2=∑i=1n(yi−y^i)2+∑i=1n(y^i−y¯)2∑i=1n(yi−y¯)2=∑i=1n(yi−y^i)2+∑i=1n(y^i−y¯)2\sum_{i=1}^n (y_i-\bar y)^2=\sum_{i=1}^n (y_i-\hat y_i)^2+\sum_{i=1}^n (\hat y_i-\bar y)^2 Ziemlich einfache Frage, aber ich suche nach einer intuitiven Erklärung. Intuitiv scheint es mir sinnvoller …


1
Eingeschränkte maximale Wahrscheinlichkeit mit weniger als dem vollen Spaltenrang von
Diese Frage befasst sich mit der eingeschränkten Maximalwahrscheinlichkeitsschätzung (REML) in einer bestimmten Version des linearen Modells, nämlich: Y=X(α)β+ϵ,ϵ∼Nn(0,Σ(α)),Y=X(α)β+ϵ,ϵ∼Nn(0,Σ(α)), Y = X(\alpha)\beta + \epsilon, \\ \epsilon\sim N_n(0, \Sigma(\alpha)), Wobei eine durch ; parametrisierte ( ) Matrix ist , wie auch . ist ein unbekannter Vektor von Störparametern; das Interesse liegt in …

2
So glätten Sie Daten und erzwingen Monotonie
Ich habe einige Daten, die ich glätten möchte, damit die geglätteten Punkte monoton abnehmen. Meine Daten nehmen stark ab und beginnen dann ein Plateau. Hier ist ein Beispiel mit R df <- data.frame(x=1:10, y=c(100,41,22,10,6,7,2,1,3,1)) ggplot(df, aes(x=x, y=y))+geom_line() Was ist eine gute Glättungstechnik, die ich verwenden könnte? Außerdem wäre es schön, …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.