Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


1
Random Forests Out-of-Bag-Stichprobengröße
Ich lese die Beschreibung von RF hier . Im Abschnitt "Wie zufällige Wälder funktionieren" steht: Wenn der Trainingssatz für den aktuellen Baum durch Stichproben mit Ersatz gezogen wird, wird etwa ein Drittel der Fälle aus der Stichprobe herausgelassen. Diese oob-Daten (out-of-bag) werden verwendet, um eine laufende unvoreingenommene Schätzung des Klassifizierungsfehlers …

2
Verstehe ich die Unterschiede zwischen Bayes'scher und frequentistischer Folgerung richtig?
Bei einer Folge unabhängiger Experimente, deren Ergebnis entweder Erfolg oder Misserfolg ist, liegt die Erfolgswahrscheinlichkeit bei einer Zahl p zwischen 0 und 1 : Ein Bayesianer würde die Ergebnisse der k Experimente fest betrachten, während p zufällig wäre, dann eine vorherige Verteilung auf p annehmen und dann eine hintere Verteilung …

4
Magisches Urnenproblem
ADDENDUM: Zunächst einmal danke ich Ihnen allen für Ihre aufschlussreichen Antworten auf dieses Wochenende, das lustige Problem und insbesondere Mark L Stone für seinen ersten Kommentar. Ich vermisse wahrscheinlich den Punkt in einigen Antworten. In diesem Fall ändern Sie sie bitte leicht, damit ich sie sehe und sie gerne annehmen …

2
Sind bei der linearen Regression der Fehler und die Prädiktorvariable unabhängig?
Wir haben ein einfaches lineares Regressionsmodell. Unsere Annahmen sind: Y.ich=β0+β1X.ich+εichYi=β0+β1X.ich+εichY_i =\beta_0+\beta_1X_i+ \varepsilon_i ,i = 1 , ⋯ , nich=1,⋯,ni=1, \cdots, n εich∼ N.( 0 ,σ2)εich∼N.(0,σ2)\varepsilon_i \sim N(0, \sigma^2) V.a r (εich|X.ich= x ) =σ2V.einr(εich|X.ich=x)=σ2Var(\varepsilon_i|X_i=x)=\sigma^2 ε1,⋯,εnε1,⋯,εn\varepsilon_1, \cdots, \varepsilon_n sind voneinander unabhängig. \\ Reichen diese Hypothesen aus, um zu behaupten, dass ?εi|Xi=x∼N(0,σ2)εich|X.ich=x∼N.(0,σ2)\varepsilon_i|X_i=x …

1
Beweise für Ähnlichkeiten zweier Zeitreihen
Nehmen wir an, ein analytisches Modell sagt einen epidemischen Trend über die Zeit voraus, dh die Anzahl der Infektionen über die Zeit. Wir haben auch eine Computersimulationsergebnisse im Laufe der Zeit, um die Leistung des Modells zu überprüfen. Ziel ist es zu beweisen, dass die Simulationsergebnisse und die vorhergesagten Werte …


3
Ist OLS der häufigere Ansatz zur linearen Regression?
In diesem Wikipedia-Artikel gibt es diesen Satz: Dies ist ein häufiger Ansatz Bezieht sich das auf OLS? Ist es wirklich eher ein "als" das "? Was sind andere häufigere Ansätze? Soweit ich weiß, müssen wir minimieren [ε1,ε2,...,εnε1,ε2,...,εn\varepsilon_1, \varepsilon_2, ..., \varepsilon_n] [ε1,ε2,...,εnε1,ε2,...,εn\varepsilon_1, \varepsilon_2, ..., \varepsilon_n] '. Bearbeiten: Dies ist in Bezug …

1
Wie kann man entscheiden, welche Interaktionsterme in ein multiples Regressionsmodell aufgenommen werden sollen?
Ich versuche, mit R ein multiples Regressionsmodell zu erstellen. Ich habe eine Reihe von Prädiktorvariablen. Ich habe einige grundlegende Domänenkenntnisse, für die ich versuche, das Modell zu erstellen. Zunächst habe ich einige Prädiktorvariablen basierend auf Domänenwissen und hohen Korrelationskoeffizienten mit der Antwortvariablen aufgenommen, während einige andere Prädiktoren aufgrund der Multikollinearität …

4
Wie trainiere ich ein verstecktes Markov-Modell mit Gaußscher Mischung?
Ich möchte ein Hidden-Markov-Modell (HMM) mit kontinuierlichen Beobachtungen erstellen, die als Gaußsche Gemische modelliert sind ( Gaußsches Mischungsmodell = GMM). Ich verstehe den Trainingsprozess so, dass er in Schritten durchgeführt werden sollte.222 1) Trainieren Sie zuerst die GMM-Parameter mithilfe der Erwartungsmaximierung (EM). 2) Trainieren Sie die HMM-Parameter mit EM. Ist …


1
Macht die Option `weight =` in lmer () das, was ich will?
Ich möchte die Leistung von PGA-Golfspielern vorhersagen. Ich frage mich, ob ich neueren Ergebnissen mit der weights=Option in der Funktion lmer () mehr Gewicht gebe. Ich habe Daten von 2012-2014 so angelegt: library("lme4") library("dplyr") head(rdDat) Source: local data frame [6 x 5] Groups: plrF, trnF plrF trnF rdF wt rdScr …

1
Was sind die vernünftigen Eigenschaften von p-Wert-Kombinationsmethoden, wenn alle p-Werte gleich sind?
Angenommen, wir testen eine Nullhypothese , indem wir Beweise aus unabhängigen Tests unter Verwendung einer p- Wert-Kombinationsmethode kombinieren . Der kombinierte p- Wert ist . Nehmen wir den Extremfall an, wenn wir aus allen Einzeltests den gleichen p- Wert erhalten, welche der folgenden Eigenschaften von sinnvoller sind:H0H0H_0nnnMMMM(p1,...,pn)M(p1,...,pn)M(p_1,...,p_n)MMM Mn(p,...,p)≤pMn(p,...,p)≤pM_n(p,...,p)\leq p ; …

2
Erwartete Größe eines Vektors aus einer multivariaten Normalen
Was ist die erwartete Größe, dh der euklidische Abstand vom Ursprung, eines Vektors, der aus einer p-dimensionalen sphärischen Normalen mit und , wo die Identitätsmatrix?Np(μ,Σ)Np(μ,Σ)\mathcal{N}_p(\mu,\Sigma)μ=0⃗ μ=0→\mu=\vec{0}Σ=σ2IΣ=σ2I\Sigma=\sigma^2 IIII Im univariaten Fall läuft dies auf , wobei . Dies ist der Mittelwert einer gefalteten Normalverteilung mit Mittelwert und Varianz , der wie …

2
Gibt es ein Problem mit mehreren Tests, wenn t-Tests für mehrere Koeffizienten in linearer Regression durchgeführt werden?
Diese Frage stammt aus einer Diskussion über den jüngsten Beitrag von @rvl. Es liegt alles in der Familie. Aber schließen wir auch die Schwiegereltern ein? Hier ist ein häufiges Szenario, das ich schon oft gesehen habe. Ein Forscher führt eine einfache lineare Regression mit beispielsweise 5 Kovariaten durch. lm(Y ~ …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.