Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Zufälliger Wald und Vorhersage
Ich versuche zu verstehen, wie Random Forest funktioniert. Ich habe ein Gespür dafür, wie Bäume gebaut werden, kann aber nicht verstehen, wie Random Forest Vorhersagen aus Sackproben macht. Kann mir bitte jemand eine einfache Erklärung geben? :)


4
Propensity Score, der mit Panel-Daten übereinstimmt
Ich habe einen longitudinalen Datensatz von Personen und einige von ihnen wurden einer Behandlung unterzogen und andere nicht. Alle Personen sind von der Geburt bis zum 18. Lebensjahr in der Stichprobe und die Behandlung erfolgt in einem Alter zwischen diesem Bereich. Das Alter der Behandlung kann von Fall zu Fall …

1
Standardisierte abhängige Variable innerhalb einer Gruppe in Paneldatenmodellen?
Ist die Standardisierung einer abhängigen Variablen innerhalb der identifizierenden Gruppe sinnvoll? Das folgende Arbeitspapier (Verlangsamung der Entwaldung im legalen Amazonasgebiet; Preise oder Richtlinien ?, pdf ) verwendet eine standardisierte abhängige Variable, um die Auswirkungen der allgemeinen Richtlinienänderung in Brasilien auf die Entwaldung zu analysieren. Die Standardisierung erfolgt wie folgt: Y.n …

2
Wann sollten Sie Ihre Variablen protokollieren / erweitern, wenn Sie Modelle mit zufälligen Gesamtstrukturen verwenden?
Ich mache eine Regression mit Random Forests, um Preise basierend auf mehreren Attributen vorherzusagen. Code wird in Python mit Scikit-learn geschrieben. Wie entscheiden Sie, ob Sie Ihre Variablen mit exp/ transformieren sollen, logbevor Sie sie für das Regressionsmodell verwenden? Ist es notwendig, einen Ensemble-Ansatz wie Random Forest zu verwenden?

4
Interpolation von Influenza-Daten, die den Wochenmittelwert erhalten
Bearbeiten Ich habe ein Dokument gefunden , das genau das beschreibt, was ich brauche. Der einzige Unterschied besteht darin, dass das Papier die Monatsmittelwerte in Tagesdaten interpoliert, während die Monatsmittelwerte beibehalten werden. Ich habe Probleme, den Ansatz zu implementieren R. Hinweise sind willkommen. Original Für jede Woche liegen mir folgende …

3
Wie berechnet man varimaxgedrehte Hauptkomponenten in R?
Ich habe PCA mit 25 Variablen ausgeführt und die 7 besten PCs mit ausgewählt prcomp. prc <- prcomp(pollutions, center=T, scale=T, retx=T) Ich habe dann Varimax-Rotation an diesen Komponenten durchgeführt. varimax7 <- varimax(prc$rotation[,1:7]) Und jetzt möchte ich die PCA-gedrehten Daten mit Varimax drehen (da sie nicht Teil des Varimax-Objekts sind - …
13 r  pca  factor-rotation 

1
Vorhersage auf Modellen mit gemischten Effekten: Was tun mit zufälligen Effekten?
Betrachten wir diesen hypothetischen Datensatz: set.seed(12345) num.subjects <- 10 dose <- rep(c(1,10,50,100), num.subjects) subject <- rep(1:num.subjects, each=4) group <- rep(1:2, each=num.subjects/2*4) response <- dose*dose/10 * group + rnorm(length(dose), 50, 30) df <- data.frame(dose=dose, response=response, subject=subject, group=group) Wir können lmedie Antwort mit einem Zufallseffektmodell modellieren: require(nlme) model <- lme(response ~ dose …


1
Sind Bootstrapping-Standardfehler und Konfidenzintervalle in Regressionen angemessen, in denen die Annahme der Homoskedastizität verletzt wird?
Wenn in Standard-OLS-Regressionen zwei Annahmen verletzt werden (Normalverteilung von Fehlern, Homoskedastizität), sind Bootstrapping-Standardfehler und Konfidenzintervalle eine geeignete Alternative, um zu aussagekräftigen Ergebnissen hinsichtlich der Signifikanz von Regressorkoeffizienten zu gelangen? Funktionieren Signifikanztests mit Bootstrap-Standardfehlern und Konfidenzintervallen immer noch mit Heteroskedastizität? Wenn ja, welche Konfidenzintervalle können in diesem Szenario verwendet werden (Perzentil, …


3
Cluster Big Data in R und ist Stichproben relevant?
Ich bin neu in der Datenwissenschaft und habe ein Problem beim Finden von Clustern in einem Datensatz mit 200.000 Zeilen und 50 Spalten in R. Da die Daten sowohl numerische als auch nominale Variablen enthalten, erscheinen Methoden wie K-means, die das euklidische Distanzmaß verwenden, nicht als geeignete Wahl. Ich wende …




Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.