Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Dokumentierte / reproduzierbare Beispiele für erfolgreiche reale Anwendungen ökonometrischer Methoden?
Diese Frage mag sehr weit gefasst klingen, aber hier ist, wonach ich suche. Ich weiß, dass es viele ausgezeichnete Bücher über ökonometrische Methoden und viele ausgezeichnete Expository-Artikel über ökonometrische Techniken gibt. Es gibt sogar ausgezeichnete reproduzierbare Beispiele für Ökonometrie, wie in dieser CrossValidated- Frage beschrieben . Tatsächlich kommen die Beispiele …

2
Zensieren / Abschneiden in JAGS
Ich habe eine Frage, wie man ein Zensurproblem in JAGS einfügt. Ich beobachte eine bivariate Normalnormalmischung, bei der die X-Werte einen Messfehler aufweisen. Ich möchte das wahre zugrunde liegende "Mittel" der beobachteten zensierten Werte modellieren. ⌈xtrue+ϵ⌉=xobserved ϵ∼N(0,sd=.5)⌈xtrue+ϵ⌉=xobserved ϵ∼N(0,sd=.5)\begin{align*} \lceil x_{true}+\epsilon \rceil = x_{observed} \ \epsilon \sim N(0,sd=.5) \end{align*} Folgendes habe …


2
Unterschied zwischen der Implementierung der Ridge-Regression in R und SAS
Ich habe die Beschreibung der Kammregression in Applied Linear Statistical Models , 5. Ausgabe, Kapitel 11, gelesen . Die Kammregression wird anhand der hier verfügbaren Körperfettdaten durchgeführt . Das Lehrbuch entspricht der Ausgabe in SAS, wobei die rücktransformierten Koeffizienten im angepassten Modell wie folgt angegeben werden: Y.= - 7,3978 + …

3
Schätzung des Exponentialmodells
Ein Exponentialmodell ist ein Modell, das durch die folgende Gleichung beschrieben wird: yi^=β0⋅eβ1x1i+…+βkxkiyi^=β0⋅eβ1x1i+…+βkxki\hat{y_{i}}=\beta_{0}\cdot e^{\beta_{1}x_{1i}+\ldots+\beta_{k}x_{ki}} Der gebräuchlichste Ansatz zur Schätzung eines solchen Modells ist die Linearisierung, die leicht durch Berechnung der Logarithmen beider Seiten durchgeführt werden kann. Was sind die anderen Ansätze? Ich interessiere mich besonders für diejenigen, die in einigen …

4
Wie kann ich die Dichte eines Null-Inflations-Parameters in R schätzen?
Ich habe einen Datensatz mit vielen Nullen, der so aussieht: set.seed(1) x <- c(rlnorm(100),rep(0,50)) hist(x,probability=TRUE,breaks = 25) Ich möchte eine Linie für ihre Dichte zeichnen, aber die density()Funktion verwendet ein sich bewegendes Fenster, das negative Werte von x berechnet. lines(density(x), col = 'grey') Es gibt density(... from, to)Argumente, aber diese …
10 r  probability  kde 

1
Zeichnen einer stückweisen Regressionslinie
Gibt es eine Möglichkeit, die Regressionslinie eines solchen stückweisen Modells lineszu zeichnen , außer jedes Segment einzeln zu zeichnen oder zu verwenden geom_smooth(aes(group=Ind), method="lm", fill=FALSE)? m.sqft <- mean(sqft) model <- lm(price~sqft+I((sqft-m.sqft)*Ind)) # sqft, price: continuous variables, Ind: if sqft>mean(sqft) then 1 else 0 plot(sqft,price) abline(reg = model) Warning message: In …

2
Guter Text zum Resampling?
Kann die Gruppe einen guten Einführungstext / eine gute Ressource für angewandte Resampling-Techniken empfehlen? Insbesondere interessiere ich mich für Alternativen zu klassischen parametrischen Tests (z. B. t-Tests, ANOVA, ANCOVA) zum Vergleichen von Gruppen, wenn Annahmen wie die Normalität eindeutig verletzt werden. Ein Beispiel für einen Problemtyp, den ich gerne über …

2
Welche Kernel-Methode liefert die besten Wahrscheinlichkeitsausgaben?
Kürzlich habe ich Platt's Skalierung von SVM-Ausgaben verwendet, um die Wahrscheinlichkeiten von Standardereignissen abzuschätzen. Direktere Alternativen scheinen "Kernel Logistic Regression" (KLR) und die zugehörige "Import Vector Machine" zu sein. Kann jemand sagen, welche Kernel-Methode, die Wahrscheinlichkeitsausgaben liefert, derzeit Stand der Technik ist? Gibt es eine R-Implementierung von KLR? Vielen Dank …

5
Generieren Sie zufällige multivariate Werte aus empirischen Daten
Ich arbeite an einer Monte-Carlo-Funktion zur Bewertung mehrerer Vermögenswerte mit teilweise korrelierten Renditen. Derzeit generiere ich nur eine Kovarianzmatrix und speise die rmvnorm()Funktion in R ein. (Erzeugt korrelierte Zufallswerte.) Betrachtet man jedoch die Verteilung der Renditen eines Vermögenswerts, so wird dieser normalerweise nicht verteilt. Dies ist wirklich eine zweiteilige Frage: …
10 mcmc  monte-carlo  pdf 

3
R-Paket zum Kombinieren von Faktorstufen für die Datenerfassung?
Sie fragen sich, ob jemand in R auf ein Paket / eine Funktion gestoßen ist, die Ebenen eines Faktors kombiniert, dessen Anteil an allen Ebenen in einem Faktor unter einem bestimmten Schwellenwert liegt? Insbesondere besteht einer der ersten Schritte bei der Datenaufbereitung darin, spärliche Ebenen von Faktoren zusammenzufassen (z. B. …


1
Passt „glmnet“ in R zu einem Achsenabschnitt?
Ich passe ein lineares Modell in R an glmnet. Das ursprüngliche (nicht regulierte) Modell wurde unter Verwendung von angepasst lmund hatte keinen konstanten Term (dh es war in der Form lm(y~0+x1+x2,data)). glmnetnimmt eine Matrix von Prädiktoren und einen Vektor von Antworten. Ich habe die glmnetDokumentation gelesen und kann den konstanten …
10 r  regression  lasso 


1
Unterschied zwischen GLS und SUR
Ich habe einige über Generalized Least Squares (GLS) gelesen und versucht, sie mit meinem ökonometrischen Grundhintergrund zu verknüpfen. Ich erinnere mich, dass ich in der Graduiertenschule scheinbar unzusammenhängende Regression (SUR) verwendet habe, die GLS etwas ähnlich zu sein scheint. Ein Artikel, über den ich gestolpert bin, bezeichnete SUR sogar als …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.