Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


3
Vorhersage der Varianz heteroskedastischer Daten
Ich versuche, eine Regression auf heteroskedastischen Daten durchzuführen, wobei ich versuche , die Fehlervarianzen sowie die Mittelwerte in Form eines linearen Modells vorherzusagen . Etwas wie das: y( x , t )ξ( x , t )y¯( x , t )σ( x , t )= y¯(x,t)+ξ(x,t),∼N(0,σ(x,t)),=y0+ax+bt,=σ0+cx+dt.y(x,t)=y¯(x,t)+ξ(x,t),ξ(x,t)∼N(0,σ(x,t)),y¯(x,t)=y0+ax+bt,σ(x,t)=σ0+cx+dt.\begin{align}\\ y\left(x,t\right) &= \bar{y}\left(x,t\right)+\xi\left(x,t\right),\\ \xi\left(x,t\right) &\sim …

1
Gini-Abnahme und Gini-Verunreinigung von Kinderknoten
Ich arbeite an der Wichtigkeitsmessung des Gini-Features für zufällige Gesamtstrukturen. Daher muss ich die Gini-Abnahme der Knotenverunreinigung berechnen. So mache ich das, was zu einem Konflikt mit der Definition führt und andeutet, dass ich mich irgendwo irren muss ... :) Für einen binären Baum kann ich unter Berücksichtigung der Wahrscheinlichkeiten …

3
SVM für unausgeglichene Daten
Ich möchte versuchen, Support Vector Machines (SVMs) für mein Dataset zu verwenden. Bevor ich das Problem versuchte, wurde ich gewarnt, dass SVMs bei extrem unausgeglichenen Daten keine gute Leistung bringen. In meinem Fall kann ich bis zu 95-98% 0 und 2-5% 1 haben. Ich habe versucht, Ressourcen zu finden, bei …

1
Was bedeutet es, die Varianz zu erklären?
Insbesondere frage ich mich, warum wir dieses Konzept Multiple R (das ich als die Korrelation zwischen beobachteten und vorhergesagten Ergebnissen in multipler Regression verstehen kann) und dann ein separates Konzept R-Quadrat haben, das nur das Quadrat oder R ist. Ich wurde informiert, dass R-Quadrat die erklärte prozentuale Variation ist und …

3
Warum verwendet niemand den multinomialen Bayes-Klassifikator Naive Bayes?
In der (unbeaufsichtigten) Textmodellierung ist Latent Dirichlet Allocation (LDA) eine Bayes-Version der probabilistischen latenten semantischen Analyse (PLSA). Im Wesentlichen hat LDA = PLSA + Dirichlet Vorrang vor seinen Parametern. Nach meinem Verständnis ist LDA jetzt der Referenzalgorithmus und wird in verschiedenen Paketen implementiert, während PLSA nicht mehr verwendet werden sollte. …

2
Berechnung des AIC „von Hand“ in R
Ich habe versucht, den AIC einer linearen Regression in R zu berechnen, ohne die AICFunktion zu verwenden: lm_mtcars <- lm(mpg ~ drat, mtcars) nrow(mtcars)*(log((sum(lm_mtcars$residuals^2)/nrow(mtcars))))+(length(lm_mtcars$coefficients)*2) [1] 97.98786 Allerdings AICgibt einen anderen Wert: AIC(lm_mtcars) [1] 190.7999 Kann mir jemand sagen, was ich falsch mache?

2
Sind Stichprobenverteilungen für Rückschlüsse zulässig?
Einige Bayesianer greifen häufig auftretende Folgerungen mit der Begründung an, dass "es keine eindeutige Stichprobenverteilung gibt", da dies von den Absichten des Forschers abhängt (Kruschke, Aguinis, & Joo, 2012, S. 733). Angenommen, ein Forscher beginnt mit der Datenerfassung, doch seine Finanzierung wurde nach 40 Teilnehmern unerwartet gekürzt. Wie würden hier …



4
Zu vermeidende Fallstricke bei der Transformation von Daten?
Nachdem ich die Antwort doppelt transformiert hatte, erreichte ich eine starke lineare Beziehung zwischen meiner XXX und YY.Y Variablen. Das Modell war Y∼XY.∼XY\sim X aber ich habe es in verbessertR2von 0,19 auf 0,76.YX−−√∼X−−√YX∼X\sqrt{\frac{Y}{X}}\sim \sqrt{X}R2R2R^2 Offensichtlich habe ich mich in dieser Beziehung anständig operieren lassen. Kann jemand die Fallstricke diskutieren, die …

1
Was ist die Intuition hinter austauschbaren Proben unter der Nullhypothese?
Permutationstests (auch Randomisierungstest, Re-Randomisierungstest oder exakter Test genannt) sind sehr nützlich und nützlich, wenn die zum Beispiel erforderliche Annahme einer Normalverteilung t-testnicht erfüllt ist und wenn die Transformation der Werte durch Rangfolge der Werte erfolgt Ein nicht parametrischer Test Mann-Whitney-U-testwürde dazu führen, dass mehr Informationen verloren gehen. Eine einzige Annahme, …
15 hypothesis-testing  permutation-test  exchangeability  r  statistical-significance  loess  data-visualization  normal-distribution  pdf  ggplot2  kernel-smoothing  probability  self-study  expected-value  normal-distribution  prior  correlation  time-series  regression  heteroscedasticity  estimation  estimators  fisher-information  data-visualization  repeated-measures  binary-data  panel-data  mathematical-statistics  coefficient-of-variation  normal-distribution  order-statistics  regression  machine-learning  one-class  probability  estimators  forecasting  prediction  validation  finance  measurement-error  variance  mean  spatial  monte-carlo  data-visualization  boxplot  sampling  uniform  chi-squared  goodness-of-fit  probability  mixture  theory  gaussian-mixture  regression  statistical-significance  p-value  bootstrap  regression  multicollinearity  correlation  r  poisson-distribution  survival  regression  categorical-data  ordinal-data  ordered-logit  regression  interaction  time-series  machine-learning  forecasting  cross-validation  binomial  multiple-comparisons  simulation  false-discovery-rate  r  clustering  frequency  wilcoxon-mann-whitney  wilcoxon-signed-rank  r  svm  t-test  missing-data  excel  r  numerical-integration  r  random-variable  lme4-nlme  mixed-model  weighted-regression  power-law  errors-in-variables  machine-learning  classification  entropy  information-theory  mutual-information 

4
Wie führe ich eine Regression für nicht normale Daten durch, die bei der Transformation nicht normal bleiben?
Ich habe einige Daten (158 Fälle), die aus einer Likert-Skala für 21 Fragebogenelemente abgeleitet wurden. Ich möchte / muss wirklich eine Regressionsanalyse durchführen, um zu sehen, welche Punkte auf dem Fragebogen die Antwort auf einen Gesamtpunkt vorhersagen (Zufriedenheit). Die Antworten sind nicht normalverteilt (laut KS-Tests) und ich habe sie in …

2
ARIMA-Schätzung von Hand
Ich versuche zu verstehen, wie die Parameter in ARIMA-Modellierung / Box Jenkins (BJ) geschätzt werden. Leider beschreibt keines der Bücher, auf die ich gestoßen bin, das Schätzverfahren wie das Log-Likelihood-Schätzverfahren im Detail. Ich fand die Website / das Lehrmaterial sehr hilfreich. Es folgt die oben angegebene Gleichung aus der Quelle. …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.