Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


2
Warum sind Distributionen wichtig?
Dies mag genauso gut fallen wie die albernsten Fragen, die jemals in diesem Forum gestellt wurden, aber nachdem ich fundierte und aussagekräftige Antworten auf eine frühere Frage erhalten hatte, dachte ich, ich werde mein Glück wieder strecken. Ich bin seit einiger Zeit sehr verwirrt über die Bedeutung statistischer Verteilungen, insbesondere …

1
Statistischer Testvorschlag
Ich muss einen geeigneten statistischen Test (Likelihood-Ratio-Test, t-Test usw.) für Folgendes finden: Sei ist eine iid-Stichprobe eines Zufallsvektors ( X ; Y ) und nimmt an, dass ( Y X ) ~ N [ ( μ 1 μ 2 ) , ( 1 .5 .5 1 ) ] . Die …

2
Ist es möglich, eine Variable zu haben, die sowohl als Effektmodifikator als auch als Störfaktor fungiert?
Ist es möglich, eine Variable zu haben, die sowohl als Effektmodifikator (Messmodifikator) als auch als Störfaktor für ein bestimmtes Paar von Risiko-Ergebnis-Assoziationen fungiert? Ich bin mir der Unterscheidung immer noch ein wenig unsicher. Ich habe mir die grafische Notation angesehen, um den Unterschied zu verstehen, aber die Unterschiede in der …




1
Warum haben Anova () und drop1 () unterschiedliche Antworten für GLMMs geliefert?
Ich habe ein GLMM der Form: lmer(present? ~ factor1 + factor2 + continuous + factor1*continuous + (1 | factor3), family=binomial) Wenn ich benutze drop1(model, test="Chi"), erhalte ich andere Ergebnisse als wenn ich Anova(model, type="III")aus dem Autopaket oder benutze summary(model). Diese beiden letzteren geben die gleichen Antworten. Unter Verwendung einer Reihe …
10 r  anova  glmm  r  mixed-model  bootstrap  sample-size  cross-validation  roc  auc  sampling  stratification  random-allocation  logistic  stata  interpretation  proportion  r  regression  multiple-regression  linear-model  lm  r  cross-validation  cart  rpart  logistic  generalized-linear-model  econometrics  experiment-design  causality  instrumental-variables  random-allocation  predictive-models  data-mining  estimation  contingency-tables  epidemiology  standard-deviation  mean  ancova  psychology  statistical-significance  cross-validation  synthetic-data  poisson-distribution  negative-binomial  bioinformatics  sequence-analysis  distributions  binomial  classification  k-means  distance  unsupervised-learning  euclidean  correlation  chi-squared  spearman-rho  forecasting  excel  exponential-smoothing  binomial  sample-size  r  change-point  wilcoxon-signed-rank  ranks  clustering  matlab  covariance  covariance-matrix  normal-distribution  simulation  random-generation  bivariate  standardization  confounding  z-statistic  forecasting  arima  minitab  poisson-distribution  negative-binomial  poisson-regression  overdispersion  probability  self-study  markov-process  estimation  maximum-likelihood  classification  pca  group-differences  chi-squared  survival  missing-data  contingency-tables  anova  proportion 

2
Wie generiere ich Zahlen gemäß einer Soliton-Verteilung?
Die Soliton-Verteilung ist eine diskrete Wahrscheinlichkeitsverteilung über eine Menge mit der Wahrscheinlichkeitsmassenfunktion{1,…,N}{1,…,N}\{1,\dots, N\} p(1)=1N,p(k)=1k(k−1)for k∈{2,…,N}p(1)=1N,p(k)=1k(k−1)for k∈{2,…,N} p(1)=\frac{1}{N},\qquad p(k)=\frac{1}{k(k-1)}\quad\text{for }k\in\{2,\dots, N\} Ich möchte es als Teil einer Implementierung eines LT-Codes verwenden , idealerweise in Python, wo ein einheitlicher Zufallszahlengenerator verfügbar ist.


3
Woher kommt der Begriff „Modell lernen“?
Oft habe ich gehört, dass die Data Miner hier diesen Begriff verwenden. Als Statistiker, der an Klassifizierungsproblemen gearbeitet hat, kenne ich den Begriff "Klassifizierer trainieren" und gehe davon aus, dass "Modell lernen" dasselbe bedeutet. Ich habe nichts gegen den Begriff "einen Klassifikator trainieren". Dies scheint die Idee der Anpassung eines …

1
Bayes-Faktoren mit unpassenden Prioritäten
Ich habe eine Frage zum Modellvergleich mit Bayes-Faktoren. In vielen Fällen sind Statistiker daran interessiert, einen Bayes'schen Ansatz mit falschen Priors zu verwenden (zum Beispiel einige Jeffreys-Priors und Referenzpriors). Meine Frage ist, ob es in den Fällen, in denen die posteriore Verteilung der Modellparameter genau definiert ist, gültig ist, Modelle …

1
Korrektur für normalverteilte Ungenauigkeiten der Uhr
Ich habe ein Experiment, das auf Hunderten von Computern durchgeführt wird, die auf der ganzen Welt verteilt sind und das Auftreten bestimmter Ereignisse messen. Die Ereignisse hängen voneinander ab, sodass ich sie in aufsteigender Reihenfolge bestellen und dann die Zeitdifferenz berechnen kann. Die Ereignisse sollten exponentiell verteilt sein, aber wenn …

2
Verwirrt über das Konfidenzintervall
Ich bin verwirrt über das Konzept des Konfidenzintervalls. Angenommen, es gibt eine Gaußsche Variable mit bekannt, und ich interessiere mich für die Untergrenze des Mittelwerts mit einem von .σ μ L 95 %X∼N(μ,σ)X∼N(μ,σ)X \sim N(\mu, \sigma)σσ\sigmaμLμL\mu_L95%95%95\% Ich werde das Experiment Mal durchführen und , , , , .x 1 x …

2
Ist Multikollinearität in kategorialen Variablen enthalten?
Beim Basteln mit einem multivariaten Regressionsmodell stellte ich fest, dass innerhalb der Kategorien einer kategorialen Variablen (natürlich nach Ausschluss der Referenzkategorie) ein kleiner, aber wahrnehmbarer Multikollinearitätseffekt auftrat, gemessen anhand von Varianzinflationsfaktoren . Nehmen wir zum Beispiel an, wir haben einen Datensatz mit der stetigen Variablen y und einer nominalen kategorialen …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.