Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Genauigkeit gegen Fläche unter der ROC-Kurve
Ich habe eine ROC-Kurve für ein Diagnosesystem erstellt. Die Fläche unter der Kurve wurde dann nicht parametrisch auf AUC = 0,89 geschätzt. Als ich versuchte, die Genauigkeit bei der optimalen Schwellenwerteinstellung (dem Punkt, der dem Punkt (0, 1) am nächsten liegt) zu berechnen, erhielt ich eine Genauigkeit des Diagnosesystems von …

1
Wie passt man ein gemischtes Modell mit einer Antwortvariablen zwischen 0 und 1 an?
Ich versuche, lme4::glmer()ein binomiales verallgemeinertes gemischtes Modell (GLMM) mit abhängiger Variable anzupassen, die nicht binär ist, sondern eine kontinuierliche Variable zwischen Null und Eins. Man kann sich diese Variable als Wahrscheinlichkeit vorstellen; Tatsächlich ist es die Wahrscheinlichkeit, die von menschlichen Probanden angegeben wurde (in einem Experiment, das ich bei der …


2
Sind wir Frequentisten wirklich nur implizite / unwissende Bayesianer?
Für ein gegebenes Inferenzproblem wissen wir, dass sich ein Bayes'scher Ansatz normalerweise sowohl in der Form unterscheidet als auch aus einem fequentistischen Ansatz resultiert. Frequentisten (in der Regel auch ich) weisen häufig darauf hin, dass für ihre Methoden keine vorherige Verwendung erforderlich ist und sie daher eher "datengesteuert" als "urteilsgesteuert" …

2
Wie unterscheiden sich ABC und MCMC in ihren Anwendungen?
Nach meinem Verständnis verfolgen Approximate Bayesian Computation (ABC) und Markov Chain Monte Carlo (MCMC) sehr ähnliche Ziele. Im Folgenden beschreibe ich mein Verständnis dieser Methoden und wie ich die Unterschiede in ihrer Anwendung auf reale Daten wahrnehme. Ungefähre Bayes'sche Berechnung ABC besteht darin, einen Parameter aus einer vorherigen, durch numerische …

4
Die Maschinengenauigkeit zur Steigerung des Gradienten nimmt mit zunehmender Anzahl von Iterationen ab
Ich experimentiere mit dem Algorithmus der Gradientenverstärkungsmaschine über das caretPaket in R. Unter Verwendung eines kleinen Datensatzes für Hochschulzulassungen habe ich den folgenden Code ausgeführt: library(caret) ### Load admissions dataset. ### mydata <- read.csv("http://www.ats.ucla.edu/stat/data/binary.csv") ### Create yes/no levels for admission. ### mydata$admit_factor[mydata$admit==0] <- "no" mydata$admit_factor[mydata$admit==1] <- "yes" ### Gradient boosting …
15 machine-learning  caret  boosting  gbm  hypothesis-testing  t-test  panel-data  psychometrics  intraclass-correlation  generalized-linear-model  categorical-data  binomial  model  intercept  causality  cross-correlation  distributions  ranks  p-value  z-test  sign-test  time-series  references  terminology  cross-correlation  definition  probability  distributions  beta-distribution  inverse-gamma  missing-data  paired-comparisons  paired-data  clustered-standard-errors  cluster-sample  time-series  arima  logistic  binary-data  odds-ratio  medicine  hypothesis-testing  wilcoxon-mann-whitney  unsupervised-learning  hierarchical-clustering  neural-networks  train  clustering  k-means  regression  ordinal-data  change-scores  machine-learning  experiment-design  roc  precision-recall  auc  stata  multilevel-analysis  regression  fitting  nonlinear  jmp  r  data-visualization  gam  gamm4  r  lme4-nlme  many-categories  regression  causality  instrumental-variables  endogeneity  controlling-for-a-variable 

1
Schreiben der mathematischen Gleichung für ein Modell mit gemischten Effekten auf mehreren Ebenen
Die Frage zum Lebenslauf Ich versuche, (eine) detaillierte und präzise mathematische Darstellung (en) eines gemischten Effektmodells zu geben. Ich verwende das lme4Paket in R. Was ist die richtige mathematische Darstellung für mein Modell? Die Daten, die wissenschaftliche Frage und der R-Code Mein Datensatz besteht aus Arten in verschiedenen Regionen. Ich …




2
Vorhersagen aus dem BSTS-Modell (in R) scheitern vollständig
Nach dem Lesen diesen Blog-Beitrag über Bayes'sche strukturelle Zeitreihenmodelle , wollte ich die Implementierung im Kontext eines Problems betrachten, für das ich zuvor ARIMA verwendet hatte. Ich habe einige Daten mit einigen bekannten (aber lauten) saisonalen Komponenten - es gibt definitiv jährliche, monatliche und wöchentliche Komponenten dazu und auch einige …
15 r  time-series  bayesian  mcmc  bsts 

1
Was sind einige gute Interviewfragen für Entwickler von statistischen Algorithmen?
Ich interviewe Leute für eine Position als Entwickler / Forscher von Algorithmen in einem Kontext von Statistik, maschinellem Lernen und Data Mining. Ich suche nach Fragen, um insbesondere die Vertrautheit, das Verständnis und die Fließfähigkeit eines Kandidaten mit der zugrunde liegenden Theorie zu bestimmen, z. B. grundlegende Eigenschaften von Erwartung …

5
Statistische Variation in zwei Formel-1-Qualifikationsformaten
Ich habe gerade diesen BBC-Artikel über das Qualifying-Format in der Formel 1 gelesen . Die Organisatoren möchten das Qualifying weniger vorhersehbar machen, dh die statistische Streuung des Ergebnisses erhöhen. Bei einigen irrelevanten Details werden die Fahrer im Moment nach ihrer besten Einzelrunde aus (der Konkretisierung halber) zwei Versuchen gewertet. Ein …
15 variance 


3
Schätzung der Wahrscheinlichkeit in einem Bernoulli-Prozess durch Stichprobe von bis zu 10 Fehlern: Ist es voreingenommen?
Angenommen, wir haben einen Bernoulli-Prozess mit der Ausfallwahrscheinlichkeit (der klein sein wird, z. B. ), aus dem wir eine Stichprobe erstellen, bis wir auf Fehler stoßen . Wir schätzen die Ausfallwahrscheinlichkeit als wobei die Anzahl der Stichproben ist.q ≤ 0,01 10 q : = 10 / N Nqqqq≤0.01q≤0.01q \leq 0.01101010q^:=10/Nq^:=10/N\hat{q}:=10/NNNN …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.