Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Ein konkretes Beispiel ist die Durchführung einer SVD, um fehlende Werte zu unterstellen
Ich habe die großartigen Kommentare zum Umgang mit fehlenden Werten vor dem Anwenden von SVD gelesen, möchte aber anhand eines einfachen Beispiels wissen, wie dies funktioniert: Movie1 Movie2 Movie3 User1 5 4 User2 2 5 5 User3 3 4 User4 1 5 User5 5 1 5 Wenn ich in der …
8 r  missing-data  data-imputation  svd  sampling  matlab  mcmc  importance-sampling  predictive-models  prediction  algorithms  graphical-model  graph-theory  r  regression  regression-coefficients  r-squared  r  regression  modeling  confounding  residuals  fitting  glmm  zero-inflation  overdispersion  optimization  curve-fitting  regression  time-series  order-statistics  bayesian  prior  uninformative-prior  probability  discrete-data  kolmogorov-smirnov  r  data-visualization  histogram  dimensionality-reduction  classification  clustering  accuracy  semi-supervised  labeling  state-space-models  t-test  biostatistics  paired-comparisons  paired-data  bioinformatics  regression  logistic  multiple-regression  mixed-model  random-effects-model  neural-networks  error-propagation  numerical-integration  time-series  missing-data  data-imputation  probability  self-study  combinatorics  survival  cox-model  statistical-significance  wilcoxon-mann-whitney  hypothesis-testing  distributions  normal-distribution  variance  t-distribution  probability  simulation  random-walk  diffusion  hypothesis-testing  z-test  hypothesis-testing  data-transformation  lognormal  r  regression  agreement-statistics  classification  svm  mixed-model  non-independent  observational-study  goodness-of-fit  residuals  confirmatory-factor  neural-networks  deep-learning 

3
Definition der Gültigkeit einer instrumentellen Variablen
Was bedeutet "Gültigkeit eines Instruments" genau? In meinem ökonometrischen Kurs haben wir gerade die Instrumentenvalidität als , wobei die instrumentelle Variable und der Fehlerterm eines univariaten Regressionsmodells ist. Dann haben wir auch über die Stärke eines Instruments gesprochen, aber ich bin mir ziemlich sicher, dass ich richtig verstanden habe, dass …

2
RNN-Topologie (Recurrent Neural Network): Warum immer vollständig verbunden?
Ich habe angefangen, über wiederkehrende neuronale Netze (RNNs) und Langzeit-Kurzzeitgedächtnis (LSTM) zu lesen ... (... oh, nicht genug Wiederholungspunkte hier, um Referenzen aufzulisten ...) Eine Sache verstehe ich nicht: Es scheint immer, dass Neuronen in jeder Instanz einer verborgenen Schicht mit jedem Neuron in der vorherigen Instanz der verborgenen Schicht …

1
Wie wird die Wahrscheinlichkeit einer probabilistischen Prognose gemessen?
Angenommen, ich mache eine Reihe von Wahrscheinlichkeitsprognosen wie: 70% Wahrscheinlichkeit, dass das Umsatzwachstum im ersten Quartal 10-15% beträgt, 10% Wahrscheinlichkeit, dass das Umsatzwachstum> 15% beträgt, 20% Wahrscheinlichkeit, dass das Umsatzwachstum <10% beträgt Was ist angesichts der tatsächlichen Daten der beste Weg, um meine Genauigkeit zu messen oder zu verfolgen? Brier …


2
Gaußsche Prozesse mit endlicher Abtastfläche
Ich entschuldige mich im Voraus, wenn diese Frage schlecht gestellt ist: Ich bin ein Astronom, kein Statistiker. Meine Frage soll mir speziell helfen, herauszufinden, ob Gaußsche Prozesse eine geeignete Technik für mein Problem sind. Mit einem Teleskop und einem fasergespeisten Spektrographen hat mein Projekt an vielen Orten das optische Spektrum …

1
Verteilung eines Polynoms zweiten Grades einer Gaußschen Zufallsvariablen
Ich möchte berechnen P(Y=aX2+bX+c&lt;0)P(Y=aX2+bX+c&lt;0)P(Y=aX^2+bX+c<0) wobei . Ich kann es ganz einfach mit Monte Carlo machen. Ich wurde jedoch gebeten, das analytische PDF von und dann zu berechnenf Y ( y ) Y.X∼N(0,σ)X∼N(0,σ)X \sim N(0,\sigma)fY(y)fY(y)f_Y(y)YYY I=∫0−∞fY(y)dyI=∫−∞0fY(y)dyI=\int_{-\infty}^0 f_Y(y) dy Ich denke, wird so sein, dass nur numerisch berechnet werden kann. Da es …

1
Angebotsverteilung - Metropolis Hastings MCMC
In der Metropolis-Hastings-Markov-Kette Monte Carlo kann die Angebotsverteilung alles sein, einschließlich des Gaußschen (laut Wikipedia). F: Was ist die Motivation, etwas anderes als Gaußsch zu verwenden? Gauß funktioniert, es ist leicht zu bewerten, es ist schnell und jeder versteht es. Warum sollte ich etwas anderes in Betracht ziehen? F: Kann …




1
Der variable Koeffizient steigt und fällt dann mit abnehmendem Lambda (LASSO)
Ich regressiere einen kontinuierlichen Prädiktor für über 60 Variablen (sowohl kontinuierlich als auch kategorial) mit LASSO (glmnet). Bei der Untersuchung des variablen Trace-Diagramms stelle ich fest, dass eine der Schlüsselvariablen mit zunehmendem log Lambda einen Koeffizienten aufweist, der tatsächlich zunimmt. Dann, nach einem bestimmten Punkt, beginnt es abzunehmen, wie wir …




Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.