Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

6
Statistik / Wahrscheinlichkeitsvideos für Anfänger
Es gab bereits eine Anfrage für mathematische Statistik-Videos , die jedoch ausdrücklich von den Leuten nachgefragt wurde Videos, die eine strenge mathematische Darstellung von Statistiken ermöglichen. dh Videos, die einen Kurs begleiten könnten, in dem ein in dieser Diskussion erwähntes Lehrbuch verwendet wird: Gleichzeitig frage ich mich, welche Empfehlung Sie …
28 references 

6
Probleme mit Kreisdiagrammen
Es scheint eine zunehmende Diskussion über Kreisdiagramme zu geben. Die Hauptargumente dagegen scheinen zu sein: Fläche wird mit weniger Kraft als Länge wahrgenommen. Kreisdiagramme haben ein sehr geringes Datenpunkt-zu-Pixel-Verhältnis Ich denke jedoch, dass sie irgendwie nützlich sein können, wenn Proportionen dargestellt werden. Ich bin damit einverstanden, in den meisten Fällen …

1
Berechnung der Wiederholbarkeit von Effekten aus einem früheren Modell
Ich bin gerade auf diese Arbeit gestoßen , in der beschrieben wird, wie die Wiederholbarkeit (auch bekannt als Zuverlässigkeit, auch bekannt als Intraclass-Korrelation) einer Messung über Mixed-Effects-Modellierung berechnet wird. Der R-Code wäre: #fit the model fit = lmer(dv~(1|unit),data=my_data) #obtain the variance estimates vc = VarCorr(fit) residual_var = attr(vc,'sc')^2 intercept_var = …
28 mixed-model  reliability  intraclass-correlation  repeatability  spss  factor-analysis  survey  modeling  cross-validation  error  curve-fitting  mediation  correlation  clustering  sampling  machine-learning  probability  classification  metric  r  project-management  optimization  svm  python  dataset  quality-control  checking  clustering  distributions  anova  factor-analysis  exponential  poisson-distribution  generalized-linear-model  deviance  machine-learning  k-nearest-neighbour  r  hypothesis-testing  t-test  r  variance  levenes-test  bayesian  software  bayesian-network  regression  repeated-measures  least-squares  change-scores  variance  chi-squared  variance  nonlinear-regression  regression-coefficients  multiple-comparisons  p-value  r  statistical-significance  excel  sampling  sample  r  distributions  interpretation  goodness-of-fit  normality-assumption  probability  self-study  distributions  references  theory  time-series  clustering  econometrics  binomial  hypothesis-testing  variance  t-test  paired-comparisons  statistical-significance  ab-test  r  references  hypothesis-testing  t-test  normality-assumption  wilcoxon-mann-whitney  central-limit-theorem  t-test  data-visualization  interactive-visualization  goodness-of-fit 



6
Was sind Alternativen zu gebrochenen Achsen?
Benutzer sind häufig versucht, Achsenwerte zu unterbrechen, um Daten unterschiedlicher Größenordnungen in demselben Diagramm darzustellen (siehe hier ). Dies mag zwar praktisch sein, ist jedoch nicht immer die bevorzugte Art der Anzeige der Daten (kann bestenfalls irreführend sein). Was sind alternative Möglichkeiten zur Anzeige von Daten, die sich in mehreren …


26
Welche R-Pakete finden Sie in Ihrer täglichen Arbeit am nützlichsten?
Doppelter Thread: Ich habe gerade die neueste Version von R installiert. Welche Pakete sollte ich erhalten? Was sind die R- Pakete, die Sie sich bei Ihrer täglichen Arbeit mit Daten nicht vorstellen können? Bitte listen Sie sowohl allgemeine als auch spezifische Tools auf. UPDATE: Stand 24.10.10 ggplot2scheint der Gewinner mit …
28 r 

4
Eine Anpassung der Kullback-Leibler-Distanz?
Schau dir dieses Bild an: Wenn wir eine Stichprobe aus der Rotdichte ziehen, werden einige Werte voraussichtlich unter 0,25 liegen, während es unmöglich ist, eine solche Stichprobe aus der Blauverteilung zu erzeugen. Infolgedessen ist der Kullback-Leibler-Abstand von der roten zur blauen Dichte unendlich. Die beiden Kurven sind jedoch in gewissem …

2
Warum ist der mittlere quadratische Fehler die Kreuzentropie zwischen der empirischen Verteilung und einem Gaußschen Modell?
In 5.5, Deep Learning (von Ian Goodfellow, Yoshua Bengio und Aaron Courville) heißt es: Jeder Verlust, der aus einer negativen logarithmischen Wahrscheinlichkeit besteht, ist eine Kreuzentropie zwischen der empirischen Verteilung, die durch den Trainingssatz definiert ist, und der Wahrscheinlichkeitsverteilung, die durch das Modell definiert ist. Zum Beispiel ist der mittlere …

6
Warum brauchen wir multivariate Regression (im Gegensatz zu einer Reihe von univariaten Regressionen)?
Ich habe gerade dieses wunderbare Buch durchgesehen: Angewandte multivariate statistische Analyse von Johnson und Wichern . Die Ironie ist, dass ich die Motivation für die Verwendung multivariater (Regressions-) Modelle anstelle separater univariater (Regressions-) Modelle immer noch nicht verstehen kann. Ich habe die stats.statexchange-Posts 1 und 2 durchgesehen , die (a) …

4
Warum colormap viridis over jet verwenden?
Wie in https://www.youtube.com/watch?v=xAoljeRJ3lU angekündigt , ändert Matplotlib die Standard-Farbkarte von Jet auf Viridis. Allerdings verstehe ich das nicht so gut. Vielleicht, weil ich farbenblind bin? Der ursprüngliche Colormap-Jet sieht sehr stark aus, ich spüre den Kontrast: Während der neuen Colormap viridis dieser Kontrast fehlt: Kann mir das bitte jemand einfacher …




Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.