Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Was ist die Summe der quadrierten t-Variablen?
Es sei aus einer Student-t-Verteilung mit Freiheitsgraden für mäßig große (sagen wir weniger als 100) gezogen. Definiere Ist fast wie ein Chi-Quadrat mit Freiheitsgraden verteilt? Gibt es so etwas wie den zentralen Grenzwertsatz für die Summe der quadratischen Zufallsvariablen?titit_innnnnnT=∑1≤i≤kt2iT=∑1≤i≤kti2T = \sum_{1\le i \le k} t_i^2TTTkkk

4
In der Praxis verwendete Metropolis-Hastings-Algorithmen
Ich habe heute Christian Roberts Blog gelesen und mochte den neuen Metropolis-Hastings-Algorithmus, den er diskutierte, sehr. Es schien einfach und leicht zu implementieren. Immer wenn ich MCMC codiere, bleibe ich bei sehr einfachen MH-Algorithmen, wie unabhängigen Zügen oder zufälligen Schritten auf der Log-Skala. Welche MH-Algorithmen verwenden Menschen routinemäßig? Bestimmtes: Warum …

4
Was ist eine enge Untergrenze für die Kuponsammelzeit?
In dem klassischen Coupon Collector-Problem ist bekannt, dass die Zeit erforderlich ist, um einen Satz von zufällig ausgewählten Coupons zu vervollständigen, , und .TTTnnnE[T]∼nlnnE[T]∼nln⁡nE[T] \sim n \ln n Var(T)∼n2Var(T)∼n2Var(T) \sim n^2Pr(T&gt;nlnn+cn)&lt;e−cPr(T&gt;nln⁡n+cn)&lt;e−c\Pr(T > n \ln n + cn) < e^{-c} Diese Obergrenze ist besser als die durch die Chebyshev-Ungleichung gegebene, die …


3
Den "Kernel-Trick" auf lineare Methoden anwenden?
Der Kernel-Trick wird in mehreren maschinellen Lernmodellen (z . B. SVM ) verwendet. Es wurde erstmals 1964 in der Arbeit "Theoretische Grundlagen der Potentialfunktionsmethode beim Lernen der Mustererkennung" vorgestellt. Die Wikipedia-Definition besagt, dass dies der Fall ist ein Verfahren zum Verwenden eines linearen Klassifikatoralgorithmus zum Lösen eines nichtlinearen Problems durch …

14
Software für einfache und dennoch robuste Datenexploration
Bei meinen Versuchen, das Chaos in der Tabellenkalkulation zu bekämpfen, bin ich oft evangelisch, wenn ich auf robustere Tools wie echte Statistiksoftware (R, Stata und dergleichen) dränge. Vor kurzem wurde ich in dieser Hinsicht von jemandem herausgefordert, der mit Nachdruck erklärte, dass er das Programmieren einfach nicht lernen werde. Ich …


4
Was sind die korrekten Werte für Präzision und Rückruf in Randfällen?
Präzision ist definiert als: p = true positives / (true positives + false positives) Ist es richtig, dass sich die Genauigkeit 1 nähert true positivesund false positivessich 0 nähert? Gleiche Frage zum Rückruf: r = true positives / (true positives + false negatives) Ich führe derzeit einen statistischen Test durch, …
20 precision-recall  data-visualization  logarithm  references  r  networks  data-visualization  standard-deviation  probability  binomial  negative-binomial  r  categorical-data  aggregation  plyr  survival  python  regression  r  t-test  bayesian  logistic  data-transformation  confidence-interval  t-test  interpretation  distributions  data-visualization  pca  genetics  r  finance  maximum  probability  standard-deviation  probability  r  information-theory  references  computational-statistics  computing  references  engineering-statistics  t-test  hypothesis-testing  independence  definition  r  censoring  negative-binomial  poisson-distribution  variance  mixed-model  correlation  intraclass-correlation  aggregation  interpretation  effect-size  hypothesis-testing  goodness-of-fit  normality-assumption  small-sample  distributions  regression  normality-assumption  t-test  anova  confidence-interval  z-statistic  finance  hypothesis-testing  mean  model-selection  information-geometry  bayesian  frequentist  terminology  type-i-and-ii-errors  cross-validation  smoothing  splines  data-transformation  normality-assumption  variance-stabilizing  r  spss  stata  python  correlation  logistic  logit  link-function  regression  predictor  pca  factor-analysis  r  bayesian  maximum-likelihood  mcmc  conditional-probability  statistical-significance  chi-squared  proportion  estimation  error  shrinkage  application  steins-phenomenon 

5
Wann können Sie datenbasierte Kriterien verwenden, um ein Regressionsmodell anzugeben?
Ich habe gehört, dass, wenn viele Regressionsmodellspezifikationen (z. B. in OLS) als Möglichkeiten für einen Datensatz betrachtet werden, dies zu mehreren Vergleichsproblemen führt und die p-Werte und Konfidenzintervalle nicht mehr zuverlässig sind. Ein extremes Beispiel hierfür ist die schrittweise Regression. Wann kann ich die Daten selbst verwenden, um das Modell …

6
Ist mein Wettermann korrekt?
Eine Frage, die mich einige Zeit beschäftigte und die ich nicht beantworten kann: Jeden Tag gibt mein Wettermann eine prozentuale Regenwahrscheinlichkeit an (nehmen wir an, dass diese auf 9000 Stellen berechnet ist und er nie eine Zahl wiederholt hat). An jedem folgenden Tag regnet es oder es regnet nicht. Ich …


4
Ist ein Modell an Daten angepasst oder sind Daten an ein Modell angepasst?
Gibt es einen konzeptionellen oder prozeduralen Unterschied zwischen der Anpassung eines Modells an Daten und der Anpassung von Daten an Modelle? Ein Beispiel für den ersten Wortlaut ist in zu sehen https://courses.washington.edu/matlab1/ModelFitting.html und das zweite unter https://reference.wolfram.com/applications/eda/FittingDataToLinearModelsByLeast-SquaresTechniques.html .

2
Bayesianische Überanpassung
Ich habe viel Zeit in die Entwicklung von Methoden und Software für die Validierung von Vorhersagemodellen im Bereich der traditionellen Statistik investiert. Wenn ich mehr Bayes'sche Ideen in die Praxis umsetze und unterrichte, sehe ich einige wesentliche Unterschiede, die ich berücksichtigen muss. Erstens fordert die Bayes'sche Vorhersagemodellierung den Analysten auf, …

1
Unterschied zwischen fehlenden Daten und spärlichen Daten in Algorithmen für maschinelles Lernen
Was sind die Hauptunterschiede zwischen Daten mit geringer Dichte und fehlenden Daten? Und wie beeinflusst es das maschinelle Lernen? Genauer gesagt, welche Auswirkung haben spärliche Daten und fehlende Daten auf Klassifizierungsalgorithmen und Regressionsalgorithmen (Vorhersage von Zahlen). Ich spreche von einer Situation, in der der Prozentsatz fehlender Daten erheblich ist und …

5
Warum funktioniert Feature Engineering?
Kürzlich habe ich erfahren, dass eine Möglichkeit, bessere Lösungen für ML-Probleme zu finden, in der Erstellung von Features besteht. Man kann das zum Beispiel durch Summieren von zwei Merkmalen tun. Zum Beispiel besitzen wir zwei Funktionen "Angriff" und "Verteidigung" einer Art Held. Wir erstellen dann ein zusätzliches Feature namens "total", …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.