Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Die Idee, die Daten zu erstellen, hat einen Mittelwert von Null
Ich sehe oft Leute, die eine Dimension / ein Feature eines Datensatzes auf einen Mittelwert von Null setzen, indem sie den Mittelwert aus allen Elementen entfernen. Aber ich habe nie verstanden, warum das so ist? Was bewirkt dies als Vorverarbeitungsschritt? Verbessert es die Klassifizierungsleistung? Hilft es, etwas über den Datensatz …


2
Ist es falsch, Liniendiagramme für diskrete Daten zu verwenden?
Ich habe oft diskrete Datensätze als Liniendiagramme gesehen, aber mir ist aufgefallen, dass die Linie an einem Punkt zwischen den Messintervallen einen Wert ableitet, der für diskrete Datensätze bedeutungslos ist. Ist es deshalb so, dass die Verwendung von Liniendiagrammen für diskrete Daten falsch ist? Nehmen Sie als Beispiel zwei Zeitreihendatensätze, …

3
Wie lassen sich Daten am besten umformen / umstrukturieren?
Ich bin wissenschaftlicher Mitarbeiter für ein Labor (ehrenamtlich). Ich und eine kleine Gruppe wurden mit der Datenanalyse für einen Datensatz aus einer großen Studie beauftragt. Leider wurden die Daten mit einer Art Online-App gesammelt und nicht so programmiert, dass die Daten in der am besten verwendbaren Form ausgegeben wurden. Die …
12 r  excel  data-cleaning 


3
Welcher statistische Test wird für den A / B-Test verwendet?
Wir haben zwei Kohorten mit jeweils 1000 Proben. Wir messen 2 Mengen pro Kohorte. Die erste ist eine binäre Variable. Die zweite Zahl ist eine reelle Zahl, die einer starken Schwanzverteilung folgt. Wir möchten beurteilen, welche Kohorte für jede Metrik die beste Leistung erbringt. Es stehen zahlreiche statistische Tests zur …
12 ab-test 


3
Exponentielle Obergrenze
Angenommen, wir haben IID-Zufallsvariablen mit der Verteilung . Wir werden eine Probe des beobachten ist auf folgende Weise: lassen unabhängig Zufallsvariablen an , dass die ganze 's und ‚s sind unabhängig und definieren die Stichprobengröße . Die - geben an, welche der - in der Stichprobe enthalten sind, und wir …



1
Lmer-Modell konvergiert nicht
Meine Daten werden hier beschrieben. Was kann dazu führen, dass beim Anpassen einer ANOVA mit wiederholten Messungen ein "Error () - Modell ist ein singulärer Fehler" auftritt? Ich versuche, den Effekt einer Interaktion zu sehen, indem lmerich folgenden Basisfall benutze : my_null.model <- lmer(value ~ Condition+Scenario+ (1|Player)+(1|Trial), data = my, …
12 r  lme4-nlme 

2
Können wir probabilistische Aussagen mit Vorhersageintervallen treffen?
Ich habe die vielen hervorragenden Diskussionen auf der Website über die Interpretation von Konfidenzintervallen und Vorhersageintervallen gelesen, aber ein Konzept ist immer noch etwas rätselhaft: Betrachten Sie das OLS-Framework und wir haben das angepasste Modell . Wir erhalten ein und werden gebeten, die Antwort vorherzusagen. Wir berechnen und geben als …

5
Wie führt man eine Imputation von Werten in einer sehr großen Anzahl von Datenpunkten durch?
Ich habe einen sehr großen Datensatz und es fehlen ungefähr 5% zufällige Werte. Diese Variablen sind miteinander korreliert. Der folgende Beispiel-R-Datensatz ist nur ein Spielzeugbeispiel mit Dummy-korrelierten Daten. set.seed(123) # matrix of X variable xmat <- matrix(sample(-1:1, 2000000, replace = TRUE), ncol = 10000) colnames(xmat) <- paste ("M", 1:10000, sep …
12 r  random-forest  missing-data  data-imputation  multiple-imputation  large-data  definition  moving-window  self-study  categorical-data  econometrics  standard-error  regression-coefficients  normal-distribution  pdf  lognormal  regression  python  scikit-learn  interpolation  r  self-study  poisson-distribution  chi-squared  matlab  matrix  r  modeling  multinomial  mlogit  choice  monte-carlo  indicator-function  r  aic  garch  likelihood  r  regression  repeated-measures  simulation  multilevel-analysis  chi-squared  expected-value  multinomial  yates-correction  classification  regression  self-study  repeated-measures  references  residuals  confidence-interval  bootstrap  normality-assumption  resampling  entropy  cauchy  clustering  k-means  r  clustering  categorical-data  continuous-data  r  hypothesis-testing  nonparametric  probability  bayesian  pdf  distributions  exponential  repeated-measures  random-effects-model  non-independent  regression  error  regression-to-the-mean  correlation  group-differences  post-hoc  neural-networks  r  time-series  t-test  p-value  normalization  probability  moments  mgf  time-series  model  seasonality  r  anova  generalized-linear-model  proportion  percentage  nonparametric  ranks  weighted-regression  variogram  classification  neural-networks  fuzzy  variance  dimensionality-reduction  confidence-interval  proportion  z-test  r  self-study  pdf 


2
Warum ist diese Verteilung einheitlich?
Wir untersuchen statistische Tests nach Bayes und stoßen auf ein merkwürdiges (zumindest für mich) Phänomen. Betrachten Sie den folgenden Fall: Wir sind daran interessiert zu messen, welche Population A oder B eine höhere Conversion-Rate aufweist. Für eine Plausibilitätsprüfung setzen wir pA=pBpA=pBp_A = p_B , dh die Konversionswahrscheinlichkeit ist in beiden …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.