Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Warum würde ein statistisches Modell bei einem riesigen Datensatz überanpassen?
Für mein aktuelles Projekt muss ich möglicherweise ein Modell erstellen, um das Verhalten einer bestimmten Personengruppe vorherzusagen. Der Trainingsdatensatz enthält nur 6 Variablen (ID dient nur zu Identifikationszwecken): id, age, income, gender, job category, monthly spend in dem monthly spendist die Antwortvariable. Der Trainingsdatensatz enthält jedoch ungefähr 3 Millionen Zeilen, …
8 modeling  large-data  overfitting  clustering  algorithms  error  spatial  r  regression  predictive-models  linear-model  average  measurement-error  weighted-mean  error-propagation  python  standard-error  weighted-regression  hypothesis-testing  time-series  machine-learning  self-study  arima  regression  correlation  anova  statistical-significance  excel  r  regression  distributions  statistical-significance  contingency-tables  regression  optimization  measurement-error  loss-functions  image-processing  java  panel-data  probability  conditional-probability  r  lme4-nlme  model-comparison  time-series  probability  probability  conditional-probability  logistic  multiple-regression  model-selection  r  regression  model-based-clustering  svm  feature-selection  feature-construction  time-series  forecasting  stationarity  r  distributions  bootstrap  r  distributions  estimation  maximum-likelihood  garch  references  probability  conditional-probability  regression  logistic  regression-coefficients  model-comparison  confidence-interval  r  regression  r  generalized-linear-model  outliers  robust  regression  classification  categorical-data  r  association-rules  machine-learning  distributions  posterior  likelihood  r  hypothesis-testing  normality-assumption  missing-data  convergence  expectation-maximization  regression  self-study  categorical-data  regression  simulation  regression  self-study  self-study  gamma-distribution  modeling  microarray  synthetic-data 

1
Fehler bei der linearen Regression / Vorhersage eines realen Datensatzes
Ich habe einen Datensatz, für den ich versuche, eine Regression durchzuführen, und der fehlschlägt. Die Situation: Tausende von Kampfroboterbetreibern kämpfen mit Kampfrobotern untereinander. Einige Kampfroboter sind stark und mächtig, andere sind schwach; Die Starken gewinnen öfter und verursachen mehr Schaden. Die Fähigkeiten der Roboterbediener variieren, wobei die erfahreneren häufiger gewinnen …


1
Nicht konjugiert vor
Kann jemand erklären, warum das Integral in der posterioren Dichte möglicherweise nicht "analytisch nachvollziehbar" ist, wenn der von uns gewählte Prior nicht konjugiert ist?
8 bayesian 


1
Validierung eines Fragebogens in einer neuen Population
Ich habe 400 Antworten auf einen 20-Punkte-Fragebogen, der vorgibt, ein Einstellungskonstrukt bei Medizinstudenten zu messen. Das Instrument wurde in den USA für ein einziges Jahr von Medizinstudenten validiert und die veröffentlichten Daten sind sehr "sauber" - alle RITC-Werte> 0,3, Alpha 0,84, PCA mit einer stabilen Vier-Faktor-Struktur usw. In meiner Stichprobe …

2
Algebraische Geometrie für die Statistik
Ich habe von Anwendungen der algebraischen Geometrie in Statistik und maschinellem Lernen gehört. Ich wollte versuchen, etwas über diese Themen zu lernen. Ich weiß fast nichts über algebraische Geometrie, aber ich habe einen Hintergrund in Mathematik und ich kenne mich mit grundlegender Gruppentheorie, Ringfeldern und etwas kommutativer Algebra aus. Meine …

1
Robuste monotone Regression in R.
Ich habe die folgende Tabelle in R df <- structure(list(x = structure(c(12458, 12633, 12692, 12830, 13369, 13455, 13458, 13515), class = "Date"), y = c(6080, 6949, 7076, 7818, 0, 0, 10765, 11153)), .Names = c("x", "y"), row.names = c("1", "2", "3", "4", "5", "6", "8", "9"), class = "data.frame") > …

2
Rastersuche zur SVM-Parameterschätzung
Ich experimentiere derzeit mit Gridsearch, um eine Support-Vektor-Maschine zu trainieren. Ich verstehe, dass, wenn ich die Parameter gamma und C habe, die R-Funktion tune.svm eine 10-fache Kreuzvalidierung für alle Kombinationen dieser beiden Parameter durchführt. Da ich nicht wusste, wie ich anfangen soll, habe ich versucht, einige Informationen darüber zu erhalten, …
8 svm 

3
Zufälliger Spaziergang: Könige auf einem Schachbrett
Ich habe eine Frage zum zufälligen Gang zweier Könige in einem 3 × 3-Schachbrett. Jeder König bewegt sich zufällig mit gleicher Wahrscheinlichkeit auf diesem Schachbrett - vertikal, horizontal und diagonal. Die beiden Könige bewegen sich unabhängig voneinander im selben Schachbrett. Beide beginnen auf demselben Feld und bewegen sich dann unabhängig …

2
Testen einer 2x2-Kontingenztabelle: männlich / weiblich, erwerbstätig / arbeitslos
Ich studiere Naturwissenschaften und meine statistischen Kenntnisse sind eher oberflächlich. Problem Ich musste einen Datensatz finden und nach besten Kräften als Aufgabe für meinen Statistikkurs analysieren. Dies ist keine Aufgabe mehr, ich brauche nur Hilfe bei der Interpretation, warum ich meine Analyse schlecht gemacht habe und was ich stattdessen hätte …

1
Sternkoordinaten vs. Hauptkomponentenanalyse
Ich bereite gerade eine Präsentation für einen Universitätskurs in "Visual Data Analysis" vor. Und eines meiner Themen ist die Visualisierung "Star Coordinate". Sternkoordinaten Da Sternkoordinaten eine Transformation hochdimensionaler Daten durchführen und die bekannte PCA-Technik dies auch tut, frage ich mich, ob PCA durch Sternkoordinaten nachgeahmt werden kann. Ich denke daran, …

1
Was bedeutet es, einen Wahrscheinlichkeitsvektor aus einer Dirichlet-Verteilung abzutasten?
Ich lerne im Wesentlichen etwas über Latent Dirichlet Allocation. Ich schaue mir hier ein Video an: http://videolectures.net/mlss09uk_blei_tm/ und stecke in Minute 45 fest, als er anfing, die Stichproben aus der Distribution zu erklären. Außerdem habe ich versucht, ein Buch über maschinelles Lernen zu konsultieren, das keine detaillierte Einführung in die …



Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.