Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren




1
Wahl zwischen verschiedenen robusten Regressionen in R.
Ich schreibe ein Programm zur Bewertung von Immobilien und verstehe die Unterschiede zwischen einigen robusten Regressionsmodellen nicht wirklich. Deshalb weiß ich nicht, welches ich wählen soll. Ich habe versucht lmrob, ltsRegund rlm. Für denselben Datensatz ergaben alle drei Methoden unterschiedliche Werte für die Koeffizienten. Ich dachte, dass es am besten …

2
R lmerTest und Tests mehrerer zufälliger Effekte
Ich bin gespannt, wie das lmerTest-Paket in R, insbesondere die "rand" -Funktion, Tests mit zufälligen Effekten verarbeitet. Betrachten Sie das Beispiel aus dem lmerTest-PDF auf CRAN, das den integrierten Datensatz "Karotten" verwendet: #import lme4 package and lmerTest package library(lmerTest) #lmer model with correlation between intercept and slopes #in the random …

1
Obergrenze an
( 0 , 1 ) φ ( x ) = 1 / x E [ 1X.XX ist eine diskrete Zufallsvariable, die Werte von annehmen kann . Da eine konvexe Funktion ist, können wir Jensens Ungleichung verwenden, um eine Untergrenze abzuleiten : Ist es möglich, eine Obergrenze abzuleiten ?( 0 , …

1
Wie berechnet man eine Stichprobengröße zur Überprüfung der Richtigkeit / Unrichtigkeit von Datensätzen in einer Datentabelle?
Ich habe vorhandene Antworten auf CrossValidated (und an anderer Stelle online) gelesen und kann nicht finden, wonach ich suche. Bitte verweise mich jedoch auf vorhandene Quellen, wenn ich sie verpasst habe. Angenommen, ich habe einen Datensatz mit N = 1000 Datensätzen, von denen jeder manuell abgetastet und entweder als "gültig" …



2
Warum enthält der Name EM-Algorithmus ein E.
Ich verstehe, wo der E-Schritt im Algorithmus stattfindet (wie im Abschnitt "Mathematik" unten erläutert). Meiner Meinung nach ist der Schlüsseleinfallsreichtum des Algorithmus die Verwendung der Jensen-Ungleichung, um eine Untergrenze für die Log-Wahrscheinlichkeit zu erstellen. In diesem Sinne Expectationwird einfach genommen, um die logarithmische Wahrscheinlichkeit neu zu formulieren, um in Jensens …

2
Ist der Wilcoxon-Rang-Summen-Test der richtige Test, um festzustellen, ob sich die Gesamtspenden unterscheiden?
Hintergrund: Meine Software bittet Benutzer um optionale Spenden in beliebiger Höhe. Ich habe Testspendenanfragen unter den Benutzern aufgeteilt, um den besten Weg zu finden, um zu fragen: 50% erhalten Anforderungsversion 1, 50% erhalten Anforderungsversion 2, und wir sehen, welche besser ist. Fast alle Benutzer geben 0 US-Dollar, aber einige spenden. …


3
Finden Sie die Verteilung und transformieren Sie sie in die Normalverteilung
Ich habe Daten, die beschreiben, wie oft ein Ereignis während einer Stunde stattfindet ("Anzahl pro Stunde", nph) und wie lange die Ereignisse dauern ("Dauer in Sekunden pro Stunde", dph). Dies sind die Originaldaten: nph <- c(2.50000000003638, 3.78947368414551, 1.51456310682008, 5.84686774940732, 4.58823529414907, 5.59999999993481, 5.06666666666667, 11.6470588233699, 1.99999999998209, NA, 4.46153846149851, 18, 1.05882352939726, 9.21739130425452, 27.8399999994814, …
8 normal-distribution  data-transformation  logistic  generalized-linear-model  ridge-regression  t-test  wilcoxon-signed-rank  paired-data  naive-bayes  distributions  logistic  goodness-of-fit  time-series  eviews  ecm  panel-data  reliability  psychometrics  validity  cronbachs-alpha  self-study  random-variable  expected-value  median  regression  self-study  multiple-regression  linear-model  forecasting  prediction-interval  normal-distribution  excel  bayesian  multivariate-analysis  modeling  predictive-models  canonical-correlation  rbm  time-series  machine-learning  neural-networks  fishers-exact  factorisation-theorem  svm  prediction  linear  reinforcement-learning  cdf  probability-inequalities  ecdf  time-series  kalman-filter  state-space-models  dynamic-regression  index-decomposition  sampling  stratification  cluster-sample  survey-sampling  distributions  maximum-likelihood  gamma-distribution 

2
Probleme mit der Ausreißererkennung
In einem Blogbeitrag schreibt Andrew Gelman : Die schrittweise Regression ist eines dieser Dinge, wie die Erkennung von Ausreißern und Kreisdiagramme, die bei Nicht-Statistikern beliebt zu sein scheinen, von Statistikern jedoch als Scherz angesehen werden. Ich verstehe den Verweis auf Kreisdiagramme, aber warum wird laut Gelman die Statistik der Ausreißer …

2
Das Wahlvorhersagemodell von Nate Silver
Nate Silver war in der Vergangenheit recht erfolgreich darin, die Ergebnisse von US-Wahlen vorherzusagen, was in seinem Buch The Signal and the Noise beschrieben wird . Das Buch enthält einige Beschreibungen des verwendeten Modells, und ein Blogbeitrag von ihm beschreibt das Modell, das für die Zwischenwahlen 2014 verwendet wurde. Diese …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.