Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Negentropie ableiten. Steckenbleiben
Diese Frage ist also etwas umständlich, aber ich habe sorgfältig versucht, sie so einfach wie möglich zu gestalten. Ziel: Kurz gesagt, es gibt eine Ableitung von Negentropie, die keine Kumulanten höherer Ordnung beinhaltet, und ich versuche zu verstehen, wie sie abgeleitet wurde. Hintergrund: (Ich verstehe das alles) Ich lerne selbst …

3
Standardmaß für Klumpen?
Ich habe viele Daten und möchte etwas tun, das sehr einfach zu sein scheint. In dieser großen Datenmenge interessiert mich, wie stark ein bestimmtes Element zusammenklumpt. Angenommen, meine Daten sind wie folgt geordnet: {A, C, B, D, A, Z, T, C ...}. Angenommen, ich möchte wissen, ob die A-Werte in …

5
Schätzung der Prozentsätze als abhängige Variable in der Regression
Ich habe die Rangprozentsätze der Studenten in 38 Prüfungen als abhängige Variable in meinem Studium. Ein Rangprozentsatz wird berechnet durch (Rang eines Schülers / Anzahl von Schülern in einer Prüfung). Diese abhängige Variable ist nahezu gleichmäßig verteilt, und ich möchte die Auswirkungen einiger Variablen auf die abhängige Variable abschätzen. Welchen …


2
Wie kann ich den Wert von
Die folgenden Grafiken sind Reststreudiagramme eines Regressionstests, für den die Annahmen "Normalität", "Homoskedastizität" und "Unabhängigkeit" mit Sicherheit bereits erfüllt wurden! Zum Testen der "Linearitäts" -Annahme kann zwar anhand der Diagramme vermutet werden, dass die Beziehung krummlinig ist, aber die Frage lautet: Wie kann der Wert für "R2 Linear" zum Testen …

6
Ressourcen zum Erlernen der Implementierung von Ensemble-Methoden
Ich verstehe theoretisch (sozusagen), wie sie funktionieren würden, bin mir aber nicht sicher, wie ich eine Ensemble-Methode anwenden soll (z. B. Abstimmung, gewichtete Mischungen usw.). Was sind gute Ressourcen für die Implementierung von Ensemble-Methoden? Gibt es spezielle Ressourcen für die Implementierung in Python? BEARBEITEN: Um einige anhand der Diskussion zu …

4
Ich suche eine wirkliche Illustration von Fischers Zitat über DoE
Mein Team und ich möchten den Nicht-Statistikern des Unternehmens einen Vortrag über die Nützlichkeit der Versuchsplanung halten. Diese Nicht-Statistiker sind auch unsere Kunden und konsultieren uns normalerweise nicht, bevor sie ihre Daten sammeln. Kennen Sie einige reale Beispiele, die das berühmte Zitat von Fisher gut veranschaulichen würden? "Den Statistiker nach …

2
Wie erhält man die Ergebnisse eines Tukey-HSD-Post-Hoc-Tests in einer Tabelle mit gruppierten Paaren?
Ich würde gerne einen TukeyHSD-Post-Hoc-Test nach meiner Zwei-Wege-Anova mit R durchführen und eine Tabelle mit den sortierten Paaren erhalten, die nach signifikanten Unterschieden gruppiert sind. (Entschuldigung für die Formulierung, ich bin noch neu mit Statistiken.) Ich hätte gerne so etwas: Also gruppiert mit Sternen oder Buchstaben. Irgendeine Idee? Ich habe …

2
Warum ist das Problem der Unordnung bei großen Stichproben nicht zu lösen?
Angenommen, wir haben eine Menge von Punkten y={y1,y2,…,yN}y={y1,y2,…,yN}\mathbf{y} = \{y_1, y_2, \ldots, y_N \} . Jeder Punkt wird unter Verwendung der Verteilung p ( y i | x ) = 1 erzeugtyiyiy_ip(yi|x)=12N(x,1)+12N(0,10).p(yi|x)=12N(x,1)+12N(0,10). p(y_i| x) = \frac12 \mathcal{N}(x, 1) + \frac12 \mathcal{N}(0, 10). Um posterior fürxxx, schreiben wir p(x|y)∝p(y|x)p(x)=p(x)∏i=1Np(yi|x).p(x|y)∝p(y|x)p(x)=p(x)∏i=1Np(yi|x). p(x| \mathbf{y}) …

1
Helfen Sie mir, die
Ich versuche hier ein Bayesianisches Logit der Daten durchzuführen . Ich verwende bayesglm()in dem armPaket in R. Die Codierung ist einfach genug: df = read.csv("http://dl.dropbox.com/u/1791181/bayesglm.csv", header=T) library(arm) model = bayesglm(PASS ~ SEX + HIGH, family=binomial(link="logit"), data=df) summary(model) gibt die folgende Ausgabe aus: Coefficients: Estimate Std. Error z value Pr(>|z|) (Intercept) …
13 r  bayesian  p-value 

1
Was ist der Unterschied zwischen wilcox.test und coin :: wilcox_test in R?
Diese beiden Funktionen existieren in R, aber ich kenne ihre Unterschiede nicht. Es scheint, dass sie nur dieselben p-Werte zurückgeben, wenn sie wilcox.testmit correct=FALSEund wilcox_test(im Münzpaket) mit aufrufen distribution="aymptotic". Für andere Werte geben sie andere p-Werte zurück. Gibt außerdem wilcox.testimmer W = 0 für meinen Datensatz zurück, unabhängig von den …

1
Vorhersagen unter Verwendung von glmnet in R
Ich versuche, einige Daten mit dem glmnetPaket in R zu modellieren . Nehmen wir an, ich habe die folgenden Daten training_x <- data.frame(variable1 = c(1, 2, 3, 2, 3), variable2 = c(1, 2, 3, 4, 5)) y <- c(1, 2, 3, 4, 5) (Dies ist eine Vereinfachung; meine Daten sind …
13 r  glmnet 

1
Lustige Statistikprüfungsantworten [geschlossen]
Geschlossen. Diese Frage ist nicht zum Thema . Derzeit werden keine Antworten akzeptiert. Möchten Sie diese Frage verbessern? Aktualisieren Sie die Frage so dass es beim Thema für Kreuz Validated. Geschlossen vor 7 Jahren . Das Korrigieren von Prüfungen ist wahrscheinlich die langweiligste Aufgabe eines Lehrers. Aber es könnte für …
13 teaching  humor 

4
Initialisierung von K-Means-Zentren durch zufällige Unterproben des Datensatzes?
Wenn ich einen bestimmten Datensatz habe, wie intelligent wäre es dann, Cluster-Zentren mithilfe von Zufallsstichproben dieses Datensatzes zu initialisieren? Angenommen, ich möchte 5 clusters. Ich nehme 5 random samplesvon sagen wir, size=20%des ursprünglichen Datensatzes. Könnte ich dann den Mittelwert jeder dieser 5 Zufallsstichproben als meine 5 anfänglichen Cluster-Zentren verwenden? Ich …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.