Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


2
Was passiert, wenn ich eine quadratische Variable in meine Regression einbeziehe?
Ich beginne mit meiner OLS-Regression: wobei D eine Dummy-Variable ist und die Schätzungen sich von Null mit einem niedrigen p-Wert unterscheiden. Ich führe dann einen Ramsey-RESET-Test durch und stelle fest, dass ich eine falsche Schreibweise der Gleichung habe. Ich beziehe also das Quadrat x ein: y=β0+β1x1+β2D+εy=β0+β1x1+β2D+ε y = \beta _0 …

3
Wie interpretiere ich den Intercept-Term in einem GLM?
Ich verwende R und habe meine Daten mit GLM mit Binomial Link analysiert. Ich möchte wissen, was die Bedeutung des Abschnitts in der Ausgabetabelle ist. Der Achsenabschnitt für eines meiner Modelle unterscheidet sich erheblich, die Variable jedoch nicht. Was bedeutet das? Was ist der Schnittpunkt? Ich weiß nicht, ob ich …



4
Statistische Intuition / Datensinn
Ich studiere im zweiten Studienjahr Mathematik und habe mit einem meiner Professoren viel über den Unterschied zwischen mathematischen und statistischen Fähigkeiten gesprochen. Einer der Hauptunterschiede, den er ansprach, war "Datensinn", den er als Kombination von technischen Fähigkeiten erklärte, während er innerhalb einer Reihe von, wie ich informell nenne, "gesunden Menschenverstand" …

4
Wie ist die Verteilung des abgerundeten Durchschnitts der Poisson-Zufallsvariablen?
Wenn ich Zufallsvariablen X1,X2,…,XnX1,X2,…,XnX_1,X_2,\ldots,X_n , die Poisson-verteilt sind mit den Parametern λ1,λ2,…,λnλ1,λ2,…,λn\lambda_1, \lambda_2,\ldots, \lambda_n , wie lautet die Verteilung von Y=⌊∑ni=1Xin⌋Y=⌊∑i=1nXin⌋Y=\left\lfloor\frac{\sum_{i=1}^n X_i}{n}\right\rfloor(dh der ganzzahlige Boden des Durchschnitts)? Eine Summe von Poisson ist auch Poisson, aber ich bin in der Statistik nicht sicher genug, um zu bestimmen, ob es für den …

2
Darstellen von Konfidenzintervallen für die vorhergesagten Wahrscheinlichkeiten aus einer logistischen Regression
Ok, ich habe eine logistische Regression und habe die predict()Funktion verwendet, um eine Wahrscheinlichkeitskurve basierend auf meinen Schätzungen zu entwickeln. ## LOGIT MODEL: library(car) mod1 = glm(factor(won) ~ as.numeric(bid), data=mydat, family=binomial(link="logit")) ## PROBABILITY CURVE: all.x <- expand.grid(won=unique(won), bid=unique(bid)) y.hat.new <- predict(mod1, newdata=all.x, type="response") plot(bid<-000:1000,predict(mod1,newdata=data.frame(bid<-c(000:1000)),type="response"), lwd=5, col="blue", type="l") Das ist großartig, …

1
Wozu dient die von qqline () in R erzeugte Zeile?
Die qqnorm()R-Funktion erzeugt einen normalen QQ-Plot und qqline()fügt eine Linie hinzu, die durch das erste und dritte Quartil verläuft. Was ist der Ursprung dieser Linie? Ist es hilfreich, die Normalität zu überprüfen? Dies ist keine klassische Linie (die Diagonale möglicherweise nach linearer Skalierung).y= xy=xy=x Hier ist ein Beispiel. Zuerst vergleiche …

3
Kann der MIC-Algorithmus zur Erkennung nichtlinearer Korrelationen intuitiv erklärt werden?
Kürzlich habe ich zwei Artikel gelesen. Erstens geht es um die Geschichte der Korrelation und zweitens um die neue Methode mit dem Namen Maximal Information Coefficient (MIC). Ich benötige Ihre Hilfe zum Verständnis der MIC-Methode zur Schätzung nichtlinearer Korrelationen zwischen Variablen. Eine Anleitung zur Verwendung in R finden Sie außerdem …

2
Paired T-Test als Spezialfall der linearen Mixed-Effect-Modellierung
Wir wissen, dass ein gepaarter t- Test nur ein Sonderfall von Einweg-ANOVA mit wiederholten Messungen (oder innerhalb des Subjekts) sowie eines linearen Mischeffektmodells ist, das mit der Funktion lme () des nlme-Pakets in R demonstriert werden kann Wie nachfolgend dargestellt. #response data from 10 subjects under two conditions x1<-rnorm(10) x2<-1+rnorm(10) …

3
Wann sollte man multiple Regression mit Dummy-Codierung gegen ANCOVA verwenden?
Ich habe kürzlich ein Experiment analysiert, das mit ANCOVA 2 kategoriale Variablen und eine kontinuierliche Variable manipuliert hat. Ein Gutachter schlug jedoch vor, dass die multiple Regression mit der als Dummy-Variablen codierten kategorialen Variablen ein geeigneterer Test für Experimente mit sowohl kategorialen als auch kontinuierlichen Variablen ist. Wann ist es …

2
Die Reihenfolge der Variablen in ANOVA ist wichtig, nicht wahr?
Ist es richtig zu verstehen, dass die Reihenfolge, in der Variablen in einer multifaktoriellen ANOVA angegeben werden, einen Unterschied macht, aber dass die Reihenfolge bei einer multiplen linearen Regression keine Rolle spielt? Nehmen wir also ein Ergebnis wie den gemessenen Blutverlust y und zwei kategoriale Variablen an Adenoidektomie-Methode a , …



Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.