Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

4
So zeichnen Sie 20 Jahre tägliche Daten in Zeitreihen auf
Ich habe den folgenden Datensatz: https://dl.dropbox.com/u/22681355/ORACLE.csv und möchte die täglichen Änderungen in "Öffnen" nach "Datum" darstellen, also habe ich Folgendes getan: oracle <- read.csv(file="http://dl.dropbox.com/u/22681355/ORACLE.csv", header=TRUE) plot(oracle$Date, oracle$Open, type="l") und ich bekomme folgendes: Dies ist offensichtlich nicht die schönste Darstellung aller Zeiten. Ich frage mich also, welche Methode für die Darstellung …

3
Konfidenzintervalle gegen Stichprobengröße?
Ich bin völlig neu in Statistiken und im Bereich der Konfidenzintervalle. Das könnte also sehr trivial sein oder sogar dumm klingen. Ich würde mich freuen, wenn Sie mir helfen könnten, Literatur / Text / Blog zu verstehen oder darauf hinzuweisen, die dies besser erklären. Ich sehe auf verschiedenen Nachrichtenseiten wie …

1
Häufige statistische Referenzen für jemanden, der sich mit moderner Wahrscheinlichkeitstheorie auskennt
Ausgehend von einem strengen Hintergrund in der Analyse und der modernen Wahrscheinlichkeitstheorie finde ich die Bayes'sche Statistik einfach und leicht zu verstehen, und die frequentistische Statistik ist unglaublich verwirrend und nicht intuitiv. Es scheint, dass Frequentisten wirklich Bayes'sche Statistiken machen, außer mit "geheimen Priors", die nicht gut motiviert oder sorgfältig …

3
Inzidenzraten vergleichen
Ich möchte die Inzidenzraten zwischen zwei Gruppen vergleichen (eine ohne Krankheit und eine mit). Ich hatte vor, das Inzidenzratenverhältnis (IRR), dh die Inzidenzratengruppe B / Inzidenzratengruppe A, zu berechnen und dann zu testen, ob diese Rate gleich 1 ist, und schließlich 95% CI-Intervalle für die IRR zu berechnen. Ich habe …

2
Problemberechnung, Interpretation von Regsubsets und allgemeine Fragen zum Modellauswahlverfahren
Ich möchte Modelle mit auswählen regsubsets(). Ich habe einen Datenrahmen namens olympiadaten (hochgeladene Daten: http://www.sendspace.com/file/8e27d0 ). Ich hänge zuerst diesen Datenrahmen an und beginne dann mit der Analyse. Mein Code lautet: attach(olympiadaten) library(leaps) a<-regsubsets(Gesamt ~ CommunistSocialist + CountrySize + GNI + Lifeexp + Schoolyears + ExpMilitary + Mortality + PopPoverty …

2
Ermittlung des größten Beitrags in einer Gruppe
Ich weiß nicht viel über Statistiken, also nimm sie mit. Nehmen wir an, ich habe 1000 Arbeiter. Ich möchte herausfinden, wer der härteste Arbeiter ist, aber ich kann nur den Arbeitsaufwand messen, der in Gruppen von 1 bis 100 Personen über eine Arbeitsstunde erledigt wird. Angenommen, jeder Arbeiter erledigt immer …

1
Fehlerverteilung für lineare und logistische Regression
Bei kontinuierlichen Daten nimmt eine lineare Regression an, dass der Fehlerterm N (0, ) verteilt ist.σ 2Y.= β1+ β2X.2+ uY=β1+β2X2+uY=\beta_1+\beta_2X_2+uσ2σ2\sigma^2 1) Nehmen wir an, dass Var (Y | x) ebenfalls ~ N (0, ) ist?σ2σ2\sigma^2 2) Wie ist diese Fehlerverteilung bei der logistischen Regression? Wenn die Daten in Form von …

1
Konfidenz- und Vorhersageintervalle des linearen Regressionsmodells
Okay, ich versuche die lineare Regression zu verstehen. Ich habe einen Datensatz und alles sieht ganz gut aus, aber ich bin verwirrt. Dies ist meine lineare Modellzusammenfassung: Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) 0.2068621 0.0247002 8.375 4.13e-09 *** temp 0.0031074 0.0004779 6.502 4.79e-07 *** --- Signif. codes: 0 …
9 r  regression 


3
Zufällige Zuordnung: Warum sich die Mühe machen?
Eine zufällige Zuordnung ist wertvoll, da sie die Unabhängigkeit der Behandlung von potenziellen Ergebnissen gewährleistet. Auf diese Weise führt dies zu unvoreingenommenen Schätzungen des durchschnittlichen Behandlungseffekts. Andere Zuweisungsschemata können jedoch auch systematisch die Unabhängigkeit der Behandlung von potenziellen Ergebnissen sicherstellen. Warum brauchen wir also eine zufällige Zuordnung? Anders ausgedrückt, was …

1
Steuern der Rate falscher Entdeckungen in Stufen
Ich habe eine dreidimensionale Tabelle der Größe . Jede Zelle der Tabelle ist ein Hypothesentest. Das Schneiden der Tabelle in der dritten Dimension erzeugt Sätze von Hypothesentests, die zwischen Sätzen unabhängig, aber innerhalb von Sätzen abhängig sind. Ursprünglich dachte ich, ich könnte die Rate falscher Entdeckungen mit dem Benjamini-Hochberg-Verfahren bei …

3
Wie verwende ich R gbm mit Distribution = "adaboost"?
Die Dokumentation besagt, dass R gbm mit Distribution = "adaboost" für das 0-1-Klassifizierungsproblem verwendet werden kann. Betrachten Sie das folgende Codefragment: gbm_algorithm <- gbm(y ~ ., data = train_dataset, distribution = "adaboost", n.trees = 5000) gbm_predicted <- predict(gbm_algorithm, test_dataset, n.trees = 5000) Es kann in der Dokumentation gefunden werden, die.ggm …
9 r  gbm 

2
Warum ist das Ausmaß der Varianz, das von meinem 1. PC erklärt wird, so nahe an der durchschnittlichen paarweisen Korrelation?
Welche Beziehung besteht zwischen der ersten Hauptkomponente (n) und der durchschnittlichen Korrelation in der Korrelationsmatrix? Zum Beispiel beobachte ich in einer empirischen Anwendung, dass die durchschnittliche Korrelation fast gleich dem Verhältnis der Varianz der ersten Hauptkomponente (erster Eigenwert) zur Gesamtvarianz (Summe aller Eigenwerte) ist. Gibt es eine mathematische Beziehung? Unten …


1
Wie kann man beobachtete mit erwarteten Ereignissen vergleichen?
Angenommen, ich habe eine Stichprobe von Häufigkeiten von 4 möglichen Ereignissen: Event1 - 5 E2 - 1 E3 - 0 E4 - 12 und ich habe die erwarteten Wahrscheinlichkeiten, dass meine Ereignisse eintreten: p1 - 0.2 p2 - 0.1 p3 - 0.1 p4 - 0.6 Mit der Summe der beobachteten …
9 r  statistical-significance  chi-squared  multivariate-analysis  exponential  joint-distribution  statistical-significance  self-study  standard-deviation  probability  normal-distribution  spss  interpretation  assumptions  cox-model  reporting  cox-model  statistical-significance  reliability  method-comparison  classification  boosting  ensemble  adaboost  confidence-interval  cross-validation  prediction  prediction-interval  regression  machine-learning  svm  regularization  regression  sampling  survey  probit  matlab  feature-selection  information-theory  mutual-information  time-series  forecasting  simulation  classification  boosting  ensemble  adaboost  normal-distribution  multivariate-analysis  covariance  gini  clustering  text-mining  distance-functions  information-retrieval  similarities  regression  logistic  stata  group-differences  r  anova  confidence-interval  repeated-measures  r  logistic  lme4-nlme  inference  fiducial  kalman-filter  classification  discriminant-analysis  linear-algebra  computing  statistical-significance  time-series  panel-data  missing-data  uncertainty  probability  multivariate-analysis  r  classification  spss  k-means  discriminant-analysis  poisson-distribution  average  r  random-forest  importance  probability  conditional-probability  distributions  standard-deviation  time-series  machine-learning  online  forecasting  r  pca  dataset  data-visualization  bayes  distributions  mathematical-statistics  degrees-of-freedom 

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.