Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Überanpassung des neuronalen Netzes
Ich habe gelernt, dass eine Überanpassung erkannt werden kann, indem der Trainingsfehler und der Testfehler gegen die Epochen aufgetragen werden. Wie in: Ich habe diesen Blogpost gelesen, in dem sie sagen, dass das neuronale Netzwerk net5 überpasst und sie diese Zahl liefern: Was für mich seltsam ist, da der Validierungs- …

1
Können wir nicht zufällige Faktoren in einem mehrstufigen / hierarchischen Design als zufällig modellieren?
Die Unterscheidung zwischen streng zufälligen Variablen (die als solche modelliert werden sollten) und nicht zufälligen Variablen, von denen einige argumentieren, dass sie als zufällig modelliert werden könnten, wenn es sich um ein hierarchisches / mehrstufiges Modell handelt, ist für mich verschwommen. Bates und Bolker veranschaulichen zufällige Effekte mit Fällen echter …


1
Was ist der Unterschied zwischen "Goldstandard" und "Grundwahrheit"?
Was ist der Unterschied zwischen "Goldstandard" und "Grundwahrheit"? Die beiden Wiki-Artikel (dh Goldstandard und Grundwahrheit ) beziehen beide Konzepte in Bezug auf Modellgenauigkeit / -genauigkeit miteinander in Beziehung. Das ist eine Möglichkeit. Ich habe aber auch festgestellt, dass diese Konzepte synonym verwendet werden, wenn es um beschriftete Datensätze geht: In …

1
Anpassungsgüte für diskrete Daten: bester Ansatz
Die Daten: Für die Zwecke dieser Frage / Kommunikation können wir annehmen, dass die Daten wie rnbinom(1000,size=0.1,prob=0.01)in R aussehen , das aus einer negativen Binomialverteilung (mit size=0.1und Wahrscheinlichkeit des Erfolgs prob=0.01) eine Zufallsstichprobe von 1.000 Beobachtungen generiert . Dies ist die Parametrisierung, bei der die Zufallsvariable die Anzahl der Fehler …

1
Äquivalenz zwischen einem Anova-Modell mit wiederholten Messungen und einem gemischten Modell: lmer vs lme und zusammengesetzte Symmetrie
Ich habe einige Probleme, gleichwertige Ergebnisse zwischen einem aovModell zwischen wiederholten Messungen und einem lmergemischten Modell zu erhalten. Meine Daten und mein Skript sehen wie folgt aus data=read.csv("https://www.dropbox.com/s/zgle45tpyv5t781/fitness.csv?dl=1") data$id=factor(data$id) data id FITNESS TEST PULSE 1 1 pilates CYCLING 91 2 2 pilates CYCLING 82 3 3 pilates CYCLING 65 4 …

2
Konfidenzintervalle für den Median
Ich habe eine Verteilung von Proben mit einer kleinen Anzahl von Werten in jeder (weniger als ). Ich habe den Median für jede Stichprobe berechnet, den ich mit einem Modell vergleichen und die Differenz zwischen dem Modell und dem Median jeder Stichprobe ermitteln möchte. Um ein konsistentes Ergebnis zu erzielen, …

1
Berechnen Sie die Inzidenzraten mithilfe des Poisson-Modells: Beziehung zur Hazard Ratio aus dem Cox PH-Modell
Ich möchte Inzidenzraten berechnen, die entlang der Gefährdungsquoten dargestellt werden, um sowohl relative als auch absolute Risikomessgrößen darzustellen. Ich habe in anderen Studien gesehen, dass solche Inzidenzraten unter Verwendung von Poisson-Modellen mit Nachbeobachtungszeit im Modell als Offset berechnet werden können. Also habe ich das in R wie folgt versucht: library(survival) …

4
Passen Sie alles an, was Sie in der Neigungsbewertung haben?
Ich habe eine methodische Frage und daher ist kein Beispieldatensatz beigefügt. Ich plane eine an den Neigungsscore angepasste Cox-Regression, mit der untersucht werden soll, ob ein bestimmtes Medikament das Risiko eines Ergebnisses verringert. Die Studie ist eine Beobachtungsstudie mit 10.000 Personen. Der Datensatz enthält 60 Variablen. Ich schätze, dass 25 …

1
Sollte ich zufällige Effekte von einem Modell ausschließen, wenn sie statistisch nicht signifikant sind?
Sollte ich zufällige Effekte in ein Modell aufnehmen, auch wenn sie statistisch nicht signifikant sind? Ich habe ein experimentelles Design mit wiederholten Messungen, bei dem jeder Einzelne drei verschiedene Behandlungen in zufälliger Reihenfolge erfährt. Ich möchte die Auswirkungen von Individuum und Ordnung kontrollieren, aber keines scheint in meinen Modellen statistisch …

1
Ausreißer auf einem Streudiagramm finden
Ich habe eine Reihe von Datenpunkten, die auf einem Ort sitzen und einem Muster folgen sollen, aber es gibt einige Streupunkte vom Hauptort, die in meiner endgültigen Analyse Unsicherheit verursachen. Ich möchte einen ordentlichen Ort erhalten, um ihn später für meine Analyse anzuwenden. Die blauen Punkte sind mehr oder weniger …

1
Welche Interpretation haben die Parameter eines verallgemeinerten linearen Modells mit Effektcodierung?
library(lme4) out <- glmer(cbind(incidence, size - incidence) ~ period + (1 | herd), data = cbpp, family = binomial, contrasts = list(period = "contr.sum")) summary(out) Fixed effects: Estimate Std. Error z value Pr(>|z|) (Intercept) -2.32337 0.22129 -10.499 < 2e-16 *** period1 0.92498 0.18330 5.046 4.51e-07 *** period2 -0.06698 0.22845 -0.293 …

2
Wie werden CP-Werte (Cost Complexity) in RPART (oder Entscheidungsbäumen im Allgemeinen) berechnet?
rpartSoweit ich weiß, hilft das Argument cp für die Funktion dabei, den Baum auf die gleiche Weise wie die Argumente minsplit oder minbucket vorab zu bereinigen. Was ich nicht verstehe, ist, wie CP-Werte berechnet werden. Zum Beispiel df<-data.frame(x=c(1,2,3,3,3,4), y=as.factor(c(TRUE, TRUE, FALSE, TRUE, FALSE, FALSE)), method="class") mytree<-rpart(y ~ x, data = …
9 r  cart  rpart 

1
Vergleichen von Residuen zwischen OLS- und Nicht-OLS-Regressionen
Angenommen, Sie möchten ein lineares Modell schätzen: ( Beobachtungen der Antwort und Prädiktoren) nnnp+1p+1p+1E ( yich) = β0+ ∑j = 1pβjxi jE.(yich)=β0+∑j=1pβjxichj\mathbb{E}(y_i) = \beta_0 + \sum_{j=1}^p \beta_j x_{ij} Eine Möglichkeit, dies zu tun, ist die OLS-Lösung, dh wählen Sie die Koeffizienten so, dass die Summe der quadratischen Fehler minimal ist: …

1
Berechnen Sie die beobachtete Inflation und die erwarteten p-Werte aus der gleichmäßigen Verteilung im QQ-Diagramm
Ich versuche, den Inflationsgrad zu quantifizieren (dh wie die beobachteten Datenpunkte am besten zu den Erwartungen passen). Eine Möglichkeit ist, sich das QQ-Diagramm anzusehen. Aber ich möchte einen numerischen Indikator für die Inflation berechnen - bedeutet, wie gut das Beobachtete zur theoretischen Gleichverteilung passt. Beispieldaten: # random uniform distribution pvalue …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.