Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


3
Sollte die Funktionsauswahl nur für Trainingsdaten (oder alle Daten) durchgeführt werden?
Sollte die Merkmalsauswahl nur für Trainingsdaten (oder alle Daten) durchgeführt werden? Ich habe einige Diskussionen und Artikel wie Guyon (2003) und Singhi und Liu (2006) durchgearbeitet, bin mir aber immer noch nicht sicher, ob ich die richtige Antwort finden soll. Mein Versuchsaufbau ist wie folgt: Datensatz: 50 gesunde Kontrollpersonen und …

4
Konvergenz der Gewichte neuronaler Netze
Ich kam zu einer Situation, in der die Gewichte meines neuronalen Netzwerks auch nach 500 Iterationen nicht konvergieren. Mein neuronales Netzwerk enthält 1 Eingangsschicht, 1 versteckte Schicht und 1 Ausgangsschicht. Sie sind ungefähr 230 Knoten in der Eingabeebene, 9 Knoten in der verborgenen Ebene und 1 Ausgabeknoten in der Ausgabeschicht. …


1
Vergleich der Verteilungen der Generalisierungsleistung
Angenommen, ich habe zwei Lernmethoden für ein Klassifizierungsproblem , und , und ich schätze ihre Generalisierungsleistung mit etwas wie wiederholter Kreuzvalidierung oder Bootstrapping. Durch diesen Prozess erhalte ich eine Verteilung der Bewertungen und für jede Methode über diese Wiederholungen (z. B. die Verteilung der ROC-AUC-Werte für jedes Modell).AAABBB PAPAP_APBPBP_B Wenn …

1
p-Wert-Anpassung für die I-Statistik von Local Moran (LISA)
Ich arbeite mit einer explorativen räumlichen Analyse in R unter Verwendung des spdep-Pakets. Ich stieß auf eine Option zum Anpassen der p- Werte lokaler Indikatoren der räumlichen Assoziation (LISA), die mithilfe der localmoranFunktion berechnet wurden . Laut den Dokumenten richtet es sich an: ... Wahrscheinlichkeitswertanpassung für mehrere Tests. Weiter in …


3
Was sind die statistischen Gründe für die Definition des BMI-Index als Gewicht / Größe ?
Vielleicht hat diese Frage in der Medizin eine Antwort, aber gibt es statistische Gründe, warum der BMI-Index als berechnet wird ? Warum nicht zum Beispiel nur ? Meine erste Idee ist, dass es etwas mit quadratischer Regression zu tun hat. Gewicht / GrößeGewicht / Größe2weight/height2\text{weight}/\text{height}^2Gewicht / Größeweight/height\text{weight}/\text{height} Stichprobe realer Daten …


1
Schätzen logistischer Regressionskoeffizienten in einem Fall-Kontroll-Design, wenn die Ergebnisvariable nicht Fall- / Kontrollstatus ist
Betrachten Sie die Stichprobendaten einer Population der Größe folgendermaßen: FürNNNk=1,...,Nk=1,...,Nk=1, ..., N Beobachten Sie den Krankheitsstatus des einzelnenkkk Wenn sie an der Krankheit leiden, nehmen Sie sie mit der Wahrscheinlichkeit in die Stichprobe auf.pk1pk1p_{k1} Wenn sie die Krankheit nicht haben, schließen Sie sie mit der Wahrscheinlichkeit .pk0pk0p_{k0} Angenommen, Sie haben …

1
Untersuchung der Robustheit der logistischen Regression gegen die Verletzung der Linearität des Logits
Ich führe eine logistische Regression mit einem binären Ergebnis durch (Start und nicht Start). Mein Prädiktormix besteht entweder aus kontinuierlichen oder dichotomen Variablen. Bei Verwendung des Box-Tidwell-Ansatzes verstößt einer meiner kontinuierlichen Prädiktoren möglicherweise gegen die Annahme der Linearität des Logits. Aus den Statistiken zur Anpassungsgüte geht nicht hervor, dass die …

3
Vorhersage der Dichtefunktion
Ich recherchiere über die Vorhersage von Zeitreihen von Wahrscheinlichkeitsdichtefunktionen. Wir sind bestrebt, ein PDF anhand eines historisch beobachteten (normalerweise geschätzten) PDF vorherzusagen. Die Prognosemethode, die wir entwickeln, funktioniert in Simulationsstudien ziemlich gut. Ich benötige jedoch ein numerisches Beispiel aus realen Anwendungen, um unsere Methode weiter zu veranschaulichen. Gibt es also …

3
So erhalten Sie das Konfidenzintervall für die Änderung des Populations-R-Quadrats
Als einfaches Beispiel wird angenommen, dass es zwei lineare Regressionsmodelle gibt Modell 1 hat drei Prädiktoren x1a, x2bundx2c Modell 2 hat drei Prädiktoren aus Modell 1 und zwei zusätzliche Prädiktoren x2aundx2b Es gibt eine Populationsregressionsgleichung, bei der die erklärte Populationsvarianz für Modell 1 für Modell 2 . Die durch Modell …

1
Verallgemeinerte kleinste Quadrate: von Regressionskoeffizienten zu Korrelationskoeffizienten?
Für kleinste Quadrate mit einem Prädiktor: y=βx+ϵy=βx+ϵy = \beta x + \epsilon Wenn und vor dem Anpassen standardisiert sind (dh ), dann:xxxyyy∼N(0,1)∼N(0,1)\sim N(0,1) ββ\beta ist der gleiche wie der Pearson-Korrelationskoeffizient .rrr ββ\beta ist in der reflektierten Regression dasselbe:x=βy+ϵx=βy+ϵx = \beta y + \epsilon Gilt das auch für generalisierte kleinste Quadrate …

1
Wie baue ich einen innovativen Ausreißer bei Beobachtung 48 in mein ARIMA-Modell ein?
Ich arbeite an einem Datensatz. Nachdem ich einige Modellidentifikationstechniken angewendet hatte, kam ich mit einem ARIMA (0,2,1) -Modell heraus. Ich habe die detectIOFunktion im Paket TSAin R verwendet, um bei der 48. Beobachtung meines ursprünglichen Datensatzes einen innovativen Ausreißer (IO) zu erkennen . Wie kann ich diesen Ausreißer in mein …
10 r  time-series  arima  outliers  hypergeometric  fishers-exact  r  time-series  intraclass-correlation  r  logistic  glmm  clogit  mixed-model  spss  repeated-measures  ancova  machine-learning  python  scikit-learn  distributions  data-transformation  stochastic-processes  web  standard-deviation  r  machine-learning  spatial  similarities  spatio-temporal  binomial  sparse  poisson-process  r  regression  nonparametric  r  regression  logistic  simulation  power-analysis  r  svm  random-forest  anova  repeated-measures  manova  regression  statistical-significance  cross-validation  group-differences  model-comparison  r  spatial  model-evaluation  parallel-computing  generalized-least-squares  r  stata  fitting  mixture  hypothesis-testing  categorical-data  hypothesis-testing  anova  statistical-significance  repeated-measures  likert  wilcoxon-mann-whitney  boxplot  statistical-significance  confidence-interval  forecasting  prediction-interval  regression  categorical-data  stata  least-squares  experiment-design  skewness  reliability  cronbachs-alpha  r  regression  splines  maximum-likelihood  modeling  likelihood-ratio  profile-likelihood  nested-models 

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.