Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


2
Was ist das lme4 :: lmer-Äquivalent einer Drei-Wege-ANOVA mit wiederholten Messungen?
Meine Frage basiert auf dieser Antwort, die zeigte, welches lme4::lmerModell einer Zwei-Wege-ANOVA mit wiederholten Messungen entspricht: require(lme4) set.seed(1234) d <- data.frame( y = rnorm(96), subject = factor(rep(1:12, 4)), a = factor(rep(1:2, each=24)), b = factor(rep(rep(1:2, each=12))), c = factor(rep(rep(1:2, each=48)))) # standard two-way repeated measures ANOVA: summary(aov(y~a*b+Error(subject/(a*b)), d[d$c == "1",])) …

1
Bayesianische Modellierung unter Verwendung multivariater Normalen mit Kovariaten
Angenommen, Sie haben eine erklärende Variable X=(X(s1),…,X(sn))X=(X(s1),…,X(sn)){\bf{X}} = \left(X(s_{1}),\ldots,X(s_{n})\right) wobei eine bestimmte Koordinate darstellt. Sie haben auch eine Antwortvariable . Jetzt können wir beide Variablen wie folgt kombinieren:sssY=(Y(s1),…,Y(sn))Y=(Y(s1),…,Y(sn)){\bf{Y}} = \left(Y(s_{1}),\ldots,Y(s_{n})\right) W(s)=(X(s)Y(s))∼N(μ(s),T)W(s)=(X(s)Y(s))∼N(μ(s),T){\bf{W}}({\bf{s}}) = \left( \begin{array}{ccc}X(s) \\ Y(s) \end{array} \right) \sim N(\boldsymbol{\mu}(s), T) In diesem Fall wählen wir einfach und ist eine …

1
Wann müssen p-Werte in mehreren Vergleichen korrigiert werden?
Ich befürchte, dass verwandte Fragen meine nicht beantwortet haben. Wir bewerten die Leistungen von> 2 Klassifikatoren (maschinelles Lernen). Unsere Nullhypothese lautet, dass sich die Leistungen nicht unterscheiden. Wir führen parametrische (ANOVA) und nicht parametrische (Friedman) Tests durch, um diese Hypothese zu bewerten. Wenn sie signifikant sind, möchten wir herausfinden, welche …

2
Erwartung eines quadratischen Gammas
Wenn eine Gammaverteilung mit und β parametrisiert ist , dann:αα\alphaββ\beta E(Γ(α,β))=αβE(Γ(α,β))=αβ E(\Gamma(\alpha, \beta)) = \frac{\alpha}{\beta} Ich möchte die Erwartung eines quadratischen Gammas berechnen, das heißt: E(Γ(α,β)2)=?E(Γ(α,β)2)=? E(\Gamma(\alpha, \beta)^2) = ? Ich denke es ist: E(Γ(α,β)2)=(αβ)2+αβ2E(Γ(α,β)2)=(αβ)2+αβ2 E(\Gamma(\alpha, \beta)^2) = \left(\frac{\alpha}{\beta}\right)^2 + \frac{\alpha}{\beta^2} Weiß jemand, ob dieser letztere Ausdruck richtig ist?

1
Ist Bootstrapping für diese fortlaufenden Daten geeignet?
Ich bin ein absoluter Neuling :) Ich mache eine Studie mit einer Stichprobengröße von 10.000 aus einer Bevölkerung von etwa 745.000. Jede Stichprobe repräsentiert eine "prozentuale Ähnlichkeit". Die große Mehrheit der Proben liegt zwischen 97% und 98%, einige jedoch zwischen 60% und 90%, dh die Verteilung ist stark negativ verzerrt. …



3
GLM mit fortlaufenden Daten, die auf Null gestapelt sind
Ich versuche, ein Modell zu erstellen, um abzuschätzen, wie gut sich katastrophale Krankheiten wie TB, AIDS usw. auf die Ausgaben für Krankenhausaufenthalte auswirken. Ich habe "Kosten pro Krankenhausaufenthalt" als abhängige Variable und verschiedene individuelle Marker als unabhängige Variablen, von denen fast alle Dummy-Werte wie Geschlecht, Status des Haushaltsvorstands, Armutsstatus und …

2
Wie kann die relative Variablenbedeutung bei der logistischen Regression in Bezug auf p quantifiziert werden?
Angenommen, ein logistisches Regressionsmodell wird verwendet, um vorherzusagen, ob ein Online-Käufer ein Produkt kaufen wird (Ergebnis: Kauf), nachdem er auf eine Reihe von Online-Anzeigen geklickt hat (Prädiktoren: Ad1, Ad2 und Ad3). Das Ergebnis ist eine binäre Variable: 1 (gekauft) oder 0 (nicht gekauft). Die Prädiktoren sind auch binäre Variablen: 1 …

1
Modellauswahl beim Offline- oder Online-Lernen
Ich habe in letzter Zeit versucht, mehr über Online-Lernen zu lernen (es ist absolut faszinierend!), Und ein Thema, das ich nicht richtig verstehen konnte, ist, wie man über Modellauswahl in Offline- oder Online-Kontexten nachdenkt. Insbesondere nehmen wir trainieren ein Klassifikator offline, basierend auf einer festen Datensatz D . Wir schätzen …


1
Robuste Schätzung der Kurtosis?
Ich verwende den üblichen Schätzer für Kurtosis, , aber ich bemerke, dass selbst kleine Ausreißer in meiner empirischen Verteilung , dh kleine Spitzen weit vom Zentrum entfernt, beeinflussen es enorm. Gibt es einen Kurtosis-Schätzer, der robuster ist?K.^= μ^4σ^4K.^=μ^4σ^4\hat{K}=\frac{\hat{\mu}_4}{\hat{\sigma}^4}

1
Was ist der Unterschied zwischen „Ladungen“ und „Korrelationsladungen“ in PCA und PLS?
Bei der Hauptkomponentenanalyse (PCA) müssen häufig zwei Ladungen gegeneinander aufgetragen werden, um die Beziehungen zwischen den Variablen zu untersuchen. In dem dem PLS R-Paket beiliegenden Dokument zur Durchführung der Hauptkomponentenregression und der PLS-Regression gibt es ein anderes Diagramm, das als Korrelationsladungsdiagramm bezeichnet wird (siehe Abbildung 7 und Seite 15 im …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.