Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


1
Warum muss der EM-Algorithmus iterativ sein?
Angenommen, Sie haben eine Population mit Einheiten mit jeweils einer Zufallsvariablen . Sie beobachten Werte für jede Einheit, für die . Wir wollen eine Schätzung von .NNNXi∼Poisson(λ)Xi∼Poisson(λ)X_i \sim \text{Poisson}(\lambda)n=N−n0n=N−n0n = N-n_0Xi>0Xi>0X_i > 0λλ\lambda Es gibt Methoden für Momente und bedingte Möglichkeiten mit maximaler Wahrscheinlichkeit, um die Antwort zu erhalten, aber …


2
Geschichte: Die Rolle der Statistik in der Astronomie
Ich habe kürzlich mutig vor einer Gruppe ziemlich kluger Schüler der achten Klasse behauptet, dass die Astronomie einen großen Beitrag zu den Grundlagen der Statistik geleistet habe und viele statistische Konzepte für die Verwendung in der Astronomie erfunden wurden. Als ich das belegen wollte, war ich ziemlich enttäuscht. Fehler, der …


1
Additive vs Multiplikative Zerlegung
Meine Frage ist wirklich einfach, aber das sind diejenigen, die mich wirklich beschäftigen :) Ich weiß nicht wirklich, wie ich beurteilen soll, ob eine bestimmte Zeitreihe mit einer additiven oder einer multiplikativen Zerlegungsmethode zerlegt werden soll. Ich weiß, dass es visuelle Hinweise gibt, wie man sie voneinander unterscheidet, aber ich …

2
Schätzung der angepassten Risikoverhältnisse in binären Daten unter Verwendung der Poisson-Regression
Ich bin daran interessiert, ein angepasstes Risikoverhältnis zu schätzen, analog dazu, wie man ein angepasstes Quotenverhältnis unter Verwendung der logistischen Regression schätzt. Einige Literaturstellen (z. B. diese ) weisen darauf hin, dass die Verwendung der Poisson-Regression mit Huber-White-Standardfehlern eine modellbasierte Methode ist, um dies zu erreichen Ich habe keine Literatur …

2
Warum ist eine Pearson-Rangkorrelation trotz Normalitätsannahme gültig?
Ich lese gerade über Annahmen für Pearson-Korrelationen. Eine wichtige Annahme für den folgenden t-Test scheint zu sein, dass beide Variablen aus Normalverteilungen stammen; Wenn dies nicht der Fall ist, wird die Verwendung alternativer Maßnahmen wie des Spearman Rho empfohlen. Die Spearman-Korrelation wird wie die Pearson-Korrelation berechnet, wobei nur die Ränge …


1
Überabtastung mit kategorialen Variablen
Ich möchte eine Kombination aus Über- und Unterabtastung durchführen, um meinen Datensatz mit ungefähr 4000 Kunden in zwei Gruppen auszugleichen, wobei eine der Gruppen einen Anteil von ungefähr 15% hat. Ich habe mir SMOTE ( http://www.inside-r.org/packages/cran/DMwR/docs/SMOTE ) und ROSE ( http://cran.r-project.org/web/packages/ROSE/) angesehen. ROSE.pdf ), aber beide erzeugen neue synthetische Proben …

3
K-fache oder Hold-out-Kreuzvalidierung für die Gratregression mit R.
Ich arbeite an einer Kreuzvalidierung der Vorhersage meiner Daten mit 200 Probanden und 1000 Variablen. Ich bin an einer Ridge-Regression interessiert, da die Anzahl der Variablen (die ich verwenden möchte) größer ist als die Anzahl der Stichproben. Ich möchte also Schrumpfungsschätzer verwenden. Die folgenden Beispieldaten bestehen aus: #random population of …

1
Welche Beziehung besteht zwischen Skalenzuverlässigkeitsmessungen (Cronbachs Alpha usw.) und Komponenten- / Faktorladungen?
Angenommen, ich habe einen Datensatz mit Bewertungen für eine Reihe von Fragebogenelementen, die theoretisch aus einer kleineren Anzahl von Skalen bestehen, wie in der Psychologieforschung. Ich weiß, dass ein gängiger Ansatz darin besteht, die Zuverlässigkeit der Skalen mit Cronbachs Alpha oder ähnlichem zu überprüfen, dann die Elemente in den Skalen …

1
Anova Typ III Test für ein GLMM
Ich passe ein glmerModell in das lme4R-Paket. Ich suche nach einer Anova-Tabelle mit dem darin gezeigten p-Wert, kann aber kein passendes Paket finden. Ist es möglich, es in R zu tun? Das Modell, das ich anpasse, hat folgende Form: model1<-glmer(dmn~period*teethTreated+(1|fullName), family="poisson", data=subset(dataset, group=='Four times a year'), control=glmerControl(optimizer="bobyqa"))

2
Wie finde ich optimale Werte für die Abstimmungsparameter beim Boosten von Bäumen?
Mir ist klar, dass das Boosting-Tree-Modell 3 Tuning-Parameter enthält, d. H. die Anzahl der Bäume (Anzahl der Iterationen) Schrumpfungsparameter Anzahl der Teilungen (Größe der einzelnen Bäume) Meine Frage ist: Wie soll ich für jeden der Abstimmungsparameter den optimalen Wert finden? Und welche Methode? Beachten Sie Folgendes: Der Parameter für die …

1
Macht in der Proteomik?
Zuschüsse erfordern häufig eine Leistungsanalyse, um eine vorgeschlagene Stichprobengröße zu unterstützen. In der Proteomik (und den meisten -omics) gibt es 100 bis 1000 Merkmale / Variablen, die über 10 Proben gemessen werden (vielleicht 100, aber unwahrscheinlich). Es ist auch bekannt, dass einige dieser Maßeinheiten (z. B. Spektralzahlen von Proteinen) nicht …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.