Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Schuette-Nesbitt-Formel
Ich habe den Artikel über die Schuette-Nesbitt-Formel gelesen , die als "Verallgemeinerung des Einschluss-Ausschluss-Prinzips" beschrieben wird und sowohl eine kombinatorische als auch eine probabilistische Version hat. Eine andere Website gab einen Beweis für abhängige Ereignisse (pdf-Download) und fand einen dritten, der ihn mit Warings Theorem (pdf) vergleicht. Ich bin jedoch …

1
Was sind heiße Forschungsthemen für Doktorarbeiten in Biostatistik?
Ich habe darüber nachgedacht, Forschungsthemen für die Doktorarbeit in Biostatistik auszuwählen. Ich möchte einige heiße Forschungsthemen der letzten Jahre kennenlernen. Soweit ich weiß, sind einige heiße Forschungsthemen: Hochdimensionale Datenanalyse; kausale Folgerung in Experimenten und Beobachtungsstudien; Propensity Score Matching; Bayesianische Statistik. Zeitfolgen; Modellauswahl; Überlebensdatenanalyse; Meine Fragen sind: Gibt es gute Literaturübersichten, …

1
Fehlerbegriffe vs Innovationen
Mir ist aufgefallen, dass wir die Fehlerbegriffe manchmal "Innovationen" nennen. Ich verstehe nicht, ob dies in besonderen Situationen der Fall ist oder ob diese Begriffe für einander verwendet werden können. Eine andere Frage lautet: "Warum nennen wir Fehlerbegriffe" Innovationen "? Danke


2
Verzerrte Verteilungen für logistische Regression
Ich habe ein logistisches Regressionsmodell entwickelt, das auf retrospektiven Daten aus einer nationalen Trauma-Datenbank für Kopfverletzungen in Großbritannien basiert. Das Hauptergebnis ist die 30-Tage-Mortalität (als Outcome30Maß angegeben). Weitere Maßnahmen in der gesamten Datenbank mit veröffentlichten Hinweisen auf signifikante Auswirkungen auf das Ergebnis in früheren Studien sind: Yeardecimal - Date of …


1
Lineare Unabhängigkeit vs. statistische Unabhängigkeit (PCA und ICA)
Ich lese dieses interessante Papier über die Anwendung von ICA auf Genexpressionsdaten. Die Autoren schreiben: [T] Hier ist es nicht erforderlich, dass PCA-Komponenten statistisch unabhängig sind. Das stimmt, aber die PCs sind orthogonal, nicht wahr? Ich bin ein bisschen verschwommen, was die Beziehung zwischen statistischer Unabhängigkeit und Orthogonalität oder linearer …
8 pca  independence  ica 

1
Ist ein Up- oder Down-Sampling von unausgeglichenen Daten tatsächlich so effektiv? Warum?
Ich höre häufig Up- oder Down-Sampling von Daten, die als Mittel zur Behandlung der Klassifizierung unausgeglichener Daten diskutiert werden. Ich verstehe, dass dies nützlich sein kann, wenn Sie mit einem binären (im Gegensatz zu einem probabilistischen oder Score-basierten) Klassifikator arbeiten und ihn als Black Box behandeln. Daher sind Stichprobenschemata Ihre …



1
Warum sollte ich einen Bootstrap durchführen wollen, wenn ich einen unabhängigen Beispiel-T-Test berechne? (wie man einen Bootstrap-T-Test rechtfertigt, interpretiert und meldet)
Angenommen, ich habe zwei Bedingungen und meine Stichprobengröße für die beiden Bedingungen ist extrem niedrig. Nehmen wir an, ich habe nur 14 Beobachtungen in der ersten Bedingung und 11 in der anderen. Ich möchte den t-Test verwenden, um zu testen, ob sich die mittleren Unterschiede signifikant voneinander unterscheiden. Erstens bin …

1
Wie verwende ich den Hausman-Test zur Diskriminierung aufgrund des Geschlechts?
Ich versuche, das geschlechtsspezifische Lohngefälle für männliche und weibliche Büroangestellte in einem großen schwedischen Unternehmen abzuschätzen, um zu testen, ob es eine Diskriminierung aufgrund des Geschlechts gibt. Der Hausman-Test lehnt die Null ab, dass die einzelnen festen Effekte zufällig sind, und daher kann ich mich nicht auf gepoolte OLS oder …




Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.