Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Was bedeutet "prinzipiell" wie in der "prinzipiellen Bayes'schen Analyse"?
Ich bin im Allgemeinen neugierig, was der Begriff "prinzipiell" bedeutet. Es wurde im Titel eines unveröffentlichten Manuskripts "Kombination von Computermodellen in einer prinzipiellen Bayes'schen Analyse" verwendet. Darüber hinaus sagt Zhang 2004: "Eine prinzipielle Bayes'sche Analyse bietet hier mehrere Vorteile": Ansonsten finde ich relativ wenige Google-Treffer für die Phrase. Was bedeutet …

3
Warum ist Abhängigkeit ein Problem?
Mich interessiert, warum abhängige Beobachtungen ein Problem in der Statistik sind. Angenommen, Sie möchten wissen, ob sich die durchschnittlichen Prüfungsergebnisse zwischen zwei Schulen unterscheiden. Sie sammeln 50 Beobachtungen in jeder Schule. Diese 50 Beobachtungen stammen aus 5 verschiedenen Klassenräumen in jeder Schule und es besteht eine Abhängigkeit innerhalb der Klassenräume. …

1
Ist es möglich, einen Schätzer zu haben, der unvoreingenommen und begrenzt ist?
Ich habe einen Parameter der zwischen . Nehmen wir an, ich kann ein Experiment durchführen und , wobei ein Standard-Gaußscher ist. Was ich brauche, ist eine Schätzung von θ, die 1) unvoreingenommen 2) fast sicher begrenzt ist. Voraussetzung (2) ist für mich entscheidend.θθ\theta[0,1][0,1][0,1]θ^=θ+wθ^=θ+w\hat{\theta} = \theta + wwwwθθ\theta Die natürliche denken …

2
Naive Bayes über kontinuierliche Variablen
Bitte erlauben Sie mir, eine grundlegende Frage zu stellen. Ich verstehe die Mechanik von Naive Bayes für diskrete Variablen und kann die Berechnungen "von Hand" wiederholen. (Code von HouseVotes84 ganz unten). Ich habe jedoch Schwierigkeiten zu sehen, wie die Mechanik für kontinuierliche Variablen funktioniert (Beispielcode siehe unten). Wie berechnet das …
8 r  naive-bayes  bayes 

3
Sind Binning-Daten vor der Pearson-Korrelation gültig?
Ist es akzeptabel, Bin-Daten zu erstellen, den Mittelwert der Bins zu berechnen und dann den Pearson-Korrelationskoeffizienten auf der Grundlage dieser Mittelwerte abzuleiten? Es scheint mir ein etwas faul zu sein, wenn (wenn Sie sich die Daten als Bevölkerungsstichprobe vorstellen) die Streuung dieser Mittelwerte der Standardfehler des Mittelwerts ist und daher …

1
Punktanalyse ändern
Könnte mir bitte jemand den Änderungspunkt erklären. Ich verwende das Paket in R und verstehe nicht wirklich, was die verschiedenen Methoden bedeuten, welche Vor- und Nachteile sie haben, und ich verstehe insbesondere den Strafwert nicht. Was bedeutet das, wenn Sie den Strafwert erhöhen, und was bewirkt es? Ich habe viel …

1
Wie kann man eine Binomialleistungsanalyse mit zwei Gruppen durchführen, ohne normale Näherungen zu verwenden?
Ich möchte Leistungsanalysen für Hypothesentests der (Nicht-) Proportionsgleichheit durchführen, bei denen die Proportionen sehr klein sind. Ich möchte dies tun, ohne normale (oder Poisson-) Näherungen der Binomialverteilung zu verwenden. Es gibt verschiedene allgemeine Arten von Machtfragen, die ich gerne beantworten möchte. Post-hoc : Gegeben (Erfolgswahrscheinlichkeit in Gruppe 1) und \ …


3
Zusammenhang zwischen Omnibus-Test und Mehrfachvergleich?
Wikipedia sagt Methoden, die auf einem Omnibus-Test beruhen, bevor mehrere Vergleiche durchgeführt werden . Typischerweise erfordern diese Methoden einen signifikanten ANOVA / Tukey-Bereichstest, bevor mehrere Vergleiche durchgeführt werden. Diese Methoden haben eine "schwache" Kontrolle des Fehlers vom Typ I. Ebenfalls Der F-Test in ANOVA ist ein Beispiel für einen Omnibus-Test, …

1
Eigenschaften der normalen und impliziten bedingten Wahrscheinlichkeit des bivariaten Standards im Roy-Modell
Entschuldigung für den langen Titel, aber mein Problem ist sehr spezifisch und schwer in einem Titel zu erklären. Ich lerne gerade über das Roy-Modell (Behandlungseffektanalyse). Bei meinen Folien gibt es einen Ableitungsschritt, den ich nicht verstehe. Wir berechnen das erwartete Ergebnis mit der Behandlung in der Behandlungsgruppe (Dummy D ist …

1
Dummy-Codierung für Kontraste: 0,1 vs. 1, -1
Ich bitte Sie um Ihre Hilfe, um den Unterschied zwischen zwei verschiedenen Kontrasten für dichotome Variablen zu verstehen. Auf dieser Seite: http://www.psychstat.missouristate.edu/multibook/mlt08.htm unter "Dichotome Prädiktorvariablen" gibt es zwei Möglichkeiten, dichotome Prädiktoren zu codieren: Verwenden des Kontrasts 0,1 oder des Kontrasts 1, -1 . Ich verstehe die Unterscheidung hier irgendwie (0,1 …


2
Warum erhalte ich in OL die gleichen Ergebnisse für OLS und GLS?
Wenn ich diesen Code ausführe: require(nlme) a <- matrix(c(1,3,5,7,4,5,6,4,7,8,9)) b <- matrix(c(3,5,6,2,4,6,7,8,7,8,9)) res <- lm(a ~ b) print(summary(res)) res_gls <- gls(a ~ b) print(summary(res_gls)) Ich bekomme die gleichen Koeffizienten und die gleiche statistische Signifikanz für die Koeffizienten: Loading required package: nlme Call: lm(formula = a ~ b) Residuals: Min 1Q …

1
Kausale Identifizierung und bestrafte Splines
Ich habe gerade eine Ablehnung von einem Wirtschaftsjournal erhalten. Als Gründe für die Ablehnung wurden angeführt: Die Vorteile der Verwendung der semiparametrischen Methode werden im Vergleich zu alternativen einfacheren Techniken mit sauberer Identifizierung von Kausalzusammenhängen nicht klar herausgestellt Es ist durchaus möglich, dass ich die Methodik einer Reihe von Ökonomen, …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.