Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Bei negativen AIC-Werten
Meine Frage bezieht sich auf den Thread Negative Werte für AIC im allgemeinen gemischten Modell . Ich bekomme oft negative AIC-Werte von der Software, die ich benutze. Ich merke es am meisten, wenn ich Zeitreihen mache. Aber hier ist was ich nicht verstehe. Bei der Definition des AIC gefällt das …
8 aic 


2
Welche Abweichung verwendet glmnet, um Werte von zu vergleichen ?
Ein Kriterium für die Auswahl des optimalen Wertes von mit einem elastischen Netz oder einer ähnlichen bestraften Regression besteht darin, eine Auftragung der Abweichung gegen den Bereich von und auszuwählen, wenn die Abweichung minimiert ist (oder innerhalb eines Standardfehlers von Minimum).λ λ λλλ\lambdaλλ\lambdaλλ\lambdaλλ\lambda Aber ich habe Schwierigkeiten zu verstehen , …
8 r  glmnet 



1
Mehrere Vergleiche mit vielen Gruppen
Ich möchte feststellen, ob die Verwendung eines Mehrfachvergleichstests für meine Daten geeignet ist. Ich habe den Kruskal-Wallis-Test verwendet, um festzustellen, ob es Unterschiede in der mittleren Hemmung zwischen verschiedenen Gruppen gibt. Die Analyse ergab, dass es signifikante Unterschiede gab, und jetzt möchte ich ein Mehrfachvergleichsverfahren (möglicherweise Dunns, da ich ungleiche …

5
Warum werden irrelevante Regressoren in großen Stichproben statistisch signifikant?
Ich versuche, statistische Signifikanz, Effektgrößen und dergleichen besser zu verstehen. Ich habe die Auffassung (vielleicht ist es falsch), dass selbst irrelevante Regressoren in großen Stichproben häufig statistisch signifikant werden . Mit irrelevant meine ich, dass es keine sachliche Erklärung gibt, warum der Regressor mit der abhängigen Variablen in Beziehung gesetzt …

3
Wie man die Quantilfunktion erhält, wenn eine analytische Form der Verteilung nicht bekannt ist
Das Problem kommt von Seite 377-379 dieses [0] Papiers. Betrachten Sie bei einer stetigen Verteilung und einem festen :z ∈ R.FFFz∈Rz∈Rz\in\mathbb{R} Lz(t)=PF(|z−Z|≤t)Lz(t)=PF(|z−Z|≤t)L_z(t)=P_F(|z-Z|\leq t) und H(z)=L−1z(0.5)=medZ∼F|z−Z|H(z)=Lz−1(0.5)=medZ∼F|z−Z|H(z)=L^{-1}_z(0.5)=\underset{Z\sim F}{\mbox{med}}|z-Z| wobei die rechte stetige Umkehrung ist. Für ein festes z ist dies also der mittlere Abstand aller Z \ sim F zu z . …

2
Was sind einige Gründe, warum iterativ neu gewichtete kleinste Quadrate nicht konvergieren würden, wenn sie für die logistische Regression verwendet werden?
Ich habe die Funktion glm.fit in R verwendet, um Parameter an ein logistisches Regressionsmodell anzupassen. Standardmäßig verwendet glm.fit iterativ neu gewichtete kleinste Quadrate, um die Parameter anzupassen. Was sind einige Gründe, warum dieser Algorithmus bei Verwendung für die logistische Regression nicht konvergieren würde?

1
Arbeiten mit dem Bootstrap-Beispiel im Vergleich zum Original-Beispiel
Betrachten Sie eine Stichprobe von reellen Zahlen. Nehmen wir an, wir möchten die zentrale Tendenz der Bevölkerung abschätzen und ein Gefühl für unsere Unsicherheit in Bezug auf diese Schätzung bekommen. Lassen Sie uns die Annahmen über die Bevölkerungsverteilung für einen Moment beiseite legen und die folgenden beiden Ansätze betrachten. Holen …

2
Manuelle Berechnung des p-Werts für den t-Test: Wie vermeide ich Werte größer als ?
Diese beiden Methoden zur Berechnung des p-Werts sollten äquivalent sein: t.test(rats.drug,mu=1.2)$p.value 2*pt((mean(rats.drug)-1.2)*sqrt(n)/sd(rats.drug),df=n-1) Das Problem bei der zweiten Methode besteht darin, dass das Risiko besteht, dass Werte größer als (tatsächlich bis zu ) erhalten werden:111222 2*pt((1.5-1.2)*sqrt(100)/.5,df=100-1) [1] 2 Dies kann natürlich durch behoben werden 2*pt((1.5-1.2)*sqrt(100)/.5,df=100-1,lower=F) [1] 3.245916e-08 Meine Frage Offensichtlich ist …
8 r  t-test  p-value 

1
Überprüfen Sie das Papier zum Partikelfilter
Ich habe Online einen Entwurf für eine ausgezeichnete Bewertung gefunden Papier von Zhe Chen dem Titel „Von Kalman Filter Partikelfiltern, und darüber hinaus Bayesian Filtering“. Laut Google Scholar lautet das Zitat für die veröffentlichte Version "Statistics 182 (1), 1-69, 2003", aber die Zeitschrift, die ich mit diesem Namen finde (ISSN: …


1
Ableiten des K-Mittelwert-Algorithmus als Grenze der Erwartungsmaximierung für Gaußsche Gemische
Christopher Bishop definiert den erwarteten Wert der Likelihood-Funktion für das vollständige Datenprotokoll (dh unter der Annahme, dass wir sowohl die beobachtbaren Daten X als auch die latenten Daten Z erhalten) wie folgt: EZ[lnp(X,Z∣μ,Σ,π)]=∑n=1N∑k=1Kγ(znk){lnπk+lnN(xn∣ μk,Σk)}(1)(1)EZ[ln⁡p(X,Z∣μ,Σ,π)]=∑n=1N∑k=1Kγ(znk){ln⁡πk+ln⁡N(xn∣ μk,Σk)} \mathbb{E}_\textbf{Z}[\ln p(\textbf{X},\textbf{Z} \mid \boldsymbol{\mu}, \boldsymbol{\Sigma}, \boldsymbol{\pi})] = \sum_{n=1}^N \sum_{k=1}^K \gamma(z_{nk})\{\ln \pi_k + \ln \mathcal{N}(\textbf{x}_n \mid …

2
Visualisierung und Überzeichnung: Alternative zu Streuungen
Ich habe eine große Menge von Länderdaten, die überfüllt sind (wie Sie unten sehen können), aber ich brauche die Beschriftungen und die Ausreißer - ich habe auch viele Grafiken, daher wäre es mühsam, das Fenster zurückzusetzen und einen falschen Datenpunkt hinzuzufügen für die Ausreißer. Gibt es eine gute Alternative zu …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.