Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Anomalieerkennung: Welcher Algorithmus soll verwendet werden?
Kontext: Ich entwickle ein System, das klinische Daten analysiert, um unplausible Daten herauszufiltern, bei denen es sich möglicherweise um Tippfehler handelt. Was ich bisher gemacht habe: Um die Plausibilität zu quantifizieren, habe ich bisher versucht, die Daten zu normalisieren und dann einen Plausibilitätswert für Punkt p basierend auf seiner Entfernung …


1
Gibt es einen Satz, der besagt, dass in der Verteilung zu einer Normalen konvergiert, wenn gegen unendlich geht?
Sei eine beliebige Verteilung mit definiertem Mittelwert und Standardabweichung . Der zentrale Grenzwertsatz besagt, dass in der Verteilung zu einer Standardnormalverteilung konvergiert. Wenn wir durch die Stichprobenstandardabweichung ersetzen , gibt es einen Satz, der besagt, dass in der Verteilung zu einer t-Verteilung konvergiert? Da für großeXXXμμ\muσσ\sigman−−√X¯−μσnX¯−μσ \sqrt{n}\frac{\bar{X} - \mu}{\sigma} σσ\sigmaSSSn−−√X¯−μSnX¯−μS …


2
Sollte ich auf Clusterebene oder auf Einzelebene booten?
Ich habe ein Überlebensmodell mit Patienten, die in Krankenhäusern verschachtelt sind, das einen Zufallseffekt für die Krankenhäuser beinhaltet. Der zufällige Effekt ist gammaverteilt, und ich versuche, die „Relevanz“ dieses Begriffs auf einer leicht verständlichen Skala darzustellen. Ich habe die folgenden Referenzen gefunden, die das Median Hazard Ratio verwenden (ein bisschen …

2
Wie wird die Spearman-Brown-Prophezeiungsformel von Fragen unterschiedlicher Schwierigkeiten beeinflusst?
Wie werden die Ergebnisse der Spearman-Brown-Prophezeiungsformel durch Testfragen mit unterschiedlichen Schwierigkeiten oder Bewertern, die leicht oder schwer zu bewerten sind, beeinflusst? Ein angesehener Text besagt, dass der SB betroffen ist, gibt jedoch keine Details an. (Siehe Zitat unten.) Guion, R. M (2011). Bewertung, Messung und Vorhersage von Personalentscheidungen, 2. Auflage. …

1
Erforderliche Anzahl von Simulationen für die Monte-Carlo-Analyse
E.E.En = { 100 ≤ zc⋅ std ( x )E.⋅ Mittelwert ( x )}}2,n={100⋅zc⋅std(x)E.⋅bedeuten(x)}}2, n = \left\{\frac{100 \cdot z_c \cdot \text{std}(x)}{E \cdot \text{mean}(x)} \right\}^2 , std ( x )std(x)\text{std}(x)zczcz_cnnn In meinem Fall führe ich die Simulation 7500 Mal aus und berechne Bewegungsmittel und Standardabweichungen für jeden Satz von 100 Stichproben …

1
Wie soll ich die GAP-Statistik interpretieren?
Ich habe die GAP-Statistik verwendet, um k Cluster in R zu schätzen. Ich bin mir jedoch nicht sicher, ob ich sie gut interpretiere. Aus der obigen Darstellung gehe ich davon aus, dass ich 3 Cluster verwenden sollte. Aus dem zweiten Plot sollte ich 6 Cluster auswählen. Ist es die richtige …
10 clustering 


1
Passen Sie ein GARCH (1,1) - Modell mit Kovariaten in R an
Ich habe einige Erfahrungen mit der Modellierung von Zeitreihen in Form einfacher ARIMA-Modelle und so weiter. Jetzt habe ich einige Daten, die Volatilitätscluster aufweisen, und ich möchte versuchen, zunächst ein GARCH (1,1) -Modell an die Daten anzupassen. Ich habe eine Datenreihe und eine Reihe von Variablen, von denen ich denke, …
10 r  regression  garch 

1
Varianzinflationsfaktor für verallgemeinerte additive Modelle
In der üblichen VIF Berechnung für eine lineare Regression, die jeweils unabhängig / erklärende Variable wird als abhängige Variable in einem gewöhnlichen Regression der kleinsten Quadrate behandelt. dhXjXjX_j Xj=β0+∑i=1,i≠jnβiXiXj=β0+∑i=1,i≠jnβiXi X_j = \beta_0 + \sum_{i=1, i \neq j}^n \beta_i X_i Die -Werte werden für jede der n Regressionen gespeichert und VIF …


3
Wann ist der Bayes'sche A / B-Test zu beenden?
Ich versuche, A / B-Tests auf Bayes'sche Weise durchzuführen , wie in Probabilistic Programming for Hackers und Bayesian A / B-Tests . Beide Artikel gehen davon aus, dass der Entscheider allein aufgrund der Wahrscheinlichkeit eines Kriteriums, z. B. , entscheidet, welche der Varianten besser ist , daher ist besser. Diese …

2
Können MCMC-Iterationen nach dem Einbrennen zur Dichteschätzung verwendet werden?
Können wir nach dem Einbrennen die MCMC-Iterationen direkt zur Dichteschätzung verwenden, z. B. durch Zeichnen eines Histogramms oder zur Schätzung der Kerneldichte? Ich mache mir Sorgen, dass die MCMC-Iterationen nicht unbedingt unabhängig sind, obwohl sie höchstens identisch verteilt sind. Was ist, wenn wir die MCMC-Iterationen weiter ausdünnen? Ich mache mir …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.