Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


2
Korrelation zwischen OLS-Schätzern für Achsenabschnitt und Steigung
In einem einfachen Regressionsmodell y=β0+β1x+ε,y=β0+β1x+ε, y = \beta_0 + \beta_1 x + \varepsilon, OLS Schätzer ββ^OLS0β^0OLS\hat{\beta}_0^{OLS} und ββ^OLS1β^1OLS\hat{\beta}_1^{OLS} korreliert sind. Die Formel für die Korrelation zwischen den beiden Schätzern lautet (wenn ich sie richtig abgeleitet habe): Corr(β^OLS0,β^OLS1)=−∑ni=1xin−−√∑ni=1x2i−−−−−−−√.Corr⁡(β^0OLS,β^1OLS)=−∑i=1nxin∑i=1nxi2. \operatorname{Corr}(\hat{\beta}_0^{OLS},\hat{\beta}_1^{OLS}) = \frac{-\sum_{i=1}^{n}x_i}{\sqrt{n} \sqrt{\sum_{i=1}^{n}x_i^2} }. Fragen: Was ist die intuitive Erklärung für das …


3
Intuitives Denken hinter voreingenommenen Maximum-Likelihood-Schätzern
Ich bin verwirrt über voreingenommene Maximum-Likelihood- Schätzer (ML). Die Mathematik des gesamten Konzepts ist mir ziemlich klar, aber ich kann die intuitive Argumentation dahinter nicht verstehen. Bei einem bestimmten Datensatz, der Stichproben aus einer Verteilung enthält, die selbst eine Funktion eines Parameters ist, den wir schätzen möchten, ergibt der ML-Schätzer …

4
Intuition hinter der Standardabweichung
Ich versuche, die Standardabweichung intuitiver zu verstehen. Soweit ich weiß, ist es repräsentativ für den Durchschnitt der Unterschiede eines Satzes von Beobachtungen in einem Datensatz gegenüber dem Mittelwert dieses Datensatzes. Es entspricht jedoch NICHT den Durchschnittswerten der Differenzen, da Beobachtungen, die weiter vom Mittelwert entfernt sind, mehr Gewicht erhalten. Angenommen, …

5
Wie kann Multikollinearität in einem gemischten linearen Modell getestet und vermieden werden?
Ich verwende derzeit einige lineare Modelle mit gemischten Effekten. Ich benutze das Paket "lme4" in R. Meine Modelle haben die Form: model <- lmer(response ~ predictor1 + predictor2 + (1 | random effect)) Bevor ich meine Modelle ausführte, überprüfte ich die mögliche Multikollinearität zwischen Prädiktoren. Ich habe das gemacht von: …


5
Wie wird eine große zufällige Korrelationsmatrix mit vollem Rang und einigen starken Korrelationen erstellt?
Ich möchte eine zufällige Korrelationsmatrix CC\mathbf C einer Größe von erzeugen, n×nn×nn \times nso dass einige mäßig starke Korrelationen vorliegen: quadratische reelle symmetrische Matrix von n×nn×nn \times n Größe, mit zB n=100n=100n=100 ; positiv-definit, dh mit allen Eigenwerten real und positiv; voller Rang; alle diagonalen Elemente sind gleich 111 ; …

4
Annahmen überprüfen lmer / lme gemischte Modelle in R
Ich habe einen wiederholten Entwurf durchgeführt, bei dem ich 30 Männer und 30 Frauen in drei verschiedenen Aufgaben getestet habe. Ich möchte verstehen, wie unterschiedlich sich Männer und Frauen verhalten und wie das von der jeweiligen Aufgabe abhängt. Ich habe sowohl das lmer- als auch das lme4-Paket verwendet, um dies …

1
"Kernel Density Estimation" ist eine Faltung von was?
Ich versuche, die Schätzung der Kerneldichte besser zu verstehen. Verwendung der Definition aus Wikipedia: https://en.wikipedia.org/wiki/Kernel_density_estimation#Definition fh^(x)=1n∑ni=1Kh(x−xi)=1nh∑ni=1K(x−xih)fh^(x)=1n∑i=1nKh(x−xi)=1nh∑i=1nK(x−xih) \hat{f_h}(x) = \frac{1}{n}\sum_{i=1}^n K_h (x - x_i) \quad = \frac{1}{nh} \sum_{i=1}^n K\Big(\frac{x-x_i}{h}\Big) Nehmen wir als rechteckige Funktion, die ergibt, wenn zwischen und und andernfalls , und (Fenstergröße) als 1.1 x - 0,5 0,5 0 …

2
Wie verwende ich R prcomp-Ergebnisse für die Vorhersage?
Ich habe einen data.frame mit 800 obs. von 40 Variablen, und möchte die Ergebnisse meiner Vorhersage mithilfe der Hauptkomponentenanalyse verbessern (was bisher mit Support Vector Machine an 15 handverlesenen Variablen am besten funktioniert). Ich verstehe, dass ein prcomp mir helfen kann, meine Vorhersagen zu verbessern, aber ich weiß nicht, wie …
25 r  pca 

2
Wie kann man feststellen, ob Daten einer Poisson-Verteilung in R folgen?
Ich bin Student und habe ein Projekt für meine Wahrscheinlichkeitsklasse. Grundsätzlich habe ich einen Datensatz über die Wirbelstürme, die mein Land mehrere Jahre lang heimgesucht haben. In meinem Wahrscheinlichkeitsbuch (Wahrscheinlichkeit und Statistik mit R) gibt es ein (nicht vollständiges) Beispiel dafür, wie überprüft werden kann, ob die Daten einer Poisson-Verteilung …

3
LSA vs. PCA (Dokumentenclustering)
Ich untersuche verschiedene Techniken, die beim Clustering von Dokumenten zum Einsatz kommen, und möchte einige Zweifel in Bezug auf PCA (Principal Component Analysis) und LSA (Latent Semantic Analysis) klären. Erste Sache - was sind die Unterschiede zwischen ihnen? Ich weiß, dass in PCA die SVD-Zerlegung auf die Term-Kovarianz-Matrix angewendet wird, …

2
Was ist das Bayes'sche Äquivalent eines allgemeinen Fitnesstests?
Ich habe zwei Datensätze, einen aus einer Reihe physikalischer Beobachtungen (Temperaturen) und einen aus einem Ensemble numerischer Modelle. Ich mache eine perfekte Modellanalyse unter der Annahme, dass das Modellensemble eine echte, unabhängige Stichprobe darstellt, und überprüfe, ob die Beobachtungen aus dieser Verteilung stammen. Die von mir berechnete Statistik ist normalisiert …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.