Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


1
Warum scheitert diese Regression NICHT an perfekter Multikollinearität, obwohl eine Variable eine lineare Kombination von anderen ist?
Heute habe ich mit einem kleinen Datensatz herumgespielt und eine einfache OLS-Regression durchgeführt, von der ich erwartet hatte , dass sie aufgrund perfekter Multikollinearität fehlschlägt. Das tat es jedoch nicht. Dies impliziert, dass mein Verständnis von Multikollinearität falsch ist. Meine Frage ist: Wo irre ich mich? Ich denke, ich kann …

2
Wenn „Standardfehler“ und „Konfidenzintervalle“ die Messgenauigkeit messen, was sind dann die Messungen der Genauigkeit?
Im Buch "Biostatistik für Dummies" auf Seite 40 las ich: Der Standardfehler (abgekürzt SE) ist eine Möglichkeit anzugeben, wie genau Ihre Schätzung oder Messung von etwas ist. und Konfidenzintervalle bieten eine andere Möglichkeit, die Genauigkeit einer Schätzung oder Messung von etwas anzugeben. Es ist jedoch nichts darüber geschrieben, wie die …

2
Die Linearität der Varianz
Ich denke, die folgenden zwei Formeln sind wahr: Var(aX)=a2Var(X)Var(aX)=a2Var(X) \mathrm{Var}(aX)=a^2 \mathrm{Var}(X) während a eine konstante Zahl ist wenn , unabhängig sindVar(X+Y)=Var(X)+Var(Y)Var(X+Y)=Var(X)+Var(Y) \mathrm{Var}(X + Y)=\mathrm{Var}(X)+\mathrm{Var}(Y) XXXYYY Ich bin mir jedoch nicht sicher, was mit dem Folgenden falsch ist: Var(2X)=Var(X+X)=Var(X)+Var(X)Var(2X)=Var(X+X)=Var(X)+Var(X)\mathrm{Var}(2X) = \mathrm{Var}(X+X) = \mathrm{Var}(X) + \mathrm{Var}(X) was nicht , dh .22Var(X)22Var(X)2^2 \mathrm{Var}(X)4Var(X)4Var(X)4\mathrm{Var}(X) …

2
Wann sollte man aufhören, ein Modell zu verfeinern?
Ich habe in den letzten 3 Jahren Statistiken aus vielen Büchern studiert und dank dieser Seite viel gelernt. Dennoch bleibt für mich eine grundlegende Frage offen. Es mag eine sehr einfache oder eine sehr schwierige Antwort geben, aber ich weiß, dass es ein tiefes Verständnis der Statistik erfordert. Bei der …


1
Grundlegendes zur QR-Zerlegung
Ich habe ein funktionierendes Beispiel (in R), das ich weiter zu verstehen versuche. Ich benutze Limma, um ein lineares Modell zu erstellen, und versuche zu verstehen, was in den Fold Change-Berechnungen Schritt für Schritt vor sich geht. Ich versuche hauptsächlich herauszufinden, was passiert, um die Koeffizienten zu berechnen. Nach allem, …

2
Das pdf von
Angenommen , X1, X2, . . . , XnX1,X2,...,XnX_1, X_2,...,X_n sei iid aus N( μ , σ2)N(μ,σ2)N(\mu,\sigma^2) mit unbekanntem μ ∈ Rμ∈R\mu \in \mathcal R und σ2> 0σ2>0\sigma^2>0 Sei Z=X1−X¯S,Z=X1−X¯S,Z=\frac{X_1-\bar{X}}{S},S ist hier die Standardabweichung. Es kann gezeigt werden, dass ZZZ die Lebesgue pdf hat f(z)=n−−√Γ(n−12)π−−√(n−1)Γ(n−22)[1−nz2(n−1)2]n/2−2I(0,(n−1)/n√)(|Z|)f(z)=nΓ(n-12)π(n-1)Γ(n-22)[1-nz2(n-1)2]n/2-2ich(0,(n-1)/n)(|Z|)f(z)=\frac{\sqrt{n} \Gamma\left(\frac{n-1}{2}\right)}{\sqrt{\pi}(n-1)\Gamma\left(\frac{n-2}{2}\right)}\left[1-\frac{nz^2}{(n-1)^2}\right]^{n/2-2}I_{(0,(n-1)/\sqrt{n})}(|Z|) Meine Frage ist dann, …
15 self-study  umvue 


1
Auf welcher Ebene ist ein
HINTERGRUND: Sicher überspringen - dient als Referenz und zur Rechtfertigung der Frage. Die Eröffnung dieses Papiers lautet: "Karl Pearsons berühmter Chi-Quadrat-Kontingenztest leitet sich aus einer anderen Statistik ab, die als z-Statistik bezeichnet wird und auf der Normalverteilung basiert. Die einfachsten Versionen von χ2χ2\chi^2 können mathematisch mit äquivalenten z-Tests identisch sein. …


4
Text Mining: Wie gruppiert man Texte (zB Nachrichtenartikel) mit künstlicher Intelligenz?
Ich habe einige neuronale Netze (MLP (vollständig verbunden), Elman (wiederkehrend)) für verschiedene Aufgaben aufgebaut, z. B. zum Spielen von Pong, zum Klassifizieren handgeschriebener Ziffern und anderer Dinge ... Zusätzlich habe ich versucht, einige erste Faltungs-Neuronale Netze aufzubauen, z. B. zum Klassifizieren von mehrstelligen handschriftlichen Notizen, aber ich bin völlig neu …

1
Andere unvoreingenommene Schätzer als die BLAUE (OLS-Lösung) für lineare Modelle
Für ein lineares Modell bietet die OLS-Lösung den besten linearen unverzerrten Schätzer für die Parameter. Natürlich können wir eine Tendenz für eine geringere Varianz eintauschen, z. B. eine Kammregression. Aber meine Frage bezieht sich darauf, keine Vorurteile zu haben. Gibt es andere Schätzer, die etwas gebräuchlich sind, aber eine höhere …

7
Was haben Sie getan, um sich an Bayes 'Regel zu erinnern?
Ich denke, eine gute Möglichkeit, sich an die Formel zu erinnern, besteht darin, sich die Formel folgendermaßen vorzustellen: Die Wahrscheinlichkeit, dass ein Ereignis A ein bestimmtes Ergebnis hat, wenn das Ergebnis eines unabhängigen Ereignisses B gegeben ist = die Wahrscheinlichkeit, dass beide Ergebnisse gleichzeitig auftreten / was auch immer wir …
15 bayesian  bayes 

1
Regularisierung für ARIMA-Modelle
Ich kenne die Regularisierung nach LASSO, Ridge und Elastic-Net in linearen Regressionsmodellen. Frage: Kann diese (oder eine ähnliche) Art der bestraften Schätzung auf die ARIMA-Modellierung angewendet werden (mit einem nicht leeren MA-Teil)? Beim Erstellen von ARIMA-Modellen scheint es üblich zu sein, eine vorgewählte maximale Verzögerungsreihenfolge ( , ) zu berücksichtigen …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.