Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Visualisieren Sie die bivariate Binomialverteilung
Frage: Wie sieht eine bivariate Binomialverteilung im dreidimensionalen Raum aus? Unten ist die spezifische Funktion, die ich für verschiedene Werte der Parameter visualisieren möchte; nämlich , p 1 und p 2 .nnnp1p1p_{1}p2p2p_{2} f(x1,x2)=n!x1!x2!px11px22,x1+x2=n,p1+p2=1.f(x1,x2)=n!x1!x2!p1x1p2x2,x1+x2=n,p1+p2=1.f(x_{1},x_{2}) = \frac{n!}{x_{1}!x_{2}!}p_{1}^{x_{1}}p_{2}^{x_{2}}, \qquad x_{1}+x_{2}=n, \quad p_{1}+p_{2}=1. Beachten Sie, dass es zwei Einschränkungen gibt. und p 1 + …






1
Annähern
Ich las beiläufig einen Artikel (in Wirtschaftswissenschaften), der die folgende Annäherung für :Log( E.( X.) )Log⁡(E.(X.))\log(E(X)) ,Log( E.( X.) ) ≈ E.( log( X.) ) + 0,5 v a r ( log( X.) )Log⁡(E.(X.))≈E.(Log⁡(X.))+0,5veinr(Log⁡(X.))\log(E(X)) \approx E(\log(X))+0.5 \mathrm{var}(\log(X)) Was der Autor sagt, ist genau, wenn X logarithmisch normal ist (was ich …

2
Warum kann die Ridge-Regression keine bessere Interpretierbarkeit bieten als LASSO?
Ich habe bereits eine Vorstellung von den Vor- und Nachteilen der Gratregression und des LASSO. Für das LASSO ergibt der L1-Strafausdruck einen Vektor mit geringem Koeffizienten, der als Merkmalsauswahlmethode angesehen werden kann. Es gibt jedoch einige Einschränkungen für den LASSO. Wenn die Merkmale eine hohe Korrelation aufweisen, wählt der LASSO …

2
Latin Hypercube Sampling Asymptotics
Ich versuche, einen Beweis für ein Problem zu erstellen, an dem ich arbeite, und eine der Annahmen, die ich mache, ist, dass die Menge der Punkte, von denen ich Stichproben mache, über den gesamten Raum dicht ist. Praktisch verwende ich Latin Hypercube Sampling, um meine Punkte über den gesamten Probenraum …

2
Erfolg von Bernoulli-Studien mit unterschiedlichen Wahrscheinlichkeiten
Wenn 20 unabhängige Bernoulli-Versuche mit jeweils unterschiedlicher Erfolgswahrscheinlichkeit und damit Misserfolg durchgeführt werden. Wie hoch ist die Wahrscheinlichkeit, dass genau n der 20 Studien erfolgreich waren? Gibt es eine bessere Möglichkeit, diese Wahrscheinlichkeiten zu berechnen, als einfach die Kombinationen von Erfolgs- und Misserfolgswahrscheinlichkeiten zusammenzufassen?


3
Darstellen von Ergebnissen mit nur Mittelwert und Standardabweichung
Ich versuche, ein geeignetes Diagramm für die Beobachtungen in dieser Tabelle der Mittelwerte und Standardabweichungen der Rückrufwerte zu visualisieren: ErinnernSteuerungBedeuten37SD8ExperimentalBedeuten21SD6SteuerungExperimentalBedeutenSDBedeutenSDErinnern378216\begin{array} {c|c c|c c|} & \text{Control} & & \text{Experimental} & \\ & \text{Mean} & \text{SD} &\text{Mean} &\text{SD} \\ \hline \text{Recall} & 37 & 8 & 21 & 6 \\ \hline \end{array} …

2
Zwei Definitionen des p-Wertes: Wie kann man ihre Äquivalenz beweisen?
Ich lese in Larry Wassermans Buch All of Statistics und derzeit über p-Werte (Seite 187). Lassen Sie mich zunächst einige Definitionen einführen (ich zitiere): Definition 1 Die Leistungsfunktion eines Tests mit Verwerfungsbereich RRR ist definiert durch β(θ)=Pθ(X∈R)β(θ)=Pθ(X∈R)\beta(\theta)=P_{\theta}(X\in R) Die Größe eines Tests definiert werden soll α=supθ∈Θ0β(θ)α=supθ∈Θ0β(θ)\alpha = \sup_{\theta\in\Theta_0}\beta(\theta) Ein Test …


1
Auswahl des Bereichs und der Gitterdichte für den Regularisierungsparameter in LASSO
In der Zwischenzeit studiere ich LASSO (Operator für geringste absolute Schrumpfung und Auswahl). Ich sehe, dass der optimale Wert für den Regularisierungsparameter durch Kreuzvalidierung ausgewählt werden kann. Ich sehe auch in der Gratregression und vielen Methoden, die Regularisierung anwenden, dass wir CV verwenden können, um den optimalen Regularisierungsparameter zu finden …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.