Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren



3
Auswahl von k Knoten im Regressionsglättungs-Spline entsprechend k kategorialen Variablen?
Ich arbeite an einem prädiktiven Kostenmodell, bei dem das Alter des Patienten (eine in Jahren gemessene ganzzahlige Größe) eine der Prädiktorvariablen ist. Ein starker nichtlinearer Zusammenhang zwischen Alter und Risiko eines Krankenhausaufenthaltes ist offensichtlich: Ich denke über einen bestraften Regressionsglättungs-Spline für das Alter des Patienten nach. Gemäß The Elements of …

3
Wenn
Nehmen Sie den folgenden Aufbau an: Es sei Zi=min{ki,Xi},i=1,...,nZi=min{ki,Xi},i=1,...,nZ_i = \min\{k_i, X_i\}, i=1,...,n . Auch Xi∼U[ai,bi],ai,bi>0Xi∼U[ai,bi],ai,bi>0X_i \sim U[a_i, b_i], \; a_i, b_i >0 . Außerdem ist ki=cai+(1−c)bi,0<c<1ki=cai+(1−c)bi,0<c<1k_i = ca_i + (1-c)b_i,\;\; 0 k_i) = 1- \Pr(X_i \le k_i) =1−ki−aibi−ai=1−(1−c)(bi−ai)bi−ai=c=1−ki−aibi−ai=1−(1−c)(bi−ai)bi−ai=c= 1- \frac {k_i - a_i}{b_i-a_i} = 1-\frac {(1-c)(b_i-a_i)}{b_i-a_i} =c Also in …


2
Eine stochastisch ansteigende Exponentialfamilie, für die
Frage Ein kleines Etwas, über das ich mich schon eine Weile gewundert habe: Sei PθPθP_\theta eine stochastisch ansteigende (Ein-Parameter-) Exponentialfamilie im Probenraum XX\mathcal{X} wobei Θ⊂RΘ⊂R\Theta\subset\mathbb{R} sein natürlicher Parameterraum ist, dh ΘΘ\Theta die Menge von Werten, für die das cdf FθFθF_\theta definiert ein Wahrscheinlichkeitsmaß. Stimmt es immer, dass Fθ(x)↗1asθ↘infΘ,Fθ(x)↗1asθ↘infΘ,F_\theta(x)\nearrow 1\qquad\mbox{as}\qquad\theta\searrow \inf\Theta, …


1
Wann ist eine ordnungsgemäße Bewertungsregel eine bessere Schätzung der Verallgemeinerung in einer Klassifizierungseinstellung?
Ein typischer Ansatz zur Lösung eines Klassifizierungsproblems besteht darin, eine Klasse von Kandidatenmodellen zu identifizieren und dann die Modellauswahl unter Verwendung eines Verfahrens wie einer Kreuzvalidierung durchzuführen. Üblicherweise wählt man das Modell mit der höchsten Genauigkeit oder eine entsprechende Funktion , dass Encodierungen Problem spezifische Informationen, wie FβFβ\text{F}_\beta . Angenommen, …

4
Was ist eine „streng positive Verteilung“?
Ich lese Judea Perles "Causality" (zweite Ausgabe 2009) und in Abschnitt 1.1.5 Conditional Independence and Graphoids sagt er: Das Folgende ist eine (teilweise) Liste von Eigenschaften, die von der bedingten Unabhängigkeitsrelation (X_ || _Y | Z) erfüllt werden. Symmetrie: (X_ || _ Y | Z) ==> (Y_ || _X | …


2
Kann ein enges Konfidenzintervall um einen nicht signifikanten Effekt den Nullpunkt belegen?
Es ist offensichtlich trügerisch anzunehmen, dass das Versäumnis, die Null abzulehnen, impliziert, dass die Null wahr ist. Aber in einem Fall, in dem die Null nicht zurückgewiesen wird und das entsprechende Konfidenzintervall (CI) eng und um 0 zentriert ist, liefert dies keinen Beweis für die Null? Ich bin zweierlei Meinung: …

1
Warum ist die funktionale Form der 1. Stufe in 2SLS nicht wichtig?
In einer heutigen Präsentation machte der Redner die obige Behauptung. Er sagte, dass selbst wenn die erste Stufe falsch spezifiziert ist, die Koeffizientenschätzungen der zweiten Stufe weiterhin gültig sind. Als Student mit niedrigem Abschluss konnte ich nicht um eine Erklärung bitten, deshalb bat ich jetzt um Ihre Hilfe!

2
SD größer als die mittlere, nicht negative Skala
Ich erhielt einen Artikel über eine Studie, die einer sehr ähnlich ist, die mein Labor durchführen möchte. Ich habe jedoch festgestellt, dass für die interessierende Variable Duration die SDs größer als der Mittelwert sind. Da dies die in Minuten gemessene Dauer ist, kann sie niemals negativ sein, und dies scheint …

2
Konvergenz in der Verteilung \ CLT
Wenn , ist die bedingte Verteilung. von ist . hat eine marginale Verteilung. von Poisson ( ) ist eine positive Konstante.N=nN=nN = nYYYχ2(2n)χ2(2n)\chi ^2(2n)NNNθθ\thetaθθ\theta Zeigen , dass, als , in der Verteilung.( Y - E ( Y ) ) / √θ→∞θ→∞\theta \rightarrow \infty (Y−E(Y))/Var(Y)−−−−−−√→N(0,1) (Y−E(Y))/Var⁡(Y)→N(0,1)\space \space (Y - E(Y))/ \sqrt{\operatorname{Var}(Y)} …

1
Äquivalenz von AIC- und p-Werten bei der Modellauswahl
In einem Kommentar zur Antwort auf diese Frage wurde festgestellt, dass die Verwendung von AIC bei der Modellauswahl der Verwendung eines p-Werts von 0,154 entspricht. Ich habe es in R versucht, wo ich einen "Rückwärts" -Untergruppenauswahlalgorithmus verwendet habe, um Variablen aus einer vollständigen Spezifikation herauszuwerfen. Erstens durch sequentielles Auswerfen der …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.