Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Wie berechnet man den erwarteten Wert einer Standardnormalverteilung?
Ich möchte lernen, wie man den erwarteten Wert einer kontinuierlichen Zufallsvariablen berechnet. Es scheint, dass der erwartete Wert E[X]=∫∞−∞xf(x)dxE[X]=∫−∞∞xf(x)dxE[X] = \int_{-\infty}^{\infty} xf(x)\mathrm{d}x wobei f(x)f(x)f(x) die Wahrscheinlichkeitsdichtefunktion von XXX . Angenommen, die Wahrscheinlichkeitsdichtefunktion von ist f ( x ) = 1XXX ist die Dichte der Standardnormalverteilung.f(x)=12π−−√e−x22f(x)=12πe−x22f(x) = \frac{1}{\sqrt{2\pi}}e^{\frac{-x^{2}}{2}} Also würde ich …


4
Wie soll ich die Annahme der Linearität zum Logit für die kontinuierlichen unabhängigen Variablen in der logistischen Regressionsanalyse überprüfen?
Ich bin verwirrt mit der Annahme der Linearität des Logits für kontinuierliche Prädiktorvariablen in der logistischen Regressionsanalyse. Müssen wir die lineare Beziehung überprüfen, während wir mithilfe einer univariablen logistischen Regressionsanalyse nach potenziellen Prädiktoren suchen? In meinem Fall verwende ich die multiple logistische Regressionsanalyse, um Faktoren zu identifizieren, die mit dem …

2
Was ist Schrumpfung?
Das Wort Schrumpfung wird in bestimmten Kreisen häufig verwendet. Aber was Schrumpfung ist, scheint es keine klare Definition zu geben. Wenn ich eine Zeitreihe (oder eine Sammlung von Beobachtungen eines Prozesses) habe, auf welche Weise kann ich eine Art empirischen Schrumpfens an der Reihe messen? Über welche verschiedenen Arten der …

3
wenn
Ich weiß, dass für die stetige Variable P[X=x]=0P[X=x]=0P[X=x]=0 . Aber ich kann mir nicht vorstellen, dass wenn P[X=x]=0P[X=x]=0P[X=x]=0 , es unendlich viele mögliche xxx . Und warum werden ihre Wahrscheinlichkeiten unendlich klein?

1
Verbindungen zwischen
Beim maschinellen Lernen können wir den Bereich unter der ROC-Kurve (oft als AUC oder AUROC abgekürzt ) verwenden, um zusammenzufassen, wie gut ein System zwischen zwei Kategorien unterscheiden kann. In der Signaldetektionstheorie wird häufig der d'd'd' (Empfindlichkeitsindex) für einen ähnlichen Zweck verwendet. Die beiden sind eng miteinander verbunden, und ich …


6
Wie kann man abrupte Veränderungen charakterisieren?
Diese Frage ist möglicherweise zu grundlegend. Für einen zeitlichen Trend von Daten möchte ich den Punkt herausfinden, an dem "abrupte" Änderungen auftreten. In der ersten Abbildung unten möchte ich beispielsweise den Änderungspunkt mithilfe einer statistischen Methode ermitteln. Und ich möchte eine solche Methode auf einige andere Daten anwenden, deren Änderungspunkt …



2
Grundlegendes zur Erstellung von Dummy-Variablen (manuell oder automatisiert) in GLM
Wenn in der glm-Formel eine Faktorvariable (z. B. Geschlecht mit den Ebenen M und F) verwendet wird, werden Dummy-Variablen erstellt, die zusammen mit den zugehörigen Koeffizienten (z. B. genderM) in der glm-Modellzusammenfassung aufgeführt sind. Wenn Sie sich nicht auf R verlassen, um den Faktor auf diese Weise aufzuteilen, wird der …

2
Wie kann eine Kreuzvalidierung für PCA durchgeführt werden, um die Anzahl der Hauptkomponenten zu bestimmen?
Ich versuche, meine eigene Funktion für die Hauptkomponentenanalyse, PCA, zu schreiben (natürlich ist bereits viel geschrieben, aber ich bin nur daran interessiert, Dinge selbst zu implementieren). Das Hauptproblem, auf das ich gestoßen bin, ist der Kreuzvalidierungsschritt und die Berechnung der vorhergesagten Quadratsumme (PRESS). Es spielt keine Rolle, welche Kreuzvalidierung ich …


1
Auswahl einer geeigneten Minibatch-Größe für den stochastischen Gradientenabstieg (SGD)
Gibt es Literatur, die die Wahl der Minibatch-Größe bei der Durchführung eines stochastischen Gradientenabfalls untersucht? Nach meiner Erfahrung scheint es sich um eine empirische Entscheidung zu handeln, die normalerweise durch Kreuzvalidierung oder unter Verwendung unterschiedlicher Faustregeln getroffen wird. Ist es eine gute Idee, die Minibatch-Größe langsam zu erhöhen, wenn der …

2
So schätzen Sie die Grundlinien-Gefährdungsfunktion im Cox-Modell mit R.
Ich muss die Grundlinien-Gefährdungsfunktion in einem zeitabhängigen Cox-Modell schätzenλ0( t )λ0(t)\lambda_0(t) λ ( t ) = λ0( t ) exp( Z.( t )'β)λ(t)=λ0(t)exp⁡(Z.(t)'β)\lambda(t) = \lambda_0(t) \exp(Z(t)'\beta) Während ich den Überlebenskurs belegte, erinnere ich mich, dass die direkte Ableitung der kumulativen Gefahrenfunktion ( λ0( t ) dt = dΛ0( t )λ0(t)dt=dΛ0(t)\lambda_0(t) …
13 r  survival  cox-model 

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.