Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Vertrauensgrenzen für einen ECDF
Ich versuche, aus Daten in Python eine ECDF (und eine Vertrauensgrenze) zu erstellen. Ich kann das ECDF ziemlich einfach numpydurch Sortieren und Verwenden erzeugen linspace. Ich bin mir jedoch nicht ganz sicher, welche Konfidenzgrenzen angemessen sind, und es scheint keine integrierten Bibliotheken zu geben, die die Grenzen berechnen ( statsmodelsscheint …

1
MLE von
Sei eine Zufallsstichprobe aus einer Verteilung mit pdf X1,X2,X3,...,XnX1,X2,X3,...,XnX_{1},X_{2},X_{3},...,X_{n}f(x;α,θ)=e−x/θθαΓ(α)xα−1I(0,∞)(x),α,θ>0f(x;α,θ)=e−x/θθαΓ(α)xα−1I(0,∞)(x),α,θ>0f(x;\alpha,\theta)=\frac{e^{-x/\theta}}{\theta^{\alpha}\Gamma(\alpha)}x^{\alpha-1}I_{(0,\infty)}(x ),\alpha,\theta>0 Finden Sie den Maximum-Likelihood-Schätzer für und . Seiαα\alphaθθ\thetaΨ(α)=dΓ(α)dαΨ(α)=dΓ(α)dα\Psi(\alpha)=\frac{d\Gamma(\alpha)}{d\alpha} Mein Versuch, L(α,θ)===∏i=1nf(xi)∏i=1ne−xi/θθαΓ(α)xα−1i1Γn(α)⋅θnα(∏i=1nxi)α−1exp(−∑i=1nxiθ)L(α,θ)=∏i=1nf(xi)=∏i=1ne−xi/θθαΓ(α)xiα−1=1Γn(α)⋅θnα(∏i=1nxi)α−1exp⁡(−∑i=1nxiθ)\begin{eqnarray*} \mathcal{L}(\alpha,\theta)&=&\prod_{i=1}^{n}f(x_i)\\ &=&\prod_{i=1}^{n}\frac{e^{-x_i/\theta}}{\theta^{\alpha}\Gamma(\alpha)}x_i^{\alpha-1}\\ &=&\frac{1}{\Gamma^{n}(\alpha)\cdot \theta^{n \alpha}}(\prod_{i=1}^{n}x_i)^{\alpha-1}\exp(-\sum_{i=1}^{n}\frac{x_i}{\theta}) \end{eqnarray*} ℓ(α,θ)δℓ(α,θ)δθ1θ2∑i=1nxiθ^=====−nlog(Γ(α))−nαlog(θ)+(α−1)∑i=1nlog(xi)−1θ∑i=1nxi−nαθ+1θ2∑i=1nxi=0nαθ∑ni=1xinα1αx¯ℓ(α,θ)=−nlog⁡(Γ(α))−nαlog⁡(θ)+(α−1)∑i=1nlog⁡(xi)−1θ∑i=1nxiδℓ(α,θ)δθ=−nαθ+1θ2∑i=1nxi=01θ2∑i=1nxi=nαθθ^=∑i=1nxinα=1αx¯\begin{eqnarray*} \ell(\alpha,\theta)&=&-n\log(\Gamma(\alpha))-n\alpha\log(\theta)+(\alpha-1)\sum_{i=1}^{n}\log(x_i)-\frac{1}{\theta}\sum_{i=1}^{n}x_i\\ \frac{\delta \ell(\alpha,\theta)}{\delta \theta}&=&-\frac{n\alpha}{\theta}+\frac{1}{\theta^2}\sum_{i=1}^{n}x_i=0\\ \frac{1}{\theta^2}\sum_{i=1}^{n}x_i&=&\frac{n\alpha}{\theta}\\ \hat{\theta}&=&\frac{\sum_{i=1}^{n}x_i}{n\alpha}\\ &=&\frac{1}{\alpha}\bar{x}\\ \end{eqnarray*} dℓ(α,θ^)dαlog(α)−Γ′(α)Γ(α)===−n⋅Γ′(α)Γ(α)−nlog(1αx¯)+∑i=1nlog(xi)=0−n⋅Γ′(α)Γ(α)+nlog(α)−nlog(x¯)+∑i=1nlog(xi)=0log(x¯)−∑ni=1log(xi)ndℓ(α,θ^)dα=−n⋅Γ′(α)Γ(α)−nlog⁡(1αx¯)+∑i=1nlog⁡(xi)=0=−n⋅Γ′(α)Γ(α)+nlog⁡(α)−nlog⁡(x¯)+∑i=1nlog⁡(xi)=0log⁡(α)−Γ′(α)Γ(α)=log⁡(x¯)−∑i=1nlog⁡(xi)n\begin{eqnarray*} \frac{d \ell(\alpha,\hat{\theta})}{d\alpha}&=&\frac{-n \cdot \Gamma'(\alpha)}{\Gamma(\alpha)}-n\log(\frac{1}{\alpha}\bar{x})+\sum_{i=1}^{n}\log(x_i)=0\\ &=&\frac{-n \cdot \Gamma'(\alpha)}{\Gamma(\alpha)}+n\log(\alpha)-n\log(\bar{x})+\sum_{i=1}^{n}\log(x_i)=0\\ \log(\alpha)-\frac{\Gamma'(\alpha)}{\Gamma(\alpha)}&=&\log(\bar{x})-\frac{\sum_{i=1}^{n}\log(x_i)}{n} \end{eqnarray*} Ich konnte nicht mehr …

3
Verwendung von ML zur Unterstützung der menschlichen Kennzeichnung in Datensätzen mit stark unausgeglichenen Klassen
Gibt es wissenschaftliche Probleme bei der Verwendung von ML zur Unterstützung menschlicher Anmerkungen? Ich habe einen unbeschrifteten Datensatz mit 3 Klassen, in dem nur 1 von 500 Elementen zu den 2 interessierenden Klassen gehört. Die Beschriftungen sind nicht für alle Elemente der unbeschrifteten Daten trivial erkennbar. Da jedoch die meisten …

2
Bewahren Autoencoder Entfernungen auf?
Nach meinem Verständnis werden Autoencoder verwendet, um eine kompakte Darstellung von Eingabefunktionen zu finden, die die wesentlichen zugrunde liegenden Informationen enthält. Gibt es eine Beziehung zwischen den L2-Abständen im ursprünglichen Eingaberaum und dem reduzierten (kompakten) Raum? Wenn nicht, kann ich das Netzwerk so trainieren, dass die kompakte Darstellung nach der …

1
McNemar oder Fisher exakter Test für Neigungsbewertung übereinstimmende Daten?
Ich möchte einige mit dem Neigungswert übereinstimmende Daten analysieren. In der Literatur wird üblicherweise ein McNemar-Test verwendet, da die Daten "gepaart" sind. Matching ist jedoch keine Paarung im gesunden Menschenverstand. Wäre es korrekter, den genauen Fisher-Test zu verwenden? Welche Meinungen gibt es zur Verwendung gepaarter Tests für übereinstimmende Daten?

2
Fügt eine Dichteprognose einen Wert hinzu, der über eine Punktprognose hinausgeht, wenn die Verlustfunktion angegeben wird?
Dichtevorhersagen sind universeller als Punktvorhersagen; Sie liefern Informationen über die gesamte vorhergesagte Verteilung einer Zufallsvariablen und nicht über eine konkrete Funktion derselben (wie den vorhergesagten Mittelwert, den Median, das Quantil usw.). Durch die Verfügbarkeit einer Dichtevorhersage können verschiedene Benutzer relevante Elemente - Punktvorhersagen - auswählen, die für sie von Interesse …


1
Was ist der Unterschied zwischen der Verwendung zufälliger Abschnitte und Steigungen anstelle separater Regressionen pro Subjekt?
Ich habe eine DV und IV von 20 Teilnehmern aufgenommen. Die IV ist eine wiederholte Messung, und mein Ziel ist es zu sehen, wie Variationen in der IV Variationen in der DV erklären können. Insbesondere möchte ich für jeden Teilnehmer einen Beta-Koeffizienten. Mein erster Gedanke war, ein lineares Mischeffektmodell mit …

1
Unterschied zwischen linearer Regression beim maschinellen Lernen und dem statistischen Modell
Ich hatte das Verständnis, dass der Hauptunterschied zwischen maschinellem Lernen und statistischem Modell darin besteht, dass das spätere eine bestimmte Art der Datenverteilung "annimmt" und auf diesem unterschiedlichen Modellparadigma sowie statistischen Ergebnissen basiert, die wir erhalten (z. B. p-Werte, F-Statistik) , t-stat usw.). Beim maschinellen Lernen kümmern wir uns jedoch …

3
Konvertieren des Beta-Koeffizienten von der Matrix in die Skalarnotation in der OLS-Regression
Ich habe bei meinen ökonometrischen Untersuchungen festgestellt, dass ich mich oft retten kann, wenn ich die Skalarnotation vergesse, indem ich mich an die Matrixnotation erinnere und rückwärts arbeite. Das Folgende verwirrte mich jedoch. Angesichts der einfachen Schätzung yi^=β0^+β1^xi1yi^=β0^+β1^xi1\hat{y_i} = \hat{\beta_0} + \hat{\beta_1}x_{i1} Wie kommen wir davon? β^=(X′X)−1X′yβ^=(X′X)−1X′y\boldsymbol{\hat{\beta}} = \boldsymbol{(X'X)}^{-1}\boldsymbol{X'y} zu …

2
Statistik ohne Hypothesentest
In seinen Blog-Posts sagt Andrew Gelman, er sei kein Fan von Bayes'schen Hypothesentests (siehe hier: http://andrewgelman.com/2009/02/26/why_i_dont_like/ ), und wenn ich mich nicht falsch erinnere, denke ich, dass er sagt auch, dass das Testen von häufig auftretenden Hypothesen auch Mängel aufweist. Meine Frage ist: Können Sie Statistiken ohne Hypothesentest auch für …

2
Interpretation der Entropie zur kontinuierlichen Verteilung?
"Entropie" erfasst grob den Grad der "Information" in einer Wahrscheinlichkeitsverteilung. Für diskrete Verteilungen gibt es eine weitaus genauere Interpretation: Die Entropie einer diskreten Zufallsvariablen ist eine Untergrenze für die erwartete Anzahl von Bits, die zur Übertragung des Ergebnisses der Zufallsvariablen erforderlich sind. Aber für eine kontinuierliche Zufallsvariable gibt es unzählige …

2
Erhöhen oder verringern mehr Objektklassen die Genauigkeit der Objekterkennung?
Angenommen, Sie haben einen Objekterkennungsdatensatz (z. B. MS COCO oder Pascal VOC) mit N Bildern, in denen k Objektklassen gekennzeichnet sind. Sie trainieren ein neuronales Netzwerk (z. B. Faster-RCNN oder YOLO) und messen die Genauigkeit (z. B. IOU@0.5). Jetzt führen Sie x zusätzliche Objektklassen ein und fügen Ihrem ursprünglichen Datensatz …

1
Ridge Regression und Lasso Regression
Ich arbeite derzeit an diesem Problem und das Ziel ist es, ein lineares Regressionsmodell zu entwickeln, um mein Y (Blutdruck) mit 8 Prädiktoren unter Verwendung der Ridge & Lasso-Regression vorherzusagen . Ich beginne damit, die Bedeutung der einzelnen Prädiktoren zu untersuchen. Unten ist einsummary()summary()summary() meiner multiplen linearen Regression mit age100age100age100 …

2
Ist die Kreuzvalidierung nutzlos, wenn die Hypothesen nicht verschachtelt sind?
Wenn ich in einer Regressionseinstellung viele Zufallsmodelle (ohne Berücksichtigung der Daten) generiere, indem ich einfach zufällig Koeffizientenwerte zuweise und diese Modelle dann über den Datensatz mit einer Fehlermetrik auswerte und das beste Modell basierend auf dieser Fehlermetrik auswähle, würde ich trotzdem ausführen in Überanpassung? Irgendwann werden wir die OLS-Lösung haben …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.