Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren



1
Patch-Wise-Training und vollständig Faltungs-Training in einem vollständig Faltungs-Neuronalen Netzwerk
In der Arbeit über ein vollständig faltungsorientiertes neuronales Netzwerk erwähnen die Autoren sowohl das Patch-weise Training als auch das vollständig faltungsorientierte Training. Mein Verständnis für den Aufbau des Trainingssets ist wie folgt: M*MExtrahieren Sie bei einem gegebenen Bild Unterbilder mit N*N, wobei ( N<M). Die ausgewählten Teilbilder überlappen sich untereinander. …

2
Derivat von Softmax in Bezug auf Gewichte
Ich bin neu im Deep Learning und versuche, die Ableitung der folgenden Funktion in Bezug auf die Matrix zu berechnen :ww\mathbf w p(a)=ew⊤axΣdew⊤dxp(a)=ewa⊤xΣdewd⊤xp(a) = \frac{e^{w_a^\top x}}{\Sigma_{d} e^{w_d^\top x}} Unter Verwendung der Quotientenregel erhalte ich: ∂p(a)∂w=xew⊤axΣdew⊤dx−ew⊤axΣdxew⊤dx[Σdew⊤dx]2=0∂p(a)∂w=xewa⊤xΣdewd⊤x−ewa⊤xΣdxewd⊤x[Σdewd⊤x]2=0\frac{\partial p(a)}{\partial w} = \frac{xe^{w_a^\top x}\Sigma_{d} e^{w_d^\top x} - e^{w_a^\top x}\Sigma_{d} xe^{w_d^\top x}}{[\Sigma_{d} e^{w_d^\top x}]^2} = …

2
Sei die Ordnungsstatistik. Bewerten Sie ,
Sei die Ordnungsstatistik für eine Zufallsstichprobe der Größe aus einer Normalverteilung mit Mittelwert und Varianz .X(1)≤X(2)X(1)≤X(2)X_{(1)}\leq X_{(2)}222μμ\muσ2σ2\sigma ^{2} Bewerten Sie , , , und .E(X(1))E⁡(X(1))\operatorname{E}(X_{(1)})E(X(2))E⁡(X(2))\operatorname{E}(X_{(2)})Var(X(1))Var⁡(X(1))\operatorname{Var}(X_{(1)})Var(X(2))Var⁡(X(2))\operatorname{Var}(X_{(2)})Cov(X(1),X(2))Cov⁡(X(1),X(2))\operatorname{Cov}(X_{(1)},X_{(2)}) Mein Versuch: Im Allgemeinen weiß ich für eine Zufallsstichprobe der Größe mit der Verteilungsfunktion und der Dichtefunktion , dass die Gelenkdichtefunktion von durch Insbesondere nach …

1
Identifizierbarkeit in einem nichtlinearen Regressionsproblem
Angenommen, ich arbeite mit dem folgenden Modell yi=α(1−exp(−βti))+γ(1−exp(−δti))+εiyi=α(1−exp⁡(−βti))+γ(1−exp⁡(−δti))+εiy_i = \alpha(1-\exp(-\beta t_i))+\gamma(1-\exp(-\delta t_i)) + \varepsilon_i. Das εiεi\varepsilon_i sind iid Gauß mit dem Mittelwert Null und ich versuche, die besten Anpassungswerte von zu finden α,β,γ,δα,β,γ,δ\alpha,\beta,\gamma,\delta. Nehmen wir zur Verdeutlichung an, dies ist ein Modell für die Gesamtmenge einiger Bakterienarten mit zwei Unterarten, …

3
Berechnung der Aktualisierung des Akteursgradienten im DDPG-Algorithmus (Deep Deterministic Policy Gradient)
Diese Frage bezieht sich auf das Deepmind-Papier zu DDPG: https://arxiv.org/pdf/1509.02971v5.pdf . Die meisten (alle?) Implementierungen des DDPG-Algorithmus, die ich gesehen habe, berechnen die Gradientenaktualisierung für das Akteursnetzwerk durch ∇(J)=∇μ(s|θ)(Q(s,μ(s|θ))∇θ(μ(s|θ))∇(J)=∇μ(s|θ)(Q(s,μ(s|θ))∇θ(μ(s|θ))\nabla(J)=\nabla_{\mu(s|\theta)}(Q(s,\mu(s|\theta))\nabla_{\theta}(\mu(s|\theta)), wo θθ\theta stellt die Parameter des Akteursnetzwerks dar, μμ\mu repräsentiert das Akteursnetzwerk, QQQ repräsentiert das Kritikernetzwerk und sssrepräsentiert die Zustandseingabe. Ich …

1
Beziehen von auf für Positiv, Erhöhend und Konkav
Die Ankunft von Photonen an einem Pixel in einem Bildsensor ist eine Poisson-verteilte Zufallsvariable, so dass die Eingabe als Poisson rv X \ sim \ mathrm {Poisson} (\ lambda) modelliert werden kann X∼Poisson(λ)X∼Poisson(λ)X\sim \mathrm{Poisson}(\lambda). Da die Eingabe Poisson ist, sind der Mittelwert und die Varianz gleich, so dass E[X]Var[X]=1E[X]Var[X]=1\begin{equation} \frac{\mathbb{E}[X]}{\mathrm{Var}[X]}=1 …

1
Monotones maschinelles Lernen
Ich habe eine binäre Klassifikation ( überwachtes Lernen) Problem, in dem alle meine Funktionen boolean sind mit folgenden Wendung: Ich mag einen Klassifikator lernen , dass ist monoton . Mit anderen Worten, wenn Sie eine Teilmenge von Merkmalen von 0 auf 1 ändern, sollte die Ausgabe des Klassifikators niemals von …

3
Bedeutung der Quadratwurzel von Kovarianz- / Präzisionsmatrizen
Sagen X∈RnX∈RnX \in \mathbb{R}^nist eine Zufallsvariable mit der Kovarianz . Einträge der Kovarianzmatrix sind per Definition Kovarianzen: Es ist auch bekannt, dass Einträge mit der Genauigkeit erfüllen: wobei die rechte Seite die Kovarianz von wobei von allen anderen Variablen abhängig ist.Σ∈Rn×nΣ∈Rn×n\Sigma \in \mathbb{R}^{n\times n}Σi j= C.o v (X.ich,X.j) .Σij=Cov(Xi,Xj). \Sigma_{ij} …

2
Quantile Regression vs OLS für Homoskedastizität
Ich habe eine Frage zum Steigungskoeffizienten von OLS im Vergleich zu dem für die Quantilregression, wenn homoskedastische Fehlerterme auftreten. Das Bevölkerungsmodell könnte folgendermaßen aussehen: yich=β0+β1xich+uichyich=β0+β1xich+uichy_i = \beta_0 + \beta_{1}x_i + u_i wobei iid Fehlerbegriffe sind. Konvergiert der geschätzte Steigungskoeffizient für OLS und für QR für verschiedene Quantile gegen denselben Wert …

2
Wann wird die Ridge-Regression und die Lasso-Regression verwendet? Was kann erreicht werden, wenn diese Techniken anstelle des linearen Regressionsmodells verwendet werden?
Ich freue mich darauf, mehr über die regulierten Regressionstechniken wie Ridge- und Lasso-Regression zu erfahren. Ich würde gerne wissen, was mit diesen Techniken im Vergleich zum linearen Regressionsmodell erreicht werden kann. Auch in welcher Situation sollten wir diese Techniken anwenden. Und was unterscheidet diese beiden Techniken? Ich möchte das Konzept …

1
Optimierung mit orthogonalen Einschränkungen
Ich arbeite an Computer Vision und muss eine Zielfunktion optimieren, die Matrix beinhaltet XXX und Matrix XXX ist eine orthogonale Matrix. maximize f(X)maximize f(X)maximize \ \ f(X) s.t XTX=Is.t XTX=I s.t \ \ X^T X=I Wo IIIist die Einheitsmatrix. Ich lese gerade eine Zeitung und sie sprachen über komplizierte Begriffe …

3
Median> Modus> Mittelwert> Bereich
Meine Frage ist: Gibt es eine Reihe von Daten, die es ermöglichen, dass der Median größer als der Modus, der Modus größer als der Mittelwert und der Mittelwert größer als der Bereich ist? Wenn ja, gibt es ein Muster oder eine bestimmte Eigenschaft eines Datensatzes, um diese Situation zuzulassen (Schiefe …

1
Genauer Unterschied zwischen zweiteiligen Modellen (z. B. Cragg) und Tobit Typ 2-Modellen (z. B. Heckman)
Ich möchte eine Regression durchführen, bei der der DV die Höhe der von Startups erhaltenen Mittel (in USD) ist. Natürlich enthält der DV viele Nullen (~ 55%) und hat eine kontinuierliche Verteilung für y> 0. Im Allgemeinen verstehe ich, dass das Tobit-Modell (oder eine Variation davon) für die Modellierung dieses …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.