\newcommand{\diag}{\operatorname{diag}} Wir haben das Problem: mit der Annahme, dass: \ sum_ {i = 1} ^ nx_ix_i ^ T = \ diag (\ sigma_1 ^ 2, ..., \ sigma_d ^ 2).minw∈Rd(1n∑i=1n(⟨w,xi⟩−yi)2+2λ||w||1),minw∈Rd(1n∑i=1n(⟨w,xi⟩−yi)2+2λ||w||1),\min_{w\in\mathbb{R}^{d}}\left( \frac{1}{n}\sum_{i=1}^{n} \left( \langle w,x_{i}\rangle-y_{i} \right)^{2} +2\lambda||w||_1\right),∑i=1nxixTi=diag(σ21,...,σ2d).∑i=1nxixiT=diag(σ12,...,σd2).\sum_{i=1}^nx_ix_i^T=\diag(\sigma_1^2,...,\sigma_d^2). Gibt es in diesem Fall eine geschlossene Lösung? Ich habe folgendes: (XTX)−1=diag(σ−21,...,σ−2d),(XTX)−1=diag(σ1−2,...,σd−2),(X^TX)^{-1}=\diag\left(\sigma_1^{-2},...,\sigma_d^{-2}\right), und daher …
Ich versuche zu verstehen, ob die diskrete Fourier-Transformation die gleiche Darstellung einer Kurve wie eine Regression auf Fourier-Basis liefert. Beispielsweise, library(fda) Y=daily$tempav[,1] ## my data length(Y) ## =365 ## create Fourier basis and estimate the coefficients mybasis=create.fourier.basis(c(0,365),365) basisMat=eval.basis(1:365,mybasis) regcoef=coef(lm(Y~basisMat-1)) ## using Fourier transform fftcoef=fft(Y) ## compare head(fftcoef) head(regcoef) FFT gibt …
Ich habe einige Artikel über das manuelle Ausdenken von Bildern gelesen, um ein neuronales Netzwerk zu "täuschen" (siehe unten). Liegt das daran, dass die Netzwerke nur die bedingte Wahrscheinlichkeit modellieren ? Wenn ein Netzwerk die gemeinsame Wahrscheinlichkeit p ( y , x ) modellieren kann , treten solche Fälle dann …
Ich habe in Google, Wikipedia, Google Scholar und anderen Quellen gesucht, aber den Ursprung der Autoencoder nicht gefunden. Vielleicht ist es eines dieser Konzepte, das sich sehr allmählich weiterentwickelt hat, und es ist unmöglich, einen klaren Ausgangspunkt zu finden, aber ich möchte dennoch eine Art Zusammenfassung der wichtigsten Schritte ihrer …
Auf dieser zentralen AP-Seite Random Variables vs. Algebraic Variables unterscheidet der Autor Peter Flanagan-Hyde zwischen algebraischen und zufälligen Variablen. Zum Teil sagt er x+x=2xx+x=2xx + x = 2x , aber X+X≠2XX+X≠2XX + X \neq 2X - in der Tat ist es der Untertitel des Artikels. Was ist der grundlegende Unterschied …
Ich bin neu in der Bayesian Statistics-Forschung. Ich habe von Forschern gehört, dass Bayesianische Forscher MCMC besser selbst implementieren als Tools wie JAGS / Stan. Darf ich fragen, was der Vorteil der Implementierung des MCMC-Algorithmus für sich selbst ist (in "nicht ganz schnellen" Sprachen wie R), außer zu Lernzwecken?
Meiner Meinung nach müssen korrelierte Eingabedaten in neuronalen Netzen zu einer Überanpassung führen, da das Netz die Korrelation lernt, z. B. Rauschen in den Daten. Ist das richtig?
In Bishops Buch über maschinelles Lernen wird das Problem der Kurvenanpassung einer Polynomfunktion an eine Reihe von Datenpunkten erörtert. Sei M die Ordnung des angepassten Polynoms. Es heißt so Wir sehen, dass mit zunehmendem M die Größe der Koeffizienten typischerweise größer wird. Insbesondere für das M = 9 - Polynom …
Ich bin kurz davor, meinen Abschluss in Statistik zu machen, und ich möchte wirklich promovieren, weil ich mathematische Statistik äußerst interessant finde. Forschungsgebiete, in denen ich am liebsten promovieren möchte, sind stochastische Prozesse und Zeitreihen. Ich möchte aber auch nach meiner Promotion eine Karriere in der Privatwirtschaft anstreben. Ich habe …
Beim Initialisieren von Verbindungsgewichtungen in einem vorwärtsgerichteten neuronalen Netzwerk ist es wichtig, sie zufällig zu initialisieren, um Symmetrien zu vermeiden, die der Lernalgorithmus nicht unterbrechen könnte. Die Empfehlung, die ich an verschiedenen Stellen gesehen habe (z. B. in TensorFlows MNIST-Tutorial ), ist die Verwendung der abgeschnittenen Normalverteilung unter Verwendung einer …
Mit zwei Zufallsvariablen ξξ\xi und ηη\eta können wir ihren "Korrelationskoeffizienten" berechnen cccund die Linie der besten Anpassung zwischen diesen beiden Zufallsvariablen bilden. Meine Frage ist warum? 1) Es gibt Zufallsvariablen, ξξ\xi und ηη\eta die in schlechtester Weise abhängig sind, dh und trotzdem . Wenn man nur an lineare Regression denkt, …
Ich möchte wissen, was es ist und wie es sich vom Ensemble unterscheidet. Angenommen, ich möchte für eine bestimmte Aufgabe eine hohe Genauigkeit bei der Klassifizierung und Segmentierung erzielen. Wenn ich dazu verschiedene Netzwerke wie CNN, RNN usw. verwende, wird dies als End-to-End-Modell bezeichnet. (Architektur?) oder nicht?
Ich habe kürzlich einige alte Artikel von Nancy Reid, Barndorff-Nielsen, Richard Cox und, ja, einem kleinen Ronald Fisher über das Konzept der "bedingten Folgerung" im frequentistischen Paradigma besprochen, was zu bedeuten scheint, dass Folgerungen nur auf dem beruhen "relevante Teilmenge" des Probenraums, nicht der gesamte Probenraum. Als Schlüsselbeispiel ist bekannt, …
In seinem Blog schrieb der Physiker Steve Hsu Folgendes: Unter der Annahme einer normalen Verteilung gibt es in den USA nur etwa 10.000 Menschen, die bei + 4SD auftreten, und eine ähnliche Anzahl in Europa. Dies ist also eine recht ausgewählte Population (ungefähr die ersten paar hundert Abiturienten pro Jahr …
Hintergrund: Ich habe kürzlich auf einer tieferen Ebene die Wichtigkeit der Datenerweiterung beim Training von neuronalen Faltungsnetzen verstanden, nachdem ich diesen ausgezeichneten Vortrag von Geoffrey Hinton gesehen habe . Er erklärt, dass Faltungsneuralnetze der aktuellen Generation den Bezugsrahmen des zu testenden Objekts nicht verallgemeinern können, was es einem Netzwerk erschwert, …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.