Gibt es eine Faustregel zwischen der Tiefe eines neuronalen Netzwerks und der Lernrate? Mir ist aufgefallen, dass die Lernrate umso niedriger sein muss, je tiefer das Netzwerk ist. Wenn das richtig ist, warum ist das so?
Während ich im Physikunterricht tatsächlich einige Programmierungen mit Boltzmann-Maschinen durchgeführt habe, bin ich mit deren theoretischer Charakterisierung nicht vertraut. Im Gegensatz dazu kenne ich eine bescheidene Menge über die Theorie der grafischen Modelle (über die ersten Kapitel von Lauritzens Buch Graphical Models ). Frage: Gibt es eine sinnvolle Beziehung zwischen …
Ich bin ein arbeitender Datenwissenschaftler mit solider Erfahrung in Regression, anderen Algorithmen vom Typ maschinelles Lernen und Programmierung (sowohl für die Datenanalyse als auch für die allgemeine Softwareentwicklung). Der größte Teil meines Arbeitslebens konzentrierte sich auf das Erstellen von Modellen für die Vorhersagegenauigkeit (Arbeiten unter verschiedenen geschäftlichen Bedingungen) und das …
Ich lese diesen Artikel über den Unterschied zwischen der Analyse von Hauptkomponenten und der Analyse mehrerer Diskriminanten (lineare Diskriminanzanalyse) und versuche zu verstehen, warum Sie jemals PCA anstelle von MDA / LDA verwenden würden. Die Erklärung ist wie folgt zusammengefasst: Grob gesagt versuchen wir in PCA, die Achsen mit maximalen …
Also habe ich zuerst in diesem Forum recherchiert und ich weiß, dass extrem ähnliche Fragen gestellt wurden, aber sie wurden normalerweise nicht richtig beantwortet oder manchmal sind die Antworten einfach nicht detailliert genug, um von mir verstanden zu werden. Diesmal lautet meine Frage also: Ich habe zwei Datensätze, für jeden …
Das „notch“ Hilfedokument ( oder Originaltext ) von boxplot in ‚R‘ gibt die folgenden: Wenn sich die Kerben zweier Diagramme nicht überschneiden, ist dies ein „starker Beweis“ dafür, dass sich die beiden Mediane unterscheiden (Chambers et al., 1983, S. 62). Die verwendeten Berechnungen finden Sie in boxplot.stats. und die ' …
Es gibt wahrscheinlich mehr als ein schwerwiegendes Missverständnis in dieser Frage, aber es ist nicht dazu gedacht, die Berechnungen richtig zu machen, sondern das Lernen von Zeitreihen mit einem gewissen Fokus zu motivieren. Beim Versuch, die Anwendung von Zeitreihen zu verstehen, scheint es, als würde eine Vorhersage der Daten die …
In Baby-Namensforen wiederholen potenzielle Eltern ständig eine Version ihrer Angst vor Jennifer: "Ich möchte nicht, dass mein Kind mit seinem Namen eines von fünf in seiner Klasse ist." Die Sache ist, dass kein Name mehr dieser Popularität nahe kommt, und selbst auf dem Höhepunkt des Jennifer-Wahnsinns haben Sie nicht fünf …
Ich möchte verstehen, wie ich den Prozentsatz der Varianz eines Datensatzes nicht in dem von PCA bereitgestellten Koordinatenraum, sondern gegen einen etwas anderen Satz von (gedrehten) Vektoren erhalten kann. set.seed(1234) xx <- rnorm(1000) yy <- xx * 0.5 + rnorm(1000, sd = 0.6) vecs <- cbind(xx, yy) plot(vecs, xlim = …
In einem Kommentar zu dieser Frage zitierte Benutzer @whuber die Möglichkeit, eine periodische Version von Splines zu verwenden, um periodische Daten anzupassen. Ich würde gerne mehr über diese Methode erfahren, insbesondere über die Gleichungen, die die Splines definieren, und wie man sie in der Praxis implementiert (ich bin meistens ein …
Nach meinem Verständnis unterschätzt die k-fache Kreuzvalidierungsschätzung des Testfehlers normalerweise den tatsächlichen Testfehler. Ich bin verwirrt, warum dies der Fall ist. Ich verstehe, warum der Trainingsfehler normalerweise niedriger ist als der Testfehler - weil Sie das Modell mit denselben Daten trainieren, auf denen Sie den Fehler schätzen! Bei der Kreuzvalidierung …
Angenommen, ist gleichmäßig auf . Lassen und . Zeigen Sie, dass die Korrelation zwischen und Null ist.XXX[0,2π][0,2π][0, 2\pi]Y=sinXY=sinXY = \sin XZ=cosXZ=cosXZ = \cos XYYYZZZ Es scheint, ich müsste die Standardabweichung von Sinus und Cosinus und ihre Kovarianz kennen. Wie kann ich diese berechnen? Ich denke, ich muss annehmen, dass eine …
Sei , , , und sei unabhängig. Was ist die Erwartung von ?X1X1X_1X2X2X_2⋯⋯\cdotsXd∼N(0,1)Xd∼N(0,1)X_d \sim \mathcal{N}(0, 1)X41(X21+⋯+X2d)2X14(X12+⋯+Xd2)2\frac{X_1^4}{(X_1^2 + \cdots + X_d^2)^2} Es ist leicht, durch Symmetrie zu finden. Aber ich weiß nicht, wie ich die Erwartung von . Könnten Sie bitte einige Hinweise geben?E(X21X21+⋯+X2d)=1dE(X12X12+⋯+Xd2)=1d\mathbb{E}\left(\frac{X_1^2}{X_1^2 + \cdots + X_d^2}\right) = \frac{1}{d}X41(X21+⋯+X2d)2X14(X12+⋯+Xd2)2\frac{X_1^4}{(X_1^2 + …
Dies ist der F-Beta-Score: Fβ=(1+β2)⋅precision⋅recall(β2⋅precision)+recallFβ=(1+β2)⋅precision⋅recall(β2⋅precision)+recallF_\beta = (1 + \beta^2) \cdot \frac{\mathrm{precision} \cdot \mathrm{recall}}{(\beta^2 \cdot \mathrm{precision}) + \mathrm{recall}} Der Wikipedia-Artikel besagt, dass .FβFβF_\beta "measures the effectiveness of retrieval with respect to a user who attaches β times as much importance to recall as precision" Ich habe die Idee nicht bekommen. Warum …
Ich versuche gerade, Partikelfilter und ihre möglichen Anwendungen im Finanzbereich zu verstehen, und ich habe ziemlich viel zu kämpfen. Was sind die mathematischen und statistischen Voraussetzungen, die ich überdenken sollte (vor dem Hintergrund der quantitativen Finanzierung), um (i) die Grundlagen von Partikelfiltern zugänglich zu machen und (ii) sie später gründlich …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.