Beim Lesen des Artikels "Forecasting at Scale" (FBProphet-Prognosetool, siehe https://peerj.com/preprints/3190.pdf ) bin ich auf den Begriff "sparse prior" gestoßen . Die Autoren erklären, dass sie einen solchen "spärlichen Prior" bei der Modellierung eines Vektors von Ratenabweichungen von einer skalaren Rate , die ein Modellparameter im logistischen Wachstumsmodell ist.δδ\mathbf{\delta}kkk Verstehe ich …
Ich habe ein ziemlich populäres Papier " ERKLÄREN UND HARNESSEN VON ADVERSARIALEN BEISPIELEN " implementiert und in dem Papier eine kontroverse Zielfunktion trainiert J '' (θ) = αJ (θ) + (1 - α) J '(θ). Es behandelt α als Hyperparameter. α kann 0,1, 0,2, 0,3 usw. sein. Unabhängig von diesem …
Basierend auf dem, was ich gelernt habe, verwenden wir mehrere Filter in einer Conv-Schicht eines CNN, um verschiedene Feature-Detektoren zu lernen. Aber da diese Filter ähnlich angewendet werden (dh verschoben und mit Regionen der Eingabe multipliziert werden), würden sie dann nicht einfach während des Trainings dieselben Parameter lernen? Daher wäre …
Diese Frage wurde hier gestellt, aber niemand gab eine gute Antwort. Ich denke, es ist eine gute Idee, es noch einmal aufzurufen, und ich möchte auch einige weitere Kommentare / Fragen hinzufügen. Die erste Frage ist, was ist der Unterschied zwischen "PLS-Pfadmodellierung" und "PLS-Regression"? Was sind Strukturgleichungsmodellierung (SEM), Pfadmodellierung und …
Ich glaube nicht, dass es eine Antwort auf alle Deep-Learning-Modelle geben kann. Welche der Deep-Learning-Modelle sind parametrisch und welche nicht parametrisch und warum?
Gibt es eine Möglichkeit, für jeden vorhergesagten Wert einen Konfidenzwert (wir können ihn auch als Konfidenzwert oder Wahrscheinlichkeit bezeichnen) zu erhalten, wenn Algorithmen wie Random Forests oder Extreme Gradient Boosting (XGBoost) verwendet werden? Angenommen, dieser Konfidenzwert reicht von 0 bis 1 und zeigt, wie sicher ich in Bezug auf eine …
Soweit ich weiß, normalisiert die Batch-Norm alle Eingabemerkmale einer Schicht auf eine Einheitsnormalverteilung . Der Mittelwert und die Varianz μ , σ 2 werden geschätzt, indem ihre Werte für die aktuelle Mini-Charge gemessen werden.N.( μ = 0 , σ= 1 )N(μ=0,σ=1)\mathcal{N}(\mu=0,\sigma=1)μ , σ2μ,σ2\mu, \sigma^2 Nach der Normalisierung werden die Eingänge …
Ich lese das Kapitel 13 "Adventures in Covariance" in dem ( hervorragenden ) Buch Statistical Rethinking von Richard McElreath, in dem er das folgende hierarchische Modell vorstellt: ( Rist eine Korrelationsmatrix) Der Autor erklärt, dass dies LKJcorrein schwach informativer Prior ist, der als Regularisierungsprior für die Korrelationsmatrix fungiert. Aber warum …
Mir ist bewusst, dass kategoriale Variablen mit k Ebenen mit k-1 Variablen in Dummy-Codierung codiert werden sollten (ähnlich für mehrwertige kategoriale Variablen). Ich habe mich gefragt, wie problematisch eine One-Hot-Codierung (dh die Verwendung von k Variablen) gegenüber einer Dummy-Codierung für verschiedene Regressionsmethoden ist, hauptsächlich lineare Regression, bestrafte lineare Regression (Lasso, …
Warum nehmen p-Werte und ks-Teststatistiken mit zunehmender Stichprobengröße ab? Nehmen Sie diesen Python-Code als Beispiel: import numpy as np from scipy.stats import norm, ks_2samp np.random.seed(0) for n in [10, 100, 1000, 10000, 100000, 1000000]: x = norm(0, 4).rvs(n) y = norm(0, 4.1).rvs(n) print ks_2samp(x, y) Die Ergebnisse sind: Ks_2sampResult(statistic=0.30000000000000004, pvalue=0.67507815371659508) …
Ich habe gerade etwas über das Konzept des Bootstrapens gelernt und eine naive Frage kam mir in den Sinn: Wenn wir immer zahlreiche Bootstrap-Beispiele unserer Daten generieren können, warum sollten wir uns überhaupt die Mühe machen, mehr "echte" Daten zu erhalten? Ich glaube, ich habe eine Erklärung, bitte sagen Sie …
Geschlossen. Diese Frage ist nicht zum Thema . Derzeit werden keine Antworten akzeptiert. Möchten Sie diese Frage verbessern? Aktualisieren Sie die Frage so dass es beim Thema für Kreuz Validated. Geschlossen im vergangenen Jahr . Das Training nach 15 Epochen mit dem CIFAR-10-Datensatz scheint den Validierungsverlust nicht mehr zu verringern …
Bei einem üblichen t-Test der Mittelwerte unter Verwendung der üblichen Hypothesentestmethoden lehnen wir entweder die Null ab oder lehnen die Null nicht ab, akzeptieren jedoch niemals die Null. Ein Grund dafür ist, dass, wenn wir mehr Beweise erhalten würden, dieselbe Effektgröße signifikant werden würde. Aber was passiert bei einem Nicht-Minderwertigkeitstest? …
Ich passe einen Datensatz mit einer binären Zielklasse durch die zufällige Gesamtstruktur an. In Python kann ich das entweder mit dem randomforestclassifier oder dem randomforestregressor machen. Ich kann die Klassifizierung direkt vom randomforestclassifier erhalten oder ich könnte zuerst randomforestregressor ausführen und eine Reihe von geschätzten Punktzahlen zurückerhalten (kontinuierlicher Wert). Dann …
Ich versuche zu verstehen, warum OLS einen voreingenommenen Schätzer für einen AR (1) -Prozess liefert. Betrachten Sie In diesem Modell wird die strikte Exogenität verletzt, dh und sind korreliert, aber und \ epsilon_t sind nicht korreliert . Aber wenn dies zutrifft, warum gilt dann die folgende einfache Ableitung nicht? ytϵtyt-1ϵtytϵt=α+βyt−1+ϵt,∼iidN(0,1).yt=α+βyt−1+ϵt,ϵt∼iidN(0,1). …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.