In einer Normalverteilung haben wir also zwei Parameter: mean und varance . Im Buch Mustererkennung und maschinelles Lernen taucht plötzlich ein Hyperparameter in den Regularisierungsbegriffen der Fehlerfunktion auf.μμ\muσ2σ2\sigma^2λλ\lambda Was sind Hyperparameter? Warum heißen sie so? Und wie unterscheiden sie sich intuitiv von Parametern im Allgemeinen?
Kann Regularisierung hilfreich sein, wenn wir nur die Modellparameter schätzen (und interpretieren) möchten, nicht aber Prognosen oder Vorhersagen? Ich sehe, wie nützlich Regularisierung / Kreuzvalidierung ist, wenn Sie gute Prognosen für neue Daten erstellen möchten. Aber was ist, wenn Sie traditionelle Wirtschaftswissenschaften betreiben und sich nur für die Schätzung von …
Gibt es ein Wort, das die Umkehrung der Varianz bedeutet? Das heißt, wenn eine hohe Varianz hat, dann hat X eine niedrige ... ? Kein Interesse an einem Beinahe-Antonym (wie 'Übereinstimmung' oder 'Ähnlichkeit'), sondern spezifisch 1 / σ 2 ?XXXXXX……\dots1/σ21/σ21/\sigma^2
Ich bin neu als Fakultätsmitglied in einer mathematischen Abteilung eingestiegen. einer renommierten Institution. Ich werde den Kurs Wahrscheinlichkeitsrechnung und Statistik im Grundstudium unterrichten. Die Institution hat bereits einen Lehrplan für diesen Kurs, mit dem ich nicht sehr zufrieden bin. In diesem Lehrplan wird zuerst die Statistik behandelt, außerdem fehlt ein …
Ich frage mich, warum Überspringen-Gramm für seltene Wörter besser ist als CBOW in word2vec. Ich habe die Behauptung unter https://code.google.com/p/word2vec/ gelesen .
Frequentistische Statistiken sind für mich gleichbedeutend mit dem Versuch, Entscheidungen zu treffen, die für alle möglichen Stichproben gut sind. Dh eine frequentistische Entscheidungsregel sollte immer versuchen, das frequentistische Risiko zu minimieren, das von einer Verlustfunktion und dem wahren Naturzustand \ theta_0 abhängt :Lδδ\deltaLLLθ0θ0\theta_0 Rfreq=Eθ0(L(θ0,δ(Y))Rfreq=Eθ0(L(θ0,δ(Y))R_\mathrm{freq}=\mathbb{E}_{\theta_0}(L(\theta_0,\delta(Y)) Wie hängt die maximale Wahrscheinlichkeitsschätzung mit …
Ich bin neu im maschinellen Lernen und suche nach Datensätzen, mit denen ich die Unterschiede zwischen verschiedenen Algorithmen für maschinelles Lernen (Decision Trees, Boosting, SVM und Neuronale Netze) vergleichen und gegenüberstellen kann. Wo finde ich solche Datensätze? Wonach sollte ich suchen, wenn ich einen Datensatz in Betracht ziehe? Es wäre …
Ich habe theano zum Experimentieren mit LSTMs verwendet und mich gefragt, welche Optimierungsmethoden (SGD, Adagrad, Adadelta, RMSprop, Adam usw.) für LSTMs am besten funktionieren. Gibt es Forschungsarbeiten zu diesem Thema? Hängt die Antwort auch von der Art der Anwendung ab, für die ich das LSTM verwende? In diesem Fall verwende …
Dies mag für viele eine einfache Frage sein, aber hier ist sie: Warum wird Varianz nicht als Differenz zwischen den aufeinander folgenden Werten definiert, anstatt als Differenz zum Durchschnitt der Werte? Dies wäre die logischere Wahl für mich, ich schätze, ich habe offensichtlich einige Nachteile. Vielen Dank BEARBEITEN: Lassen Sie …
In diesem Artikel verknüpft der Autor die lineare Diskriminanzanalyse (LDA) mit der Hauptkomponentenanalyse (PCA). Mit meinen begrenzten Kenntnissen kann ich nicht nachvollziehen, wie LDA PCA ähneln kann. Ich habe immer gedacht, dass LDA eine Art Klassifizierungsalgorithmus ist, ähnlich der logistischen Regression. Ich würde mich über eine Hilfe freuen, um zu …
Der Lernratenparameter ( ) in Gradient Boosting verringert den Beitrag jedes neuen Basismodells - normalerweise eines flachen Baums -, das in der Reihe hinzugefügt wird. Es hat sich gezeigt, dass die Genauigkeit des Testsatzes drastisch erhöht wird, was verständlich ist, da mit kleineren Schritten das Minimum der Verlustfunktion genauer erreicht …
Ich versuche, ein Modell unter Verwendung von Winddaten (0, 359) und Tageszeit (0, 23) anzupassen, befürchte jedoch, dass sie schlecht in eine lineare Regression passen, da sie selbst keine linearen Parameter sind. Ich möchte sie mit Python transformieren. Ich habe einige Erwähnungen gesehen, wie man einen Vektormittelwert berechnet, indem man …
Ich habe ein sehr einfaches Problem, aber ich kann kein passendes Werkzeug finden, um es zu lösen. Ich habe eine Folge von Vektoren gleicher Länge. Jetzt möchte ich LSTM RNN auf dem Zugmuster dieser Sequenzen trainieren und es dann machen, um eine neue Sequenz von Vektoren der Länge basierend auf …
Dieser Beitrag bezieht sich auf ein sich schnell änderndes Ereignis. Ich bin auf eine Frage aus dem Jahr 2012 gestoßen, die eine sehr gute Diskussion über Julia als Alternative zu R / Python für verschiedene Arten von statistischer Arbeit hatte. Hier liegt die ursprüngliche Frage von 2012 über Julias Versprechen …
Ich bin gespannt, wie wichtig der Bias-Knoten für die Wirksamkeit moderner neuronaler Netze ist. Ich kann leicht verstehen, dass es in einem flachen Netzwerk mit nur wenigen Eingabevariablen wichtig sein kann. Moderne neuronale Netze wie das Deep Learning verfügen jedoch häufig über eine große Anzahl von Eingabevariablen, um zu entscheiden, …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.