Aufgrund der geringen Kenntnisse, die ich über MCMC-Methoden (Markov-Kette Monte Carlo) habe, verstehe ich, dass die Probenahme ein entscheidender Teil der oben genannten Technik ist. Die am häufigsten verwendeten Stichprobenverfahren sind Hamilton und Metropolis. Gibt es eine Möglichkeit, maschinelles Lernen oder sogar Tiefenlernen zu nutzen, um einen effizienteren MCMC-Sampler zu …
Wann sollten wir unabhängige Variablen / Features diskretisieren / binieren und wann nicht? Meine Versuche, die Frage zu beantworten: Im Allgemeinen sollten wir nicht binieren, da Binning Informationen verlieren wird. Binning erhöht tatsächlich den Freiheitsgrad des Modells, sodass es nach dem Binning zu einer Überanpassung kommen kann. Wenn wir ein …
Meine Frage entstand aus einer Diskussion mit @whuber in den Kommentaren einer anderen Frage . Konkret lautete der Kommentar von @whuber wie folgt: Ein Grund dafür könnte sein, dass die Annahmen, die einem Korrelationstest und einem Regressionssteigungstest zugrunde liegen, unterschiedlich sind. Selbst wenn wir verstehen, dass Korrelation und Steigung wirklich …
Beschreiben unabhängig und zufällig in der Statistik die gleichen Merkmale? Was ist der Unterschied zwischen ihnen? Wir stoßen oft auf die Beschreibung "zwei unabhängige Zufallsvariablen" oder "Zufallsstichproben". Ich frage mich, was genau der Unterschied zwischen ihnen ist. Kann jemand dies erklären und einige Beispiele geben? Zum Beispiel nicht unabhängiger, aber …
Mein Verständnis ist , dass , selbst wenn nach ordnungsgemäßem Kreuzvalidierung und Modellauswahlverfahren, Überanpassung wird , wenn man sucht nach einem Modell passiert schwer genug , wenn man nicht erlegt Beschränkungen Modellkomplexität, period. Darüber hinaus wird häufig versucht, aus den Daten Strafen für die Modellkomplexität zu lernen, die den Schutz …
Warum verwenden Leute Techniken der quadratischen Programmierung (wie SMO), wenn sie mit kernelisierten SVMs arbeiten? Was ist los mit Gradient Descent? Kann man es nicht mit Kerneln benutzen oder ist es einfach zu langsam (und warum?). Hier ist ein wenig mehr Kontext: Um die SVMs ein bisschen besser zu verstehen, …
Vor kurzem habe ich mich mit dem Erlernen von Boosting-Algorithmen wie Adaboost und Gradienten-Boost befasst, und ich kenne die Tatsache, dass der am häufigsten verwendete schwache Lernende Bäume sind. Ich möchte wirklich wissen, ob es in letzter Zeit einige erfolgreiche Beispiele (ich meine einige Artikel oder Artikel) für die Verwendung …
Was ist "logistisch" an der logistischen Verteilung im gesunden Menschenverstand? Was ist die Etymologie und die lexikalische Begründung für den Namen, nicht nur die reine mathematische Definition?
Ich möchte eine logistische Regression mit unausgeglichenen Daten modellieren (9: 1). Ich wollte die Gewichtsoption in der glmFunktion in R ausprobieren , bin mir aber nicht zu 100% sicher, was sie bewirkt. Nehmen wir an, meine Ausgabevariable ist c(0,0,0,0,0,0,0,0,0,1). jetzt möchte ich der "1" 10 mal mehr gewicht geben. Also …
EDIT: Da diese Frage aufgeblasen wurde, eine Zusammenfassung: Finden verschiedener aussagekräftiger und interpretierbarer Datensätze mit derselben gemischten Statistik (Mittelwert, Median, Mittlerer Bereich und die damit verbundenen Streuungen und Regressionen). Das Anscombe Quartett (siehe ? Purpose hoher Abmessungsdaten zu visualisieren ) ist ein bekanntes Beispiel von vier - Datensätzen mit dem …
Ich las den Bericht über die Siegerlösung eines Kaggle-Wettbewerbs ( Malware Classification ). Der Bericht ist in diesem Forumsbeitrag zu finden . Das Problem war ein Klassifizierungsproblem (neun Klassen, die Metrik war der logarithmische Verlust) mit 10000 Elementen in der Zugmenge, 10000 Elementen in der Testmenge. Während des Wettbewerbs wurden …
Nehmen wir der Einfachheit halber an, ich arbeite am klassischen Beispiel von Spam- / Nicht-Spam-E-Mails. Ich habe 20000 E-Mails. Davon weiß ich, dass 2000 Spam sind, aber ich habe kein Beispiel für Nicht-Spam-E-Mails. Ich möchte vorhersagen, ob es sich bei den verbleibenden 18000 um Spam handelt oder nicht. Im Idealfall …
Ich habe Probleme zu verstehen, was ein Bayes-Bootstrapping-Prozess ist und wie sich dieser von Ihrem normalen Bootstrapping unterscheidet. Und wenn jemand eine intuitive / konzeptionelle Überprüfung und einen Vergleich von beiden anbieten könnte, wäre das großartig. Nehmen wir ein Beispiel. Angenommen, wir haben einen Datensatz X, der [1,2,5,7,3] ist. Wenn …
In vielen Anwendungen des maschinellen Lernens haben die sogenannten Datenerweiterungsmethoden die Erstellung besserer Modelle ermöglicht. Nehmen Sie zum Beispiel einen Trainingssatz mit Bildern von Katzen und Hunden an. Durch Drehen, Spiegeln, Anpassen des Kontrasts usw. ist es möglich, zusätzliche Bilder aus den Originalbildern zu generieren.100100100 Bei Bildern ist die Datenerweiterung …
Ich versuche für mich selbst ein Layout zu erstellen, wenn es angebracht ist, welchen Regressionstyp (geometrisch, Poisson, negatives Binomial) mit Zähldaten innerhalb des GLM-Frameworks zu verwenden (nur 3 der 8 GLM-Verteilungen werden für Zähldaten verwendet, obwohl die meisten davon verwendet werden Ich habe Zentren über die negativen Binomial- und Poisson-Verteilungen …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.