Wie soll ich das anovaErgebnis beim Vergleich zweier Modelle verstehen ? Beispiel: Res.Df RSS Df Sum of Sq F Pr(>F) 1 9 54.032 2 7 4.632 2 49.4 37.329 0.0001844 *** In der Manpage heißt es: "Berechnen Sie die Analyse von Varianz- (oder Abweichungs-) Tabellen für ein oder mehrere angepasste …
Fragen: Was ist der Unterschied zwischen Boosted Regression Tree (BRT) und Generalized Boosted Models (GBM)? Können sie austauschbar verwendet werden? Ist das eine eine bestimmte Form des anderen? Warum verwendete Ridgeway den Ausdruck "Generalized Boosted Regression Models" (GBM), um zu beschreiben, was Friedman zuvor als "Gradient Boosting Machine" (GBM) vorgeschlagen …
Ich habe einige Vorhersagemodelle, deren Leistung ich zurücktesten möchte (dh ich nehme meinen Datensatz, spule ihn zu einem früheren Zeitpunkt zurück und sehe, wie sich das Modell prospektiv entwickelt hätte). Das Problem ist, dass einige meiner Modelle über einen interaktiven Prozess erstellt wurden. Zum Beispiel habe ich gemäß den Ratschlägen …
In Random Forest wird jeder Baum parallel auf einer eindeutigen Boostrap-Stichprobe der Daten gezüchtet. Da erwartet wird, dass jede Boostrap-Probe ungefähr 63% der eindeutigen Beobachtungen enthält, bleiben ungefähr 37% der Beobachtungen aus, die zum Testen des Baums verwendet werden können. Nun scheint es bei Stochastic Gradient Boosting auch eine -Schätzung …
Ich habe zwei verschiedene Markov-Ketten mit jeweils einem absorbierenden Zustand und einer bekannten Ausgangsposition. Ich möchte die Wahrscheinlichkeit bestimmen, dass Kette 1 in weniger Schritten einen absorbierenden Zustand erreicht als Kette 2. Ich denke, ich kann die Wahrscheinlichkeit berechnen, nach n Schritten einen absorbierenden Zustand in einer bestimmten Kette zu …
Ich möchte Attributgewichte für mein Unähnlichkeitsmaß lernen (ableiten), das ich für das Clustering verwenden kann. Ich habe einige Beispiele von Objektpaaren, die "ähnlich" sind (sich im selben Cluster befinden sollten), sowie einige Beispiele von Objektpaaren, die "nicht ähnlich" sind (sollten nicht sein) im selben Cluster sein). Jedes Objekt hat eine …
Ich habe einen Datensatz mit kontinuierlicher Variable und einer binären Zielvariablen (0 und 1). Ich muss die kontinuierlichen Variablen (für die logistische Regression) in Bezug auf die Zielvariable und mit der Einschränkung diskretisieren, dass die Beobachtungshäufigkeit in jedem Intervall ausgeglichen sein sollte. Ich habe maschinelle Lernalgorithmen wie Chi Merge und …
In diesem Artikel wird behauptet, dass in CART, da bei jedem Schritt eine binäre Aufteilung an einer einzelnen Kovariate durchgeführt wird, alle Aufteilungen orthogonal sind und daher Wechselwirkungen zwischen Kovariaten nicht berücksichtigt werden. Viele sehr ernsthafte Referenzen behaupten jedoch im Gegenteil, dass die hierarchische Struktur eines Baums garantiert, dass Interaktionen …
Bei Fällen mit Lungenkrebs und übereinstimmenden Kontrollen (ohne Lungenkrebs) (Übereinstimmung basierend auf Alter, Geschlecht usw.). Um Beweise für die Auswirkung des Rauchens auf Lungenkrebs zu finden, habe ich den genauen Fisher-Test in der Kontingenztabelle verwendet. Dies berücksichtigte jedoch nicht, dass die Kontrollen und Fälle übereinstimmten. 404040404040 Also habe ich mich …
12 Lehrer unterrichten 600 Schüler. Die 12 von diesen Lehrern unterrichteten Kohorten haben eine Größe von 40 bis 90 Schülern, und wir erwarten systematische Unterschiede zwischen den Kohorten, da Doktoranden überproportional bestimmten Kohorten zugeordnet wurden. Frühere Erfahrungen haben gezeigt, dass die Absolventen im Durchschnitt erheblich höher sind als die Studenten. …
Zum Spaß nehme ich einige Daten von Anrufen aus dem Callcenter, in dem ich arbeite, und versuche, Hypothesentests für sie durchzuführen, insbesondere die Anzahl der in einer Woche eingegangenen Anrufe, und verwende eine Poisson-Verteilung, um sie anzupassen. Aufgrund des Themas meines Jobs gibt es zwei Arten von Wochen. Rufen wir …
Es ist bekannt, dass eine lineare Kombination von 2 zufälligen Normalvariablen auch eine zufällige Normalvariable ist. Gibt es gemeinsame nicht normale Verteilungsfamilien (z. B. Weibull), die diese Eigenschaft ebenfalls teilen? Es scheint viele Gegenbeispiele zu geben. Beispielsweise ist eine lineare Kombination von Uniformen typischerweise nicht einheitlich. Gibt es insbesondere nicht …
Heute bin ich auf das Buch "Informationstheorie: Eine Einführung in ein Tutorial" von James Stone gestoßen und habe ein oder zwei Momente über das Ausmaß der Verwendung der Informationstheorie in der angewandten Datenwissenschaft nachgedacht (wenn Sie mit diesem noch etwas unscharfen Begriff nicht vertraut sind, Denken Sie an Datenanalyse , …
Ich dachte, da von und sie dann unabhängig sindX,YX,YX, YN(0,1)N(0,1)N(0,1) X−2YX−2YX - 2Y hat eine Verteilung von . Dann hat eine Wahrscheinlichkeit von .N(0,5)N(0,5)N(0, 5)X−2Y>0X−2Y>0X-2Y > 01/21/21/2 Das Obige scheint mir richtig zu sein, obwohl es so hätte eine Wahrscheinlichkeit von . Das scheint ein bisschen falsch. Habe ich etwas …
Manchmal nehmen wir an, dass Regressoren fest sind, dh sie sind nicht stochastisch. Ich denke , das bedeutet , dass alle unsere Prädiktoren, Parameterschätzungen usw. bedingungslos sind, oder? Darf ich überhaupt so weit gehen, dass es sich nicht mehr um Zufallsvariablen handelt? Wenn wir andererseits akzeptieren, dass die meisten Regressoren …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.