Ich verwende das randomForest-Paket in R (R-Version 2.13.1, randomForest-Version 4.6-2) für die Regression und habe eine signifikante Verzerrung in meinen Ergebnissen festgestellt: Der Vorhersagefehler hängt vom Wert der Antwortvariablen ab. Hohe Werte werden unterprognostiziert und niedrige Werte werden überprognostiziert. Zuerst vermutete ich, dass dies eine Folge meiner Daten war, aber …
Diese Frage hat hier bereits eine Antwort : Korrelation zwischen kategorialen Variablen (1 Antwort) Geschlossen vor 5 Monaten . Ich weiß, dass wir Spearman Rho verwenden können, um die Korrelation zwischen numerischen Variablen zu messen. Aber wie misst man die Korrelation zwischen kategorialen Variablen?
Angenommen, wir erhalten einen Satz von Daten der Form und . Wir haben die Aufgabe, basierend auf den Werten von vorherzusagen . Wir schätzen zwei Regressionen, bei denen: ( y , x 1 , x 2 , ⋯ , x n - 1 ) y x y(y,x1,x2,⋯,xn)(y,x1,x2,⋯,xn)(y,x_{1},x_{2},\cdots, x_{n})( y, x1, …
Angenommen, ich habe ein einfaches Problem mit maschinellem Lernen wie eine Klassifizierung. Mit einigen Maßstäben in Bezug auf Vision oder Audioerkennung bin ich als Mensch ein sehr guter Klassifikator. Ich habe daher eine Vorstellung davon, wie gut ein Klassifikator werden kann. Bei vielen Daten ist ein Punkt, dass ich nicht …
Ich arbeite derzeit an einer Reihe von Poisson-Zeitreihenmodellen, die versuchen, den Effekt einer Änderung der Art und Weise, wie die Zählungen erhalten wurden (Wechsel von einem Diagnosetest zu einem anderen), abzuschätzen und gleichzeitig andere Trends im Laufe der Zeit zu kontrollieren (z. B. eine allgemeine Zunahme der Inzidenz von Krankheiten). …
Ich habe einige Zeitreihendaten mit einem allgemeinen additiven Poisson-Modell unter Verwendung von SAS angepasst PROC GAM. Im Allgemeinen habe ich durch das integrierte verallgemeinerte Kreuzvalidierungsverfahren mindestens einen anständigen "Startpunkt" für meinen einzelnen Spline generiert, der eine nichtlineare Funktion der Zeit zusammen mit einem einzelnen parametrischen Term (dem I) ist bin …
Ich lese A. Agresti (2007), Eine Einführung in die kategoriale Datenanalyse , 2 .. Ich bin mir nicht sicher, ob ich diesen Absatz (S.106, 4.2.1) richtig verstehe (obwohl es einfach sein sollte): In Tabelle 3.1 zu Schnarchen und Herzerkrankungen im vorherigen Kapitel gaben 254 Probanden an, jede Nacht zu schnarchen, …
Ich habe einen ziemlich komplizierten Datensatz zu analysieren und kann keine gute Lösung dafür finden. Hier ist das Ding: 1. Die Rohdaten sind im Wesentlichen Insekten-Song-Aufnahmen. Jedes Lied besteht aus mehreren Bursts und jeder Burst aus Untereinheiten. Alle Personen wurden 5 Minuten lang aufgezeichnet. Die Anzahl der Bursts und ihre …
Ich habe den Root Mean Squared Error(RMSE) verwendet, um die Genauigkeit von Werten zu messen, die unter Verwendung eines Modells vorhergesagt wurden. Ich verstehe, dass der zurückgegebene Wert die Einheiten meiner Kennzahlen (anstelle eines Prozentsatzes) verwendet. Ich möchte jedoch meine Werte als Prozentsatz angeben. Der Ansatz, den ich gewählt habe, …
Ich habe aus meinen experimentellen Messungen ein einfaches lineares Regressionsmodell berechnet, um Vorhersagen zu treffen. Ich habe gelesen, dass Sie keine Vorhersagen für Punkte berechnen sollten, die zu weit von den verfügbaren Daten abweichen. Ich konnte jedoch keine Anleitung finden, die mir hilft, zu wissen, wie weit ich extrapolieren kann. …
Das Bradley-Terry-Luce (BTL) -Modell besagt, dass , wobei die Wahrscheinlichkeit ist, dass das Objekt als "besser" beurteilt wird. schwerer usw. als Objekt und und sind Parameter.pj i= l o gi t- 1( δj- δich)pjich=lÖGicht- -1(δj- -δich)p_{ji} = logit^{-1}(\delta_j - \delta_i)pi jpichjp_{ij}jjjichichiδichδich\delta_iδjδj\delta_j Dies scheint ein Kandidat für die glm-Funktion mit family …
Meine Daten sind eine Zeitreihe der Erwerbsbevölkerung L und der Zeitspanne Jahr. n.auto=auto.arima(log(L),xreg=year) summary(n.auto) Series: log(L) ARIMA(2,0,2) with non-zero mean Coefficients: ar1 ar2 ma1 ma2 intercept year 1.9122 -0.9567 -0.3082 0.0254 -3.5904 0.0074 s.e. NaN NaN NaN NaN 1.6058 0.0008 sigma^2 estimated as 1.503e-06: log likelihood=107.55 AIC=-201.1 AICc=-192.49 BIC=-193.79 In-sample …
@whuber hat gezeigt, wie multivariate Ergebnisse ( , und y_3 ) für einen Zeitpunkt simuliert werden können.y1y1y_1y2y2y_2y3y3y_3 Wie wir wissen, treten in medizinischen Studien häufig Längsschnittdaten auf. Meine Frage ist, wie man multivariate Ergebnisse mit wiederholten Messungen in R simuliert. Zum Beispiel messen wir wiederholt y1y1y_1 , y2y2y_2 und y3y3y_3 …
Ich weiß, dass dies wahrscheinlich eine grundlegende Frage ist ... Aber ich scheine keine Antwort zu finden. Ich passe ein GLM an eine Poisson-Familie an und habe dann versucht, einen Blick auf die Vorhersagen zu werfen, aber der Offset scheint berücksichtigt zu werden: model_glm=glm(cases~rhs(data$year,2003)+lhs(data$year,2003), offset=(log(population)), data=data, subset=28:36, family=poisson()) predict (model_glm, …
Ich bin kein Experte für Statistik, aber es gibt Meinungsverschiedenheiten darüber, ob eine "frequentistische" oder "bayesianische" Interpretation der Wahrscheinlichkeit die "richtige" ist. Von Wagenmakers et. al p. 183: Betrachten Sie eine gleichmäßige Verteilung mit Mittelwert und Breite . Zeichnen Sie zwei Werte zufällig aus dieser Verteilung, beschriften Sie den kleinsten …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.