Ich bin gerade auf diese großartige Analyse gestoßen, die sowohl interessant als auch optisch schön ist: http://www.nytimes.com/interactive/2012/11/02/us/politics/paths-to-the-white-house.html Ich bin gespannt, wie ein solcher "Pfadbaum" mit R erstellt werden kann. Welche Daten und Algorithmen braucht man, um einen solchen Pfadbaum zu erstellen? Vielen Dank.
Der AIC ist definiert als , wobei der Maximum-Likelihood-Schätzer und die Dimension des Parameterraums ist. Bei der Schätzung von vernachlässigt man normalerweise den konstanten Faktor der Dichte. Dies ist der Faktor, der nicht von den Parametern abhängt, um die Wahrscheinlichkeit zu vereinfachen. Andererseits ist dieser Faktor für die Berechnung des …
Mein Verständnis ist, dass die zufällige Gesamtstruktur zufällig ausgewählte Variablen auswählt , um jeden Entscheidungsbaum zu erstellen. Wenn also mtry = ncol / 3 ist, wird jede Variable durchschnittlich in 1/3 der Bäume verwendet. Und 2/3 der Bäume werden sie nicht benutzen. Aber was ist, wenn ich weiß, dass eine …
Ich habe Daten mit einer minimalen Anzahl von Features, die sich nicht ändern, und ein paar zusätzlichen Features, die sich ändern und einen großen Einfluss auf das Ergebnis haben können. Mein Datensatz sieht so aus: Merkmale sind A, B, C (immer vorhanden) und D, E, F, G, H (manchmal vorhanden) …
Angenommen, ich habe eine Mischung aus endlich vielen Gaußschen mit bekannten Gewichten, Mittelwerten und Standardabweichungen. Die Mittel sind nicht gleich. Der Mittelwert und die Standardabweichung des Gemisches können natürlich berechnet werden, da die Momente gewichtete Mittelwerte der Momente der Komponenten sind. Die Mischung ist keine Normalverteilung, aber wie weit ist …
Für einen bestimmten Datensatz wird der Spread häufig entweder als Standardabweichung oder als IQR (Interquartilbereich) berechnet. Während a standard deviationnormalisiert ist (z-Scores usw.) und somit zum Vergleich der Streuung aus zwei verschiedenen Populationen verwendet werden kann, ist dies beim IQR nicht der Fall, da die Stichproben aus zwei verschiedenen Populationen …
Ich vergleiche die Größenverteilung von Bäumen in sechs Parzellenpaaren, wobei eine Parzelle eine Behandlung erhielt und die andere eine Kontrolle. Unter Verwendung eines Kolmogorov-Smirnov-Tests für jedes Paar von Parzellen stelle ich fest, dass Bereich von 0,0003707 bis 0,75 liegt . Gibt es geeignete Methoden für den Umgang mit allen Wiederholungen …
Können wir die hintere Wahrscheinlichkeit, die von einem Klassifikator erhalten wird, der einen vorhergesagten Klassenwert und eine Wahrscheinlichkeit ausgibt (zum Beispiel logistische Regression oder Naive Bayes), als eine Art Vertrauensbewertung interpretieren, die diesem vorhergesagten Klassenwert zugewiesen wird?
Ich konnte nicht herausfinden, wie eine lineare Regression in R in für ein Design mit wiederholten Kennzahlen durchgeführt werden kann. In einer früheren Frage (die noch nicht beantwortet wurde) wurde mir vorgeschlagen, keine lmgemischten Modelle zu verwenden , sondern diese zu verwenden. Ich habe es lmfolgendermaßen benutzt: lm.velocity_vs_Velocity_response <- lm(Velocity_response~Velocity*Subject, …
Gibt es einen technischen Trick, um das dritte Quartil zu bestimmen, wenn es zu einem offenen Intervall gehört, das mehr als ein Viertel der Bevölkerung enthält (also kann ich das Intervall nicht schließen und die Standardformel verwenden)? Bearbeiten Falls ich etwas missverstanden habe, werde ich mehr oder weniger vollständigen Kontext …
Ich versuche, anomale Werte in einer Zeitreihe von Klimadaten mit einigen fehlenden Beobachtungen zu ermitteln. Beim Durchsuchen des Webs habe ich viele verfügbare Ansätze gefunden. Von diesen scheint die Zersetzung im Sinne der Entfernung von Trends und saisonalen Bestandteilen und der Untersuchung des Restes ansprechend zu sein. Lesen von STL: …
Ich versuche, eine Kovarianzmatrix zu zerlegen, die auf einem dünn besetzten Datensatz basiert. Ich bemerke, dass die Summe von Lambda (erklärte Varianz), wie sie mit berechnet svdwird, mit zunehmend unsteten Daten verstärkt wird. Ohne Lücken, svdund eigendie gleichen Ergebnisse yeild. Dies scheint bei einer eigenZersetzung nicht zu passieren . Ich …
Könnten Sie mir etwas Klarheit über Data Mining und Algorithmen für künstliche Intelligenz geben? Auf welcher mathematischen Basis haben sie gearbeitet? Können Sie mir einen mathematischen Ansatz geben, um diese Art von Algorithmen zu verstehen?
Ich verwende das randomForest- Paket in R und verwende die Iris-Daten. Die generierte zufällige Gesamtstruktur ist eine Klassifizierung. Wenn ich jedoch einen Datensatz mit ca. 700 Features verwende (die Features sind jeweils Pixel in einem 28 x 28 Pixel großen Bild), wird die Beschriftungsspalte benannt labelist die randomForesterzeugte Regression. Ich …
Würden Sie das HBM vs EB als zwei Alternativen betrachten, bei denen die Hyperparameter "im Spiel" sind, abgetastet / geschätzt / etc. Zu werden? Es besteht eindeutig ein Zusammenhang zwischen diesen beiden. Würden Sie HBM als "voll Bayesianer" betrachten als EB? Gibt es einen Ort, an dem ich sehen kann, …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.