Zufällige Wälder sind dafür bekannt, dass sie bei einer Vielzahl von Aufgaben eine recht gute Leistung erbringen . Gibt es Probleme oder spezielle Bedingungen, unter denen man die Verwendung einer zufälligen Gesamtstruktur vermeiden sollte?
In einem einfachen Regressionsmodell y=β0+β1x+ε,y=β0+β1x+ε, y = \beta_0 + \beta_1 x + \varepsilon, OLS Schätzer ββ^OLS0β^0OLS\hat{\beta}_0^{OLS} und ββ^OLS1β^1OLS\hat{\beta}_1^{OLS} korreliert sind. Die Formel für die Korrelation zwischen den beiden Schätzern lautet (wenn ich sie richtig abgeleitet habe): Corr(β^OLS0,β^OLS1)=−∑ni=1xin−−√∑ni=1x2i−−−−−−−√.Corr(β^0OLS,β^1OLS)=−∑i=1nxin∑i=1nxi2. \operatorname{Corr}(\hat{\beta}_0^{OLS},\hat{\beta}_1^{OLS}) = \frac{-\sum_{i=1}^{n}x_i}{\sqrt{n} \sqrt{\sum_{i=1}^{n}x_i^2} }. Fragen: Was ist die intuitive Erklärung für das …
Ich bin ein Master-CS-Student an einer deutschen Universität und schreibe gerade meine Abschlussarbeit. Ich werde in zwei Monaten fertig sein. Ich muss die sehr schwierige Entscheidung treffen, ob ich weiter promovieren oder einen Job in der Branche finden soll. Meine Gründe für eine Promotion: Ich bin eine sehr neugierige Person …
Ich bin verwirrt über voreingenommene Maximum-Likelihood- Schätzer (ML). Die Mathematik des gesamten Konzepts ist mir ziemlich klar, aber ich kann die intuitive Argumentation dahinter nicht verstehen. Bei einem bestimmten Datensatz, der Stichproben aus einer Verteilung enthält, die selbst eine Funktion eines Parameters ist, den wir schätzen möchten, ergibt der ML-Schätzer …
Ich versuche, die Standardabweichung intuitiver zu verstehen. Soweit ich weiß, ist es repräsentativ für den Durchschnitt der Unterschiede eines Satzes von Beobachtungen in einem Datensatz gegenüber dem Mittelwert dieses Datensatzes. Es entspricht jedoch NICHT den Durchschnittswerten der Differenzen, da Beobachtungen, die weiter vom Mittelwert entfernt sind, mehr Gewicht erhalten. Angenommen, …
Ich verwende derzeit einige lineare Modelle mit gemischten Effekten. Ich benutze das Paket "lme4" in R. Meine Modelle haben die Form: model <- lmer(response ~ predictor1 + predictor2 + (1 | random effect)) Bevor ich meine Modelle ausführte, überprüfte ich die mögliche Multikollinearität zwischen Prädiktoren. Ich habe das gemacht von: …
Betrachten Sie das folgende R-Beispiel: plot( hclust(dist(USArrests), "ave") ) Was genau bedeutet die y-Achse "Höhe"? Blick auf North Carolina und Kalifornien (eher links). Ist Kalifornien North Carolina "näher" als Arizona? Kann ich diese Interpretation machen? Hawaii (rechts) tritt dem Cluster ziemlich spät bei. Ich kann das als "höher" als andere …
Ich möchte eine zufällige Korrelationsmatrix CC\mathbf C einer Größe von erzeugen, n×nn×nn \times nso dass einige mäßig starke Korrelationen vorliegen: quadratische reelle symmetrische Matrix von n×nn×nn \times n Größe, mit zB n=100n=100n=100 ; positiv-definit, dh mit allen Eigenwerten real und positiv; voller Rang; alle diagonalen Elemente sind gleich 111 ; …
Ich habe einen wiederholten Entwurf durchgeführt, bei dem ich 30 Männer und 30 Frauen in drei verschiedenen Aufgaben getestet habe. Ich möchte verstehen, wie unterschiedlich sich Männer und Frauen verhalten und wie das von der jeweiligen Aufgabe abhängt. Ich habe sowohl das lmer- als auch das lme4-Paket verwendet, um dies …
Ich versuche, die Schätzung der Kerneldichte besser zu verstehen. Verwendung der Definition aus Wikipedia: https://en.wikipedia.org/wiki/Kernel_density_estimation#Definition fh^(x)=1n∑ni=1Kh(x−xi)=1nh∑ni=1K(x−xih)fh^(x)=1n∑i=1nKh(x−xi)=1nh∑i=1nK(x−xih) \hat{f_h}(x) = \frac{1}{n}\sum_{i=1}^n K_h (x - x_i) \quad = \frac{1}{nh} \sum_{i=1}^n K\Big(\frac{x-x_i}{h}\Big) Nehmen wir als rechteckige Funktion, die ergibt, wenn zwischen und und andernfalls , und (Fenstergröße) als 1.1 x - 0,5 0,5 0 …
Ich habe einen data.frame mit 800 obs. von 40 Variablen, und möchte die Ergebnisse meiner Vorhersage mithilfe der Hauptkomponentenanalyse verbessern (was bisher mit Support Vector Machine an 15 handverlesenen Variablen am besten funktioniert). Ich verstehe, dass ein prcomp mir helfen kann, meine Vorhersagen zu verbessern, aber ich weiß nicht, wie …
Ich bin Student und habe ein Projekt für meine Wahrscheinlichkeitsklasse. Grundsätzlich habe ich einen Datensatz über die Wirbelstürme, die mein Land mehrere Jahre lang heimgesucht haben. In meinem Wahrscheinlichkeitsbuch (Wahrscheinlichkeit und Statistik mit R) gibt es ein (nicht vollständiges) Beispiel dafür, wie überprüft werden kann, ob die Daten einer Poisson-Verteilung …
Ich untersuche verschiedene Techniken, die beim Clustering von Dokumenten zum Einsatz kommen, und möchte einige Zweifel in Bezug auf PCA (Principal Component Analysis) und LSA (Latent Semantic Analysis) klären. Erste Sache - was sind die Unterschiede zwischen ihnen? Ich weiß, dass in PCA die SVD-Zerlegung auf die Term-Kovarianz-Matrix angewendet wird, …
Ich habe zwei Datensätze, einen aus einer Reihe physikalischer Beobachtungen (Temperaturen) und einen aus einem Ensemble numerischer Modelle. Ich mache eine perfekte Modellanalyse unter der Annahme, dass das Modellensemble eine echte, unabhängige Stichprobe darstellt, und überprüfe, ob die Beobachtungen aus dieser Verteilung stammen. Die von mir berechnete Statistik ist normalisiert …
Ich habe eine Datenanalyse durchgeführt und versucht, Längsschnittdaten mit R und dem kml- Paket zu clustern . Meine Daten enthalten etwa 400 einzelne Flugbahnen (wie es in der Veröffentlichung heißt). Sie können meine Ergebnisse auf dem folgenden Bild sehen: Nach der Lektüre von Kapitel 2.2 „Auswahl einer optimalen Anzahl von …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.