Siehe auch eine ähnliche Frage zu stats.SE . Bei Boosting- Algorithmen wie AdaBoost und LPBoost ist bekannt, dass die zu kombinierenden "schwachen" Lernenden nur bessere Leistungen erbringen müssen als der Zufall, um nützlich zu sein. Die verwendeten Klassifizierer können schwach sein (dh eine erhebliche Fehlerrate aufweisen), aber solange ihre Leistung …
Wie erstelle ich Zahlen basierend auf einer beliebigen diskreten Verteilung? Zum Beispiel habe ich eine Reihe von Zahlen, die ich generieren möchte. Angenommen, sie sind wie folgt mit 1-3 gekennzeichnet. 1: 4%, 2: 50%, 3: 46% Grundsätzlich handelt es sich bei den Prozentsätzen um Wahrscheinlichkeiten, mit denen sie in der …
Ich untersuche eine Methode zur automatischen Überprüfung von Markov-Ketten-Monte-Carlo-Methoden und möchte einige Beispiele für Fehler nennen, die beim Erstellen oder Implementieren solcher Algorithmen auftreten können. Bonuspunkte, wenn die falsche Methode in einem veröffentlichten Artikel verwendet wurde. Ich bin besonders an Fällen interessiert, in denen der Fehler bedeutet, dass die Kette …
Google Prediction API ist ein Cloud-Dienst, bei dem Benutzer einige Trainingsdaten übermitteln können, um einen mysteriösen Klassifikator zu trainieren, und ihn später auffordern können, eingehende Daten zu klassifizieren, um beispielsweise Spam-Filter zu implementieren oder Benutzereinstellungen vorherzusagen. Aber was steckt hinter den Kulissen?
Eine Formel für Pseudo fand ich in dem Buch Extending the Linear Model with R., Julian J. Faraway (S. 59).R2R2R^2 1−ResidualDevianceNullDeviance1−ResidualDevianceNullDeviance1-\frac{\text{ResidualDeviance}}{\text{NullDeviance}} . Ist dies eine gebräuchliche Formel für Pseudo für GLMs?R2R2R^2
Betrachten Sie als Beispiel den ChickWeightDatensatz in R. Die Varianz wächst offensichtlich mit der Zeit. Wenn ich also eine einfache lineare Regression verwende, wie: m <- lm(weight ~ Time*Diet, data=ChickWeight) Meine Fragen: Welche Aspekte des Modells werden fraglich sein? Beschränken sich die Probleme darauf, außerhalb des TimeBereichs zu extrapolieren ? …
Es ist hilfreich, den Datenanalysecode von Experten zu studieren. Ich habe kürzlich Github durchgesehen und es gibt eine Reihe von Leuten, die dort Datenanalyse-Code austauschen . Dies beinhaltet einige R-Pakete (die natürlich direkt von CRAN erhältlich sind), aber auch einige Beispiele reproduzierbarer Forschung, insbesondere unter Verwendung von R ( siehe …
Wie wählt man ein Modell aus verschiedenen Modellen aus, die nach verschiedenen Methoden ausgewählt wurden (z. B. Rückwärts- oder Vorwärtsauswahl)? Was ist auch ein sparsames Modell?
Die meisten Standarddistributionen in R haben eine Befehlsfamilie - pdf / pmf, cdf / cmf, quantile, zufällige Abweichungen (zum Beispiel dnorm, pnorm, qnorm, rnorm). Ich weiß, es ist einfach genug, einige Standardbefehle zu verwenden, um diese Funktionen für die diskreten Gleichverteilungen zu reproduzieren, aber gibt es bereits eine bevorzugte integrierte …
Gibt es Ähnlichkeits- oder Abstandsmaße zwischen zwei symmetrischen Kovarianzmatrizen (beide mit den gleichen Abmessungen)? Ich denke hier an Analoga zur KL-Divergenz von zwei Wahrscheinlichkeitsverteilungen oder dem euklidischen Abstand zwischen Vektoren, außer wenn sie auf Matrizen angewendet werden. Ich stelle mir vor, dass es einige Ähnlichkeitsmessungen geben würde. Idealerweise möchte ich …
Ich suche nach einer guten Terminologie, um zu beschreiben, was ich versuche, um die Suche nach Ressourcen zu vereinfachen. Angenommen, ich habe zwei Cluster von Punkten A und B, die jeweils zwei Werten X und Y zugeordnet sind, und ich möchte den "Abstand" zwischen A und B messen, dh wie …
Wenn Sie zurückdenken, bis zu dem Zeitpunkt, als Sie mit der Zeitreihenanalyse begonnen haben. Welche Tools, R-Pakete und Internetressourcen hätten Sie gerne gewusst? Was ich versuche zu fragen ist, wo soll man anfangen? Speziell, gibt es irgendwelche Ressourcen für R, die es für jemanden, der "neu" in der Zeitreihenanalyse mit …
Was sind einige gute Papiere, die Anwendungen von Statistiken beschreiben, die Spaß machen und informativ zu lesen wären? Um ganz klar zu sein, ich suche nicht wirklich Papiere, die neue statistische Methoden beschreiben (z. B. eine Arbeit zur Regression des kleinsten Winkels), sondern Papiere, die beschreiben, wie man reale Probleme …
Ich benutze das "boot" -Paket, um einen ungefähren 2-seitigen Bootstrap-P-Wert zu berechnen, aber das Ergebnis ist zu weit vom P-Wert entfernt, als dass man t.test verwenden könnte. Ich kann nicht herausfinden, was ich in meinem R-Code falsch gemacht habe. Kann mir bitte jemand einen Hinweis dazu geben time = c(14,18,11,13,18,17,21,9,16,17,14,15, …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.