Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Warum sind die Lernenden beim Boosten „schwach“?
Siehe auch eine ähnliche Frage zu stats.SE . Bei Boosting- Algorithmen wie AdaBoost und LPBoost ist bekannt, dass die zu kombinierenden "schwachen" Lernenden nur bessere Leistungen erbringen müssen als der Zufall, um nützlich zu sein. Die verwendeten Klassifizierer können schwach sein (dh eine erhebliche Fehlerrate aufweisen), aber solange ihre Leistung …


3
Beispiele für Fehler in MCMC-Algorithmen
Ich untersuche eine Methode zur automatischen Überprüfung von Markov-Ketten-Monte-Carlo-Methoden und möchte einige Beispiele für Fehler nennen, die beim Erstellen oder Implementieren solcher Algorithmen auftreten können. Bonuspunkte, wenn die falsche Methode in einem veröffentlichten Artikel verwendet wurde. Ich bin besonders an Fällen interessiert, in denen der Fehler bedeutet, dass die Kette …
28 mcmc 

1
Was steckt hinter der Google Prediction-API?
Google Prediction API ist ein Cloud-Dienst, bei dem Benutzer einige Trainingsdaten übermitteln können, um einen mysteriösen Klassifikator zu trainieren, und ihn später auffordern können, eingehende Daten zu klassifizieren, um beispielsweise Spam-Filter zu implementieren oder Benutzereinstellungen vorherzusagen. Aber was steckt hinter den Kulissen?

4
Pseudo-R-Quadrat-Formel für GLMs
Eine Formel für Pseudo fand ich in dem Buch Extending the Linear Model with R., Julian J. Faraway (S. 59).R2R2R^2 1−ResidualDevianceNullDeviance1−ResidualDevianceNullDeviance1-\frac{\text{ResidualDeviance}}{\text{NullDeviance}} . Ist dies eine gebräuchliche Formel für Pseudo für GLMs?R2R2R^2

5
Welche Gefahren birgt die Verletzung der Homoskedastizitätsannahme für die lineare Regression?
Betrachten Sie als Beispiel den ChickWeightDatensatz in R. Die Varianz wächst offensichtlich mit der Zeit. Wenn ich also eine einfache lineare Regression verwende, wie: m <- lm(weight ~ Time*Diet, data=ChickWeight) Meine Fragen: Welche Aspekte des Modells werden fraglich sein? Beschränken sich die Probleme darauf, außerhalb des TimeBereichs zu extrapolieren ? …



3
Gibt es Standardfunktionen für diskrete Gleichverteilungen in R?
Die meisten Standarddistributionen in R haben eine Befehlsfamilie - pdf / pmf, cdf / cmf, quantile, zufällige Abweichungen (zum Beispiel dnorm, pnorm, qnorm, rnorm). Ich weiß, es ist einfach genug, einige Standardbefehle zu verwenden, um diese Funktionen für die diskreten Gleichverteilungen zu reproduzieren, aber gibt es bereits eine bevorzugte integrierte …

4
Ähnlichkeits- oder Abstandsmaße zwischen zwei Kovarianzmatrizen
Gibt es Ähnlichkeits- oder Abstandsmaße zwischen zwei symmetrischen Kovarianzmatrizen (beide mit den gleichen Abmessungen)? Ich denke hier an Analoga zur KL-Divergenz von zwei Wahrscheinlichkeitsverteilungen oder dem euklidischen Abstand zwischen Vektoren, außer wenn sie auf Matrizen angewendet werden. Ich stelle mir vor, dass es einige Ähnlichkeitsmessungen geben würde. Idealerweise möchte ich …



3
Zeitreihen mit R
Wenn Sie zurückdenken, bis zu dem Zeitpunkt, als Sie mit der Zeitreihenanalyse begonnen haben. Welche Tools, R-Pakete und Internetressourcen hätten Sie gerne gewusst? Was ich versuche zu fragen ist, wo soll man anfangen? Speziell, gibt es irgendwelche Ressourcen für R, die es für jemanden, der "neu" in der Zeitreihenanalyse mit …
28 r  time-series 


3
Berechnung des p-Wertes mit Bootstrap mit R
Ich benutze das "boot" -Paket, um einen ungefähren 2-seitigen Bootstrap-P-Wert zu berechnen, aber das Ergebnis ist zu weit vom P-Wert entfernt, als dass man t.test verwenden könnte. Ich kann nicht herausfinden, was ich in meinem R-Code falsch gemacht habe. Kann mir bitte jemand einen Hinweis dazu geben time = c(14,18,11,13,18,17,21,9,16,17,14,15, …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.