Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Antwortverteilungsabhängige Verzerrung bei der zufälligen Waldregression
Ich verwende das randomForest-Paket in R (R-Version 2.13.1, randomForest-Version 4.6-2) für die Regression und habe eine signifikante Verzerrung in meinen Ergebnissen festgestellt: Der Vorhersagefehler hängt vom Wert der Antwortvariablen ab. Hohe Werte werden unterprognostiziert und niedrige Werte werden überprognostiziert. Zuerst vermutete ich, dass dies eine Folge meiner Daten war, aber …



3
Erwartete bestmögliche Leistung für einen Datensatz
Angenommen, ich habe ein einfaches Problem mit maschinellem Lernen wie eine Klassifizierung. Mit einigen Maßstäben in Bezug auf Vision oder Audioerkennung bin ich als Mensch ein sehr guter Klassifikator. Ich habe daher eine Vorstellung davon, wie gut ein Klassifikator werden kann. Bei vielen Daten ist ein Punkt, dass ich nicht …

2
Anpassen eines gemischten Poisson GLM-Modells mit zufälliger Steigung und Achsenabschnitt
Ich arbeite derzeit an einer Reihe von Poisson-Zeitreihenmodellen, die versuchen, den Effekt einer Änderung der Art und Weise, wie die Zählungen erhalten wurden (Wechsel von einem Diagnosetest zu einem anderen), abzuschätzen und gleichzeitig andere Trends im Laufe der Zeit zu kontrollieren (z. B. eine allgemeine Zunahme der Inzidenz von Krankheiten). …

3
Spline df Auswahl in einem allgemeinen additiven Poisson-Modellproblem
Ich habe einige Zeitreihendaten mit einem allgemeinen additiven Poisson-Modell unter Verwendung von SAS angepasst PROC GAM. Im Allgemeinen habe ich durch das integrierte verallgemeinerte Kreuzvalidierungsverfahren mindestens einen anständigen "Startpunkt" für meinen einzelnen Spline generiert, der eine nichtlineare Funktion der Zeit zusammen mit einem einzelnen parametrischen Term (dem I) ist bin …


1
Welches Modell für einen herausfordernden Datensatz? (Hunderte von Zeitreihen mit viel Verschachtelung)
Ich habe einen ziemlich komplizierten Datensatz zu analysieren und kann keine gute Lösung dafür finden. Hier ist das Ding: 1. Die Rohdaten sind im Wesentlichen Insekten-Song-Aufnahmen. Jedes Lied besteht aus mehreren Bursts und jeder Burst aus Untereinheiten. Alle Personen wurden 5 Minuten lang aufgezeichnet. Die Anzahl der Bursts und ihre …

3
Wie wird der RMSE durch den aufgerufenen Mittelwert normalisiert?
Ich habe den Root Mean Squared Error(RMSE) verwendet, um die Genauigkeit von Werten zu messen, die unter Verwendung eines Modells vorhergesagt wurden. Ich verstehe, dass der zurückgegebene Wert die Einheiten meiner Kennzahlen (anstelle eines Prozentsatzes) verwendet. Ich möchte jedoch meine Werte als Prozentsatz angeben. Der Ansatz, den ich gewählt habe, …

2
Verwenden eines Regressionsmodells zur Vorhersage: Wann aufhören?
Ich habe aus meinen experimentellen Messungen ein einfaches lineares Regressionsmodell berechnet, um Vorhersagen zu treffen. Ich habe gelesen, dass Sie keine Vorhersagen für Punkte berechnen sollten, die zu weit von den verfügbaren Daten abweichen. Ich konnte jedoch keine Anleitung finden, die mir hilft, zu wissen, wie weit ich extrapolieren kann. …

1
Wie passt das Bradley-Terry-Luce-Modell ohne komplizierte Formel in R?
Das Bradley-Terry-Luce (BTL) -Modell besagt, dass , wobei die Wahrscheinlichkeit ist, dass das Objekt als "besser" beurteilt wird. schwerer usw. als Objekt und und sind Parameter.pj i= l o gi t- 1( δj- δich)pjich=lÖGicht- -1(δj- -δich)p_{ji} = logit^{-1}(\delta_j - \delta_i)pi jpichjp_{ij}jjjichichiδichδich\delta_iδjδj\delta_j Dies scheint ein Kandidat für die glm-Funktion mit family …

3
auto.arima warnt NaNs, die bei einem Standardfehler erzeugt wurden
Meine Daten sind eine Zeitreihe der Erwerbsbevölkerung L und der Zeitspanne Jahr. n.auto=auto.arima(log(L),xreg=year) summary(n.auto) Series: log(L) ARIMA(2,0,2) with non-zero mean Coefficients: ar1 ar2 ma1 ma2 intercept year 1.9122 -0.9567 -0.3082 0.0254 -3.5904 0.0074 s.e. NaN NaN NaN NaN 1.6058 0.0008 sigma^2 estimated as 1.503e-06: log likelihood=107.55 AIC=-201.1 AICc=-192.49 BIC=-193.79 In-sample …
9 r  regression  arima 


1
GLM-Poisson mit Offset vorhersagen
Ich weiß, dass dies wahrscheinlich eine grundlegende Frage ist ... Aber ich scheine keine Antwort zu finden. Ich passe ein GLM an eine Poisson-Familie an und habe dann versucht, einen Blick auf die Vorhersagen zu werfen, aber der Offset scheint berücksichtigt zu werden: model_glm=glm(cases~rhs(data$year,2003)+lhs(data$year,2003), offset=(log(population)), data=data, subset=28:36, family=poisson()) predict (model_glm, …

3
Häufiges Denken und Konditionieren von Beobachtungen (Beispiel von Wagenmakers et al.)
Ich bin kein Experte für Statistik, aber es gibt Meinungsverschiedenheiten darüber, ob eine "frequentistische" oder "bayesianische" Interpretation der Wahrscheinlichkeit die "richtige" ist. Von Wagenmakers et. al p. 183: Betrachten Sie eine gleichmäßige Verteilung mit Mittelwert und Breite . Zeichnen Sie zwei Werte zufällig aus dieser Verteilung, beschriften Sie den kleinsten …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.