Als «regression» getaggte Fragen

Techniken zum Analysieren der Beziehung zwischen einer (oder mehreren) "abhängigen" Variablen und "unabhängigen" Variablen.

1
Wie kann man den Theil-Sen-Schätzer effizient berechnen?
Der Theil-Sen-Schätzer ist für mich von Interesse, aber wenn ich ihn selbst implementiere, erhalte ich etwas, das als O (n ^ 2) skaliert. Laut Wikipedia kann es genau in O (n log (n)) berechnet werden. Kann mich jemand auf eine effiziente Implementierung hinweisen (Python oder Mathematica wären am besten, Matlab …

2
Warum sollte
Beide Antworten in diesen Threads, eins und zwei, behaupten, dass transformiert werden sollte, bevor eine andere Transformation auf die Prädiktoren angewendet wird. In der Tat konzentriert sich das Weisberg- Kapitel über Transformationen mehr auf DV als auf Prädiktoren, ebenso wie die Handbuchseite des R-Car-Pakets powerTransform ().Y.YY Wir wissen jedoch, dass …

1
Wie genau wird die Summen- (oder Mittelwert-) Zentrierungsbeschränkung für Splines (auch für Gam von mgcv) durchgeführt?
Der Datenerzeugungsprozess ist:y=sin(x+I(d=0))+sin(x+4∗I(d=1))+I(d=0)z2+3I(d=1)z2+N(0,1)y=sin(x+I(d=0))+sin(x+4∗I(d=1))+I(d=0)z2+3I(d=1)z2+N(0,1)y = \text{sin}\Big(x+I(d=0)\Big) + \text{sin}\Big(x+4*I(d=1)\Big) + I(d=0)z^2 + 3I(d=1)z^2 + \mathbb{N}\left(0,1\right) Sei eine Folge von bis der Länge 100 und d der entsprechende Faktor d \ in \ {0,1 \} . Nehmen Sie alle möglichen Kombinationen von x, z, d , um y zu berechnen : - 4 …


1
Berechnung der inversen Wahrscheinlichkeitsgewichte - bedingte (multivariate) Dichteschätzung?
Die allgemeine Version: Ich muss schätzen, wobei und stetig und multivariat sind. Ich mache es lieber nichtparametrisch, weil ich keine gute funktionale Form im Sinn habe und so etwas wie unvoreingenommen sein muss. Ich wollte einen bedingten Kernel-Dichteschätzer verwenden, aber mir wurde klar, dass ich zuerst quantisieren musste . Dann …

1
Interpretation eines gruppierten Restplots in der logistischen Regression
Ich eine logistische Regression mit unabhängigen Variablen und Beobachtungen durch. Ich bewerte die Modellanpassung, um festzustellen, ob die Daten den Modellannahmen entsprechen, und habe mit dem Paket das folgende gruppierte Restdiagramm erstellt:242424123,996123,996123,996arm R Offensichtlich gibt es einige schlechte Anzeichen in dieser Darstellung: Viele Punkte liegen außerhalb der Konfidenzbänder und die …

4
Auswahl eines Regressionsmodells
Wie kann man objektiv ("algorithmisch" gelesen) ein geeignetes Modell für eine einfache lineare Regression der kleinsten Quadrate mit zwei Variablen auswählen? Angenommen, die Daten scheinen einen quadratischen Trend zu zeigen, und es wird eine Parabel generiert, die recht gut zu den Daten passt. Wie rechtfertigen wir es, dies zur Regression …

1
Simulieren Sie Regressionsdaten, wobei die abhängige Variable nicht normal verteilt ist
Für die Regressionsanalyse ist es häufig hilfreich, den Datengenerierungsprozess zu kennen, um zu überprüfen, wie die verwendete Methode funktioniert. Während es für eine einfache lineare Regression ziemlich einfach ist, dies zu tun, ist dies nicht der Fall, wenn die abhängige Variable einer bestimmten Verteilung folgen muss. Betrachten Sie eine einfache …

1
Versteckte Zustandsmodelle vs. staatenlose Modelle für die Zeitreihenregression
Dies ist eine recht allgemeine Frage: Angenommen, ich möchte ein Modell erstellen, um die nächste Beobachtung basierend auf den vorherigen Beobachtungen vorherzusagen ( kann ein Parameter zur experimentellen Optimierung sein). Wir haben also im Grunde ein Schiebefenster mit Eingabemerkmalen, um die nächste Beobachtung vorherzusagen.N.NNNNNN Ich kann einen Hidden-Markov-Modell-Ansatz verwenden, dh …

1
Testen auf Überdispersion in der logistischen Regression
R in Action (Kabacoff, 2011) schlägt die folgende Routine vor, um die Überdispersion in einer logistischen Regression zu testen: Passen Sie die logistische Regression mithilfe der Binomialverteilung an: model_binom <- glm(Species=="versicolor" ~ Sepal.Width, family=binomial(), data=iris) Anpassung der logistischen Regression mithilfe der Quasibinomverteilung: model_overdispersed <- glm(Species=="versicolor" ~ Sepal.Width, family=quasibinomial(), data=iris) Verwenden …

2
Lineare Regression auf einer Probe, die viele Größenordnungen umfasst
Das Gesetz von Beer aus der Chemie besagt, dass die Absorption einer Flüssigkeit proportional zur Konzentration C ist , also: A = k C Der Standard besteht darin, einen Satz von Lösungen mit bekannten Konzentrationen herzustellen und die Absorption zu messen, um einen Standard zu bilden Kurve '(im Grunde eine …

2
Warum würde ein statistisches Modell bei einem riesigen Datensatz überanpassen?
Für mein aktuelles Projekt muss ich möglicherweise ein Modell erstellen, um das Verhalten einer bestimmten Personengruppe vorherzusagen. Der Trainingsdatensatz enthält nur 6 Variablen (ID dient nur zu Identifikationszwecken): id, age, income, gender, job category, monthly spend in dem monthly spendist die Antwortvariable. Der Trainingsdatensatz enthält jedoch ungefähr 3 Millionen Zeilen, …
8 modeling  large-data  overfitting  clustering  algorithms  error  spatial  r  regression  predictive-models  linear-model  average  measurement-error  weighted-mean  error-propagation  python  standard-error  weighted-regression  hypothesis-testing  time-series  machine-learning  self-study  arima  regression  correlation  anova  statistical-significance  excel  r  regression  distributions  statistical-significance  contingency-tables  regression  optimization  measurement-error  loss-functions  image-processing  java  panel-data  probability  conditional-probability  r  lme4-nlme  model-comparison  time-series  probability  probability  conditional-probability  logistic  multiple-regression  model-selection  r  regression  model-based-clustering  svm  feature-selection  feature-construction  time-series  forecasting  stationarity  r  distributions  bootstrap  r  distributions  estimation  maximum-likelihood  garch  references  probability  conditional-probability  regression  logistic  regression-coefficients  model-comparison  confidence-interval  r  regression  r  generalized-linear-model  outliers  robust  regression  classification  categorical-data  r  association-rules  machine-learning  distributions  posterior  likelihood  r  hypothesis-testing  normality-assumption  missing-data  convergence  expectation-maximization  regression  self-study  categorical-data  regression  simulation  regression  self-study  self-study  gamma-distribution  modeling  microarray  synthetic-data 

1
Fehler bei der linearen Regression / Vorhersage eines realen Datensatzes
Ich habe einen Datensatz, für den ich versuche, eine Regression durchzuführen, und der fehlschlägt. Die Situation: Tausende von Kampfroboterbetreibern kämpfen mit Kampfrobotern untereinander. Einige Kampfroboter sind stark und mächtig, andere sind schwach; Die Starken gewinnen öfter und verursachen mehr Schaden. Die Fähigkeiten der Roboterbediener variieren, wobei die erfahreneren häufiger gewinnen …

1
Robuste monotone Regression in R.
Ich habe die folgende Tabelle in R df <- structure(list(x = structure(c(12458, 12633, 12692, 12830, 13369, 13455, 13458, 13515), class = "Date"), y = c(6080, 6949, 7076, 7818, 0, 0, 10765, 11153)), .Names = c("x", "y"), row.names = c("1", "2", "3", "4", "5", "6", "8", "9"), class = "data.frame") > …

1
Lasso zum negativen binomialen Regressionsmodell
Gibt es überhaupt eine Möglichkeit, LASSO mit negativer Binomialregression auf R durchzuführen? Ich führe eine negative binomiale Regression für meinen Datensatz durch, da die Daten zu verteilt sind, um eine Poisson-Regression zu erzwingen. Inzwischen stehe ich auch vor einem Multikollinearitätsproblem. Ich habe bereits versucht, glmnetmit zu arbeiten family = poisson, …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.