Als «regression» getaggte Fragen

Techniken zum Analysieren der Beziehung zwischen einer (oder mehreren) "abhängigen" Variablen und "unabhängigen" Variablen.

3
Grundlegendes zu Gaußschen Basisfunktionsparametern für die lineare Regression
Ich möchte die Gaußsche Basisfunktion auf eine lineare Regressionsimplementierung anwenden. Leider fällt es mir schwer, ein paar Parameter in der Basisfunktion zu verstehen. Insbesondere und .μμ\muσσ\sigma Mein Datensatz ist eine 10.000 x 31-Matrix. 10.000 Samples und 31 Features. Ich habe gelesen, dass "Jede Basisfunktion den Eingabevektor x in einen Skalarwert …


2
Können wir probabilistische Aussagen mit Vorhersageintervallen treffen?
Ich habe die vielen hervorragenden Diskussionen auf der Website über die Interpretation von Konfidenzintervallen und Vorhersageintervallen gelesen, aber ein Konzept ist immer noch etwas rätselhaft: Betrachten Sie das OLS-Framework und wir haben das angepasste Modell . Wir erhalten ein und werden gebeten, die Antwort vorherzusagen. Wir berechnen und geben als …

5
Wie führt man eine Imputation von Werten in einer sehr großen Anzahl von Datenpunkten durch?
Ich habe einen sehr großen Datensatz und es fehlen ungefähr 5% zufällige Werte. Diese Variablen sind miteinander korreliert. Der folgende Beispiel-R-Datensatz ist nur ein Spielzeugbeispiel mit Dummy-korrelierten Daten. set.seed(123) # matrix of X variable xmat <- matrix(sample(-1:1, 2000000, replace = TRUE), ncol = 10000) colnames(xmat) <- paste ("M", 1:10000, sep …
12 r  random-forest  missing-data  data-imputation  multiple-imputation  large-data  definition  moving-window  self-study  categorical-data  econometrics  standard-error  regression-coefficients  normal-distribution  pdf  lognormal  regression  python  scikit-learn  interpolation  r  self-study  poisson-distribution  chi-squared  matlab  matrix  r  modeling  multinomial  mlogit  choice  monte-carlo  indicator-function  r  aic  garch  likelihood  r  regression  repeated-measures  simulation  multilevel-analysis  chi-squared  expected-value  multinomial  yates-correction  classification  regression  self-study  repeated-measures  references  residuals  confidence-interval  bootstrap  normality-assumption  resampling  entropy  cauchy  clustering  k-means  r  clustering  categorical-data  continuous-data  r  hypothesis-testing  nonparametric  probability  bayesian  pdf  distributions  exponential  repeated-measures  random-effects-model  non-independent  regression  error  regression-to-the-mean  correlation  group-differences  post-hoc  neural-networks  r  time-series  t-test  p-value  normalization  probability  moments  mgf  time-series  model  seasonality  r  anova  generalized-linear-model  proportion  percentage  nonparametric  ranks  weighted-regression  variogram  classification  neural-networks  fuzzy  variance  dimensionality-reduction  confidence-interval  proportion  z-test  r  self-study  pdf 


1
Informationen aus der Hutmatrix für die logistische Regression
Mir ist klar und an mehreren Stellen gut erklärt, welche Informationen die Werte auf der Diagonale der Hutmatrix für die lineare Regression liefern. Die Hutmatrix eines logistischen Regressionsmodells ist mir weniger klar. Ist es identisch mit den Informationen, die Sie durch lineare Regression aus der Hutmatrix erhalten? Dies ist die …

4
Annahmen zur verbleibenden Regressionsverteilung
Warum ist es notwendig, die Verteilungsannahme auf die Fehler zu setzen, dh yi=Xβ+ϵiyi=Xβ+ϵiy_i = X\beta + \epsilon_{i} mitϵi∼N(0,σ2)ϵi∼N(0,σ2)\epsilon_{i} \sim \mathcal{N}(0,\sigma^{2}) . Warum nicht schreiben yi=Xβ+ϵiyi=Xβ+ϵiy_i = X\beta + \epsilon_{i} mityi∼N(Xβ^,σ2)yi∼N(Xβ^,σ2)y_i \sim \mathcal{N}(X\hat{\beta},\sigma^{2}) , wobei in jedem Fall ϵi=yi−y^ϵi=yi−y^\epsilon_i = y_i - \hat{y} . Ich habe gesehen, wie betont wurde, dass …


5
Rekursiver (online) regularisierter Algorithmus der kleinsten Quadrate
Kann mich jemand auf einen (rekursiven) Online-Algorithmus für die Tikhonov-Regularisierung (regularisierte kleinste Quadrate) hinweisen? In einer Offline-Einstellung würde ich Verwendung meines ursprünglichen Datensatzes berechnen, wobei unter Verwendung der n-fachen Kreuzvalidierung gefunden wird. Ein neuer Wert kann für ein gegebenes x mit y = x ^ T \ hat \ beta …

2
Warum testen manche Leute regressionsähnliche Modellannahmen an ihren Rohdaten und andere Leute testen sie an den Residuen?
Ich bin ein Doktorand in experimenteller Psychologie und ich bemühe mich sehr, meine Fähigkeiten und Kenntnisse im Analysieren meiner Daten zu verbessern. Bis zu meinem 5. Jahr in Psychologie dachte ich, dass die regressionsähnlichen Modelle (zB ANOVA) die folgenden Dinge annehmen: Normalität der Daten Varianzhomogenität für die Daten und so …

1
Kriterien für die Auswahl des „besten“ Modells in einem Hidden-Markov-Modell
Ich habe einen Zeitreihendatensatz, an den ich ein Hidden Markov Model (HMM) anpasse, um die Anzahl der latenten Zustände in den Daten abzuschätzen. Mein Pseudocode dafür ist der folgende: for( i in 2 : max_number_of_states ){ ... calculate HMM with i states ... optimal_number_of_states = "model with smallest BIC" ... …

2
Mischmodell mit 1 Beobachtung pro Level
Ich rüste glmereinige Geschäftsdaten mit einem Zufallseffektmodell aus . Ziel ist es, die Vertriebsleistung nach Händlern unter Berücksichtigung regionaler Unterschiede zu analysieren. Ich habe folgende Variablen: distcode: Distributor ID, mit ca. 800 Ebenen region: Geografische ID der obersten Ebene (Norden, Süden, Osten, Westen) zone: Geographie auf mittlerer Ebene region, insgesamt …

2
Zusammenhang und Differenz zwischen Zeitreihen und Regression?
Was sind Beziehung und Unterschied zwischen Zeitreihen und Regression? Ist es für Modelle und Annahmen richtig, dass die Regressionsmodelle die Unabhängigkeit zwischen den Ausgabevariablen für verschiedene Werte der Eingabevariablen annehmen, während das Zeitreihenmodell dies nicht tut? Was sind noch einige andere Unterschiede? Für Methoden von einer Website von Darlington Es …

1
Testen bestimmter Kontraste: Ist das nachweislich ein schweres Problem oder nicht?
Ich habe dies in mathoverflow gepostet und niemand antwortet: Scheffés Methode zur Identifizierung statistisch signifikanter Kontraste ist weithin bekannt. Ein Kontrast zwischen den Mitteln μiμi\mu_i , i=1,…,ri=1,…,ri=1,\ldots,r von rrr Populationen ist eine Linearkombination ∑ri=1ciμi∑i=1rciμich\sum_{i=1}^r c_i \mu_i in der ∑ri=1ci=0∑i=1rci=0\sum_{i=1}^r c_i=0und ein skalares Vielfaches eines Kontrasts ist im Wesentlichen der gleiche …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.