Als «regression» getaggte Fragen

Techniken zum Analysieren der Beziehung zwischen einer (oder mehreren) "abhängigen" Variablen und "unabhängigen" Variablen.

2
Ist die Aufteilung der Daten in Test- und Trainingssätze eine reine Statistiksache?
Ich bin ein Physikstudent, der maschinelles Lernen / Datenwissenschaft studiert, daher meine ich nicht, dass diese Frage Konflikte auslöst :) Ein großer Teil eines Physik-Bachelor-Programms besteht jedoch darin, Labore / Experimente durchzuführen, was eine Menge Daten bedeutet Verarbeitung und statistische Analyse. Ich bemerke jedoch einen starken Unterschied zwischen der Art …

1
Wie man die Ergebnisse interpretiert, wenn sowohl Grat als auch Lasso getrennt gut abschneiden, aber unterschiedliche Koeffizienten erzeugen
Ich führe sowohl mit Lasso als auch mit Ridge ein Regressionsmodell durch (um eine diskrete Ergebnisvariable im Bereich von 0 bis 5 vorherzusagen). Bevor ich das Modell ausführe, verwende ich die SelectKBestMethode scikit-learn, um den Funktionsumfang von 250 auf 25 zu reduzieren . Ohne eine anfängliche Merkmalsauswahl ergeben sowohl Lasso …


2
Wenn die Schrumpfung auf clevere Weise angewendet wird, funktioniert sie für effizientere Schätzer immer besser?
Angenommen , ich habe zwei Schätzern ß 1 und β 2 , die konsistente Schätzer des gleichen Parameters β 0 und so , dass √βˆ1β^1\widehat{\beta}_1βˆ2β^2\widehat{\beta}_2β0β0\beta_0n−−√(βˆ1−β0)→dN(0,V1),n−−√(βˆ2−β0)→dN(0,V2)n(β^1−β0)→dN(0,V1),n(β^2−β0)→dN(0,V2)\sqrt{n}(\widehat{\beta}_1 -\beta_0) \stackrel{d}\rightarrow \mathcal{N}(0, V_1), \quad \sqrt{n}(\widehat{\beta}_2 -\beta_0) \stackrel{d}\rightarrow \mathcal{N}(0, V_2) mitV1≤V2V1≤V2V_1 \leq V_2in dem psd Sinne. Somit asymptotisch β 1ist effizienter als β 2. Diese …

2
Verwenden Sie den Pearson-Korrelationskoeffizienten als Optimierungsziel beim maschinellen Lernen
Beim maschinellen Lernen (für Regressionsprobleme) sehe ich häufig, dass der mittlere quadratische Fehler (MSE) oder der mittlere absolute Fehler (MAE) als Fehlerfunktion zum Minimieren verwendet werden (plus Regularisierungsterm). Ich frage mich, ob es Situationen gibt, in denen die Verwendung des Korrelationskoeffizienten angemessener wäre. Wenn eine solche Situation vorliegt, dann: In …

3
Regression mit verzerrten Daten
Der Versuch, die Anzahl der Besuche anhand der demografischen Daten und des Service zu berechnen. Die Daten sind sehr verzerrt. Histogramme: qq-Diagramme (links ist log): m <- lm(d$Visits~d$Age+d$Gender+city+service) m <- lm(log(d$Visits)~d$Age+d$Gender+city+service) cityund servicesind Faktorvariablen. Ich bekomme einen niedrigen p-Wert *** für alle Variablen, aber ich bekomme auch ein niedriges r-Quadrat …


2
Entscheidungsbäume und Regression - Können vorhergesagte Werte außerhalb des Bereichs der Trainingsdaten liegen?
Kann der vorhergesagte Wert bei Entscheidungsbäumen außerhalb des Bereichs der Trainingsdaten liegen? Wenn der Trainingsdatensatzbereich der Zielvariablen beispielsweise 0-100 beträgt, können meine Werte beim Generieren und Anwenden meines Modells auf etwas anderes -5 sein? oder 150? Da ich die Regression von Entscheidungsbäumen so verstehe, dass sie immer noch auf Regeln …





2
VC-Dimension von Regressionsmodellen
In der Vorlesungsreihe Learning from Data erwähnt der Professor, dass die VC-Dimension die Komplexität des Modells daran misst, wie viele Punkte ein bestimmtes Modell zerbrechen kann. Dies funktioniert also perfekt für Klassifizierungsmodelle, bei denen wir aus N Punkten sagen können, ob der Klassifizierer in der Lage ist, k Punkte effektiv …

2
Wann unterscheiden sich die durch logistische und logitlineare Regression geschätzten Koeffizienten?
Bei der Modellierung kontinuierlicher Proportionen (z. B. proportionale Vegetationsbedeckung bei Erhebungsquadraten oder Anteil der Zeit, die an einer Aktivität beteiligt ist) wird die logistische Regression als unangemessen angesehen (z. B. Warton & Hui (2011). Der Arkussinus ist asinin: die Analyse der Proportionen in der Ökologie ). Vielmehr ist eine OLS-Regression …
11 r  regression  logistic 

1
R - Lasso-Regression - unterschiedliche Lambda pro Regressor
Ich möchte Folgendes tun: 1) OLS-Regression (kein Bestrafungsterm), um Beta-Koeffizienten ; steht für die zur Regression verwendeten Variablen. Ich mache das durch jb∗jbj∗b_{j}^{*}jjj lm.model = lm(y~ 0 + x) betas = coefficients(lm.model) 2) Lasso-Regression mit einem Bestrafungsbegriff, die Auswahlkriterien sind die Bayesian Information Criteria (BIC), angegeben durch λj=log(T)T|b∗j|λj=log⁡(T)T|bj∗|\lambda _{j} = …
11 r  regression  glmnet  lars 

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.