Als «regression» getaggte Fragen

Techniken zum Analysieren der Beziehung zwischen einer (oder mehreren) "abhängigen" Variablen und "unabhängigen" Variablen.

1
Beeinflusst das Aufnehmen der Protokolle der abhängigen und / oder unabhängigen Variablen die Modellfehler und damit die Gültigkeit der Inferenz?
Ich sehe oft Leute (Statistiker und Praktiker), die Variablen ohne einen zweiten Gedanken transformieren. Ich hatte immer Angst vor Transformationen, weil ich befürchte, dass sie die Fehlerverteilung ändern und somit zu ungültigen Schlussfolgerungen führen könnten, aber es ist so häufig, dass ich etwas falsch verstehen muss. Angenommen, ich habe ein …

2
Warum erhalte ich keine gleichmäßige p-Wert-Verteilung durch logistische Regression mit zufälligen Prädiktoren?
Der folgende Code generiert einen Satz von Testdaten, die aus einer Reihe von "Signal" -Wahrscheinlichkeiten mit Binomialrauschen bestehen. Der Code verwendet dann 5000 Sätze von Zufallszahlen als "erklärende" Reihen und berechnet den logistischen Regressions-p-Wert für jede. Ich finde, dass die zufälligen Erklärungsreihen in 57% der Fälle bei 5% statistisch signifikant …

2
Verzögerte abhängige Variable in der linearen Regression
Kürzlich habe ich eine Arbeit gelesen, in der in einer Zeitreihe Daten gemäß der Gleichung OLS wurde hier (mit dem Befehl in R) verwendet, um den Koeffizienten von . Ist es statistisch korrekt?Yt=β1Yt−1+β2X+ε.Yt=β1Yt−1+β2X+ε. Y_t=\beta_1 Y_{t−1}+\beta_2X+\varepsilon. lm()Yt−1Yt−1Y_{t-1} Ich verstehe, wenn wir uns mit Zeitreihendaten befassen, bedeutet dies tatsächlich einen ARX-Prozess und …


1
Homoskedastizitätsannahme bei linearer Regression vs. Konzept studentisierter Residuen
Nachdem ich über studentisierte Residuen gelesen habe, verstehe ich nicht, wie die Idee unterschiedlicher Residuenvarianzen, die von bestimmten Werten eines Prädiktors abhängig sind (wie dies durch das Konzept studentisierter Residuen impliziert wird), nicht inhärent im Widerspruch zur Annahme der Homoskedastizität in linearen Regressionsmodellen mit einem einzigen steht Prädiktorvariable.XXX In meinem …



2
Was sind die Motive für die Verwendung der logistischen Funktion als Modell für die binäre Klassifizierung?
Die bei der binären Klassifizierung verwendete logistische Regression verwendet die logistische Funktion als Modell für die zugrunde liegende Wahrscheinlichkeit der Ergebnisvariablen. Es hat einige nützliche und wesentliche Eigenschaften für die Anpassung eines solchen Modells. Zum Beispiel nimmt es monoton zu, es tendiert zu 1, wenn x gegen unendlich tendiert, es …

2
Berechnung der Wahrscheinlichkeit von x1> x2
Ich lerne selbst über die Wahrscheinlichkeit mithilfe von R, linearen Modellen und Wahrscheinlichkeitsberechnungen. Ich bin derzeit nicht sicher, wie ich zwei Vorhersagen aus einem Modell vergleichen kann. Die von mir verwendeten Daten werden (kostenlos) von hier heruntergeladen: wmbriggs.com/public/sat.csv df <- read.csv("sat.csv") # Load data lm <- lm(cgpa~hgpa+sat+ltrs,data=df) # model to …

1
Warum ist die Abweichung für den OLS-Schätzer in Bezug auf die lineare Regression gleich Null?
Ich verstehe das Konzept des Bias-Varianz-Kompromisses. Eine nach meinem Verständnis basierende Verzerrung stellt den Fehler dar, weil ein einfacher Klassifikator (z. B. linear) verwendet wird, um eine komplexe nichtlineare Entscheidungsgrenze zu erfassen. Daher habe ich erwartet, dass der OLS-Schätzer eine hohe Verzerrung und eine geringe Varianz aufweist. Aber ich bin …

1
Warum verbessert die Reduzierung eines Regressionsmodells in ein Klassifizierungsmodell durch Ausgabediskretisierung ein Modell?
Wenn bei Regressionsproblemen die Ausgabe in Bins / Kategorien / Cluster diskretisiert und als Beschriftungen verwendet wird, wird das Modell auf ein Klassifizierungsmodell reduziert. Meine Frage ist: Was ist die theoretische oder angewandte Motivation für diese Reduzierung? In meinen speziellen Experimenten zur Vorhersage des Standorts anhand von Text habe ich …

1
Ist eine auf einem vollständigen (globalen) Regressionsmodell basierende Inferenz angemessen?
Ist eine Schlussfolgerung auf der Grundlage eines vollständigen Modells angemessen und wenn ja, unter welchen Umständen? Angenommen, Sie interessieren sich für die mögliche Beziehung zwischen einer Antwortvariablen und mehreren Kandidaten-Prädiktorvariablen und verwenden eine Form der Regression (z. B. ein verallgemeinertes lineares Modell), um dies zu beantworten. Ein Ansatz, um zu …

1
Poisson-Abweichung (xgboost vs gbm vs Regression)
Ich würde gerne wissen, welches der Abweichungsausdruck in der Poisson-Regression ist, der mit einem xgboostWerkzeug verwendet wird (extreme Gradientenverstärkung). Laut Quellcode lautet die Auswertungsfunktion: struct EvalPoissonNegLogLik : public EvalEWiseBase { const char *Name() const override { return "poisson-nloglik"; } inline bst_float EvalRow(bst_float y, bst_float py) const { const bst_float eps …

3
Ganzzahlige Daten: kategorisch oder kontinuierlich?
Ich frage mich, ob ganzzahlige Prädiktordaten als kategorisch (daher codierungsbedürftig) oder kontinuierlich behandelt werden sollten. Wenn der Bereich eines bestimmten Prädiktors Xbeispielsweise alle Ganzzahlen zwischen 1 und 230 sind, kann ich ihn dann als kontinuierliche Variable behandeln oder sollte ich ihn codieren, um 230 (oder vielleicht 229) neue Dummy-Variablen zu …

3
Wie interpretiere ich Bootstrap?
Ich bin ein echter Neuling, wenn es um Statistik geht, also beurteilen Sie mich und meine Frage bitte nicht;) Ich mache eine lineare Regressionsanalyse mit SPSS und da meine Daten weder normal verteilt sind noch Homoskedastizität aufweisen, habe ich mich für Bootstrapping entschieden. Jetzt bin ich wirklich verwirrt, wenn es …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.