Angenommen , ich habe eine Stichprobe .
Angenommen,
und
Was ist der Unterschied zwischen und ?
Angenommen , ich habe eine Stichprobe .
Angenommen,
und
Was ist der Unterschied zwischen und ?
Antworten:
ist eine Idee - sie existiert in der Praxis nicht wirklich. Wenn jedoch die Gauß-Markov-Annahme zutrifft, würde β 1 Ihnen diese optimale Steigung mit Werten darüber und darunter auf einer vertikalen "Schicht" vertikal zur abhängigen Variablen geben, die eine schöne normale Gaußsche Verteilung der Residuen bildet. Β 1 ist die Schätzung von β 1 auf der Probe berechnet.
Die Idee ist, dass Sie mit einer Stichprobe aus einer Population arbeiten. Ihre Probe bildet eine Datenwolke, wenn Sie so wollen. Eine der Dimensionen entspricht der abhängigen Variablen, und Sie versuchen, die Linie anzupassen, die die Fehlerterme minimiert. In OLS ist dies die Projektion der abhängigen Variablen auf den Vektorunterraum, der durch den Spaltenraum der Modellmatrix gebildet wird. Diese Schätzungen der Populationsparameter werden mit dem bezeichneten β - Symbol. Je mehr Datenpunkte Sie haben desto genauer sind die geschätzten Koeffizienten, β i sind, und desto besser ist die Abschätzung dieser idealisierten Population Koeffizienten, β i .
Hier ist der Unterschied in den Steigungen ( gegenüber β ) zwischen der „Population“ in blau, und die Probe in isolierten schwarzen Punkten:
Die Regressionslinie ist gepunktet und schwarz, während die synthetisch perfekte "Populations" -Linie durchgehend blau ist. Die Fülle an Punkten vermittelt ein taktiles Gefühl für die Normalität der Residuenverteilung.
Das "Hut" -Symbol bezeichnet im Allgemeinen eine Schätzung im Gegensatz zum "wahren" Wert. Daher β ist eine Schätzung von β . Einige Symbole haben ihre eigenen Konventionen: die Stichprobenvarianz zum Beispiel oft als geschrieben s 2 , nicht σ 2 , obwohl einige Leute benutzen beide zwischen voreingenommen und unverzerrte Schätzungen zu unterscheiden.
In Ihrem speziellen Fall ist die β sind Werte , Parameterschätzungen für ein lineares Modell. Das lineare Modell nimmt an, dass die Ergebnisvariable Y durch eine lineare Kombination der x i s erzeugt wird, die jeweils mit dem entsprechenden β i -Wert gewichtet sind . In der Praxis sind diese β- Werte natürlich unbekannt und existieren möglicherweise nicht einmal (möglicherweise werden die Daten nicht durch ein lineares Modell erzeugt). Dennoch können wir abschätzen , β - Werte aus den Daten , die ungefähre Y .
Die Gleichung
. Je nachdem, welche statistischen Methoden verwendet werden, können die Schätzungen sehr unterschiedlich sein. In der Regressionseinstellung werden die Schätzungen über eine Methode namens Ordinary Least Squares erhalten. Dies wird auch als Methode der Linie der besten Anpassung bezeichnet. Grundsätzlich müssen Sie die Linie zeichnen, die am besten zu den Daten passt. Ich spreche hier nicht über Formeln, aber wenn Sie die Formel für OLS verwenden, erhalten Sie
und die resultierende Linie der besten Anpassung ist,
