Ich sehe oft Leute (Statistiker und Praktiker), die Variablen ohne einen zweiten Gedanken transformieren. Ich hatte immer Angst vor Transformationen, weil ich befürchte, dass sie die Fehlerverteilung ändern und somit zu ungültigen Schlussfolgerungen führen könnten, aber es ist so häufig, dass ich etwas falsch verstehen muss. Angenommen, ich habe ein …
Der folgende Code generiert einen Satz von Testdaten, die aus einer Reihe von "Signal" -Wahrscheinlichkeiten mit Binomialrauschen bestehen. Der Code verwendet dann 5000 Sätze von Zufallszahlen als "erklärende" Reihen und berechnet den logistischen Regressions-p-Wert für jede. Ich finde, dass die zufälligen Erklärungsreihen in 57% der Fälle bei 5% statistisch signifikant …
Kürzlich habe ich eine Arbeit gelesen, in der in einer Zeitreihe Daten gemäß der Gleichung OLS wurde hier (mit dem Befehl in R) verwendet, um den Koeffizienten von . Ist es statistisch korrekt?Yt=β1Yt−1+β2X+ε.Yt=β1Yt−1+β2X+ε. Y_t=\beta_1 Y_{t−1}+\beta_2X+\varepsilon. lm()Yt−1Yt−1Y_{t-1} Ich verstehe, wenn wir uns mit Zeitreihendaten befassen, bedeutet dies tatsächlich einen ARX-Prozess und …
In der Statistik stoße ich manchmal auf Symbole, deren Symbol ein "Quadrat" trägt. In anderen Bereichen, wie zum Beispiel der Mechanik, geben Sie die Menge an, die Sie für einen normalen Buchstaben interessiert, und definieren dann Ihre Formeln, sodass Sie sie neu anordnen können, bis die Menge, an der Sie …
Nachdem ich über studentisierte Residuen gelesen habe, verstehe ich nicht, wie die Idee unterschiedlicher Residuenvarianzen, die von bestimmten Werten eines Prädiktors abhängig sind (wie dies durch das Konzept studentisierter Residuen impliziert wird), nicht inhärent im Widerspruch zur Annahme der Homoskedastizität in linearen Regressionsmodellen mit einem einzigen steht Prädiktorvariable.XXX In meinem …
Ich versuche zu verstehen, wie Menschen die Wahrscheinlichkeit für eine einfache lineare Regression ableiten. Nehmen wir an, wir haben nur ein Merkmal x und das Ergebnis y. Ich bezweifle nicht den Ausdruck mit der normalen Dichte selbst und ich bezweifle auch nicht, dass man das Produkt aufgrund der Unabhängigkeit in …
Ich wäre dankbar für Ratschläge, wie ich mit der folgenden Situation umgehen soll: Ich habe eine Zählvariable X und vier binäre Variablen A, B, C, D. Die Zählvariable ist die unabhängige Variable (sie bezieht sich auf die Anzahl der nachteiligen Erfahrungen in der Kindheit ) und die Binärdateien sind abhängige …
Die bei der binären Klassifizierung verwendete logistische Regression verwendet die logistische Funktion als Modell für die zugrunde liegende Wahrscheinlichkeit der Ergebnisvariablen. Es hat einige nützliche und wesentliche Eigenschaften für die Anpassung eines solchen Modells. Zum Beispiel nimmt es monoton zu, es tendiert zu 1, wenn x gegen unendlich tendiert, es …
Ich lerne selbst über die Wahrscheinlichkeit mithilfe von R, linearen Modellen und Wahrscheinlichkeitsberechnungen. Ich bin derzeit nicht sicher, wie ich zwei Vorhersagen aus einem Modell vergleichen kann. Die von mir verwendeten Daten werden (kostenlos) von hier heruntergeladen: wmbriggs.com/public/sat.csv df <- read.csv("sat.csv") # Load data lm <- lm(cgpa~hgpa+sat+ltrs,data=df) # model to …
Ich verstehe das Konzept des Bias-Varianz-Kompromisses. Eine nach meinem Verständnis basierende Verzerrung stellt den Fehler dar, weil ein einfacher Klassifikator (z. B. linear) verwendet wird, um eine komplexe nichtlineare Entscheidungsgrenze zu erfassen. Daher habe ich erwartet, dass der OLS-Schätzer eine hohe Verzerrung und eine geringe Varianz aufweist. Aber ich bin …
Wenn bei Regressionsproblemen die Ausgabe in Bins / Kategorien / Cluster diskretisiert und als Beschriftungen verwendet wird, wird das Modell auf ein Klassifizierungsmodell reduziert. Meine Frage ist: Was ist die theoretische oder angewandte Motivation für diese Reduzierung? In meinen speziellen Experimenten zur Vorhersage des Standorts anhand von Text habe ich …
Ist eine Schlussfolgerung auf der Grundlage eines vollständigen Modells angemessen und wenn ja, unter welchen Umständen? Angenommen, Sie interessieren sich für die mögliche Beziehung zwischen einer Antwortvariablen und mehreren Kandidaten-Prädiktorvariablen und verwenden eine Form der Regression (z. B. ein verallgemeinertes lineares Modell), um dies zu beantworten. Ein Ansatz, um zu …
Ich würde gerne wissen, welches der Abweichungsausdruck in der Poisson-Regression ist, der mit einem xgboostWerkzeug verwendet wird (extreme Gradientenverstärkung). Laut Quellcode lautet die Auswertungsfunktion: struct EvalPoissonNegLogLik : public EvalEWiseBase { const char *Name() const override { return "poisson-nloglik"; } inline bst_float EvalRow(bst_float y, bst_float py) const { const bst_float eps …
Ich frage mich, ob ganzzahlige Prädiktordaten als kategorisch (daher codierungsbedürftig) oder kontinuierlich behandelt werden sollten. Wenn der Bereich eines bestimmten Prädiktors Xbeispielsweise alle Ganzzahlen zwischen 1 und 230 sind, kann ich ihn dann als kontinuierliche Variable behandeln oder sollte ich ihn codieren, um 230 (oder vielleicht 229) neue Dummy-Variablen zu …
Ich bin ein echter Neuling, wenn es um Statistik geht, also beurteilen Sie mich und meine Frage bitte nicht;) Ich mache eine lineare Regressionsanalyse mit SPSS und da meine Daten weder normal verteilt sind noch Homoskedastizität aufweisen, habe ich mich für Bootstrapping entschieden. Jetzt bin ich wirklich verwirrt, wenn es …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.