Ich mache ein einfaches AIC-basiertes Rückwärtseliminierungsmodell, bei dem einige Variablen kategoriale Variablen mit mehreren Ebenen sind. Diese Variablen werden als Satz von Dummy-Variablen modelliert. Sollte ich bei der Rückwärtseliminierung alle Ebenen einer Variablen zusammen entfernen? Oder sollte ich jede Dummy-Variable separat behandeln? Und warum? Als verwandte Frage behandelt Schritt in …
Welche Faktoren sollten bei der Entscheidung, ob mehrere binäre Klassifikatoren oder ein einzelner Klassifikator für mehrere Klassen verwendet werden sollen, berücksichtigt werden? Zum Beispiel baue ich ein Modell, das die Klassifizierung von Handgesten durchführt. Ein einfacher Fall hat 4 Ausgänge: [Keine, thumbs_up, clenched_fist, all_fingers_extended]. Ich sehe zwei Möglichkeiten, dies zu …
In maschinellen Lernblogs begegne ich häufig dem Wort "Vanille". Zum Beispiel "Vanilla Gradient Descent" oder "Vanilla Method". Dieser Begriff wird in Optimierungslehrbüchern buchstäblich nie verwendet. In diesem Beitrag heißt es beispielsweise: Dies ist die einfachste Form der Gradientenabstiegstechnik. Vanille bedeutet hier rein / ohne Verfälschung. Sein Hauptmerkmal ist, dass wir …
Ich habe eine Zeitreihe, die ich mit Pythons Statistikmodellen ARIMA api modellieren möchte. Wenn ich Folgendes bewerbe: from statsmodels.tsa.arima_model import ARIMA model = ARIMA(data['Sales difference'].dropna(), order=(2, 1, 2)) results_AR = model.fit(disp=-1) Ich erhalte folgende Fehlermeldung: ValueError: The computed initial AR coefficients are not stationary You should induce stationarity, choose a …
Es ist seit geraumer Zeit bekannt, dass das jüngste Alter, in dem sich Schachspieler für den Großmeistertitel qualifizieren konnten, seit den 1950er-Jahren erheblich zurückgegangen ist. Derzeit sind fast 30 Spieler vor ihrem 15. Geburtstag Großmeister geworden . Auf Chess Stack Exchange gibt es jedoch eine Frage: Wie alt ist das …
Ich möchte Deep Learning verwenden, um eine binäre Erkennung von Gesichtern / Nicht-Gesichtern zu trainieren. Welchen Verlust soll ich verwenden ? Ich denke, es ist SigmoidCrossEntropyLoss oder Hinge-loss . Stimmt das, aber ich frage mich auch, ob ich Softmax verwenden soll, aber nur mit zwei Klassen?
Wir haben zwei Variablen gemessen und das Streudiagramm scheint mehrere "lineare" Modelle nahezulegen. Gibt es eine Möglichkeit, diese Modelle zu destillieren? Es hat sich als schwierig erwiesen, andere unabhängige Variablen zu identifizieren. Beide Variablen sind stark nach links verschoben (in Richtung der kleinen Zahlen), dies ist eine erwartete Verteilung in …
Die R-Dokumentation für beide gibt nicht viel Aufschluss. Alles, was ich von diesem Link bekommen kann, ist, dass es in Ordnung sein sollte, einen von beiden zu verwenden. Was ich nicht verstehe ist, warum sie nicht gleich sind. Fakt: Die schrittweise Regressionsfunktion in R, step()verwendet extractAIC(). Interessanterweise führt das Ausführen …
Ich versuche, eine multiple lineare Regression in R mit einer Gleichung wie der folgenden zu schätzen: regr <- lm(rate ~ constant + askings + questions + 0) Fragen und Antworten sind vierteljährliche Datenzeitreihen, die mit erstellt wurden askings <- ts(...). Das Problem ist jetzt, dass ich autokorrelierte Residuen habe. Ich …
Die Definitionen eines Parameters und einer Statistik stimmen ziemlich genau überein: Parameter und Statistiken sind numerische Merkmale oder numerische Zusammenfassungen einer Population bzw. einer Stichprobe für eine bestimmte Studie. Ich denke nicht, dass dies allgemein üblich ist, aber ... Könnte die Populationsgröße als Parameter betrachtet werden? Könnte die Stichprobengröße als …
Ich lese jetzt einen Hinweis zur Biostatistik von PMT Education und beachte die folgenden Sätze in Abschnitt 2.7: Ein Baby, das im 50. Massenperzentil geboren wurde, ist schwerer als 50% der Babys. Ein Baby, das im 25. Massenperzentil geboren wurde, ist schwerer als 75% der Babys. Ein Baby, das im …
In Goodfellow's (2016) Buch über tiefes Lernen sprach er über die Gleichwertigkeit eines frühen Stopps der L2-Regularisierung ( https://www.deeplearningbook.org/contents/regularization.html Seite 247). Die quadratische Approximation der Kostenfunktion jjj ist gegeben durch: J^(θ)=J(w∗)+12(w−w∗)TH(w−w∗)J^(θ)=J(w∗)+12(w−w∗)TH(w−w∗)\hat{J}(\theta)=J(w^*)+\frac{1}{2}(w-w^*)^TH(w-w^*) wobei HHH die hessische Matrix ist (Gl. 7.33). Fehlt dies mittelfristig? Taylorentwicklung sollte sein: f(w+ϵ)=f(w)+f′(w)⋅ϵ+12f′′(w)⋅ϵ2f(w+ϵ)=f(w)+f′(w)⋅ϵ+12f″(w)⋅ϵ2f(w+\epsilon)=f(w)+f'(w)\cdot\epsilon+\frac{1}{2}f''(w)\cdot\epsilon^2
Wenn wir den Standardfehler eines Regressionskoeffizienten berechnen, erklärst wir nicht für die Zufälligkeit in der Design - Matrix XXX . In OLS wir zum Beispiel berechnen var(β^)var(β^)\text{var}(\hat{\beta}) als var((XTX)−1XTY)=σ2(XTX)−1var((XTX)−1XTY)=σ2(XTX)−1\text{var}((X^TX)^{-1}X^TY) = \sigma^2(X^TX)^{-1} Wenn die XXX als zufällig betrachtet würde, würde das Gesetz der Gesamtvarianz in gewissem Sinne auch den zusätzlichen Beitrag …
Ich versuche Bayes Factor (BF) zu verstehen. Ich glaube, sie sind wie das Wahrscheinlichkeitsverhältnis von 2 Hypothesen. Wenn BF also 5 ist, bedeutet dies, dass H1 5-mal wahrscheinlicher ist als H0. Ein Wert von 3-10 zeigt mäßige Hinweise an, während> 10 starke Hinweise anzeigt. Für den P-Wert wird jedoch traditionell …
Hintergrund : Ich habe einen Doktortitel in Sozialpsychologie, in dem theoretische Statistik und Mathematik in meinen quantitativen Kursen kaum behandelt wurden. Während des Studiums und der Graduiertenschule wurde ich (wahrscheinlich wie viele von Ihnen auch in den Sozialwissenschaften) durch das "klassische" frequentistische Rahmenwerk unterrichtet. Jetzt liebe ich auch R und …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.