Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Wie soll ich mit kategorialen Variablen mit mehreren Ebenen umgehen, wenn ich eine Rückwärtseliminierung durchführe?
Ich mache ein einfaches AIC-basiertes Rückwärtseliminierungsmodell, bei dem einige Variablen kategoriale Variablen mit mehreren Ebenen sind. Diese Variablen werden als Satz von Dummy-Variablen modelliert. Sollte ich bei der Rückwärtseliminierung alle Ebenen einer Variablen zusammen entfernen? Oder sollte ich jede Dummy-Variable separat behandeln? Und warum? Als verwandte Frage behandelt Schritt in …

1
Viele binäre Klassifikatoren im Vergleich zu einzelnen Klassifikatoren mit mehreren Klassen
Welche Faktoren sollten bei der Entscheidung, ob mehrere binäre Klassifikatoren oder ein einzelner Klassifikator für mehrere Klassen verwendet werden sollen, berücksichtigt werden? Zum Beispiel baue ich ein Modell, das die Klassifizierung von Handgesten durchführt. Ein einfacher Fall hat 4 Ausgänge: [Keine, thumbs_up, clenched_fist, all_fingers_extended]. Ich sehe zwei Möglichkeiten, dies zu …

1
Was bedeutet "Vanille"?
In maschinellen Lernblogs begegne ich häufig dem Wort "Vanille". Zum Beispiel "Vanilla Gradient Descent" oder "Vanilla Method". Dieser Begriff wird in Optimierungslehrbüchern buchstäblich nie verwendet. In diesem Beitrag heißt es beispielsweise: Dies ist die einfachste Form der Gradientenabstiegstechnik. Vanille bedeutet hier rein / ohne Verfälschung. Sein Hauptmerkmal ist, dass wir …

4
Laut Statsmodels ist ARIMA nicht geeignet, da Serien nicht stationär sind. Wie wird das getestet?
Ich habe eine Zeitreihe, die ich mit Pythons Statistikmodellen ARIMA api modellieren möchte. Wenn ich Folgendes bewerbe: from statsmodels.tsa.arima_model import ARIMA model = ARIMA(data['Sales difference'].dropna(), order=(2, 1, 2)) results_AR = model.fit(disp=-1) Ich erhalte folgende Fehlermeldung: ValueError: The computed initial AR coefficients are not stationary You should induce stationarity, choose a …


5
Welche Verlustfunktion sollte ich für die binäre Erkennung bei Gesichtserkennung / Nicht-Gesichtserkennung in CNN verwenden?
Ich möchte Deep Learning verwenden, um eine binäre Erkennung von Gesichtern / Nicht-Gesichtern zu trainieren. Welchen Verlust soll ich verwenden ? Ich denke, es ist SigmoidCrossEntropyLoss oder Hinge-loss . Stimmt das, aber ich frage mich auch, ob ich Softmax verwenden soll, aber nur mit zwei Klassen?

3
Wie diskutiere ich ein Streudiagramm mit mehreren auftauchenden Linien?
Wir haben zwei Variablen gemessen und das Streudiagramm scheint mehrere "lineare" Modelle nahezulegen. Gibt es eine Möglichkeit, diese Modelle zu destillieren? Es hat sich als schwierig erwiesen, andere unabhängige Variablen zu identifizieren. Beide Variablen sind stark nach links verschoben (in Richtung der kleinen Zahlen), dies ist eine erwartete Verteilung in …



2
Ist die Populationsgröße ein Parameter oder die Stichprobengröße eine Statistik?
Die Definitionen eines Parameters und einer Statistik stimmen ziemlich genau überein: Parameter und Statistiken sind numerische Merkmale oder numerische Zusammenfassungen einer Population bzw. einer Stichprobe für eine bestimmte Studie. Ich denke nicht, dass dies allgemein üblich ist, aber ... Könnte die Populationsgröße als Parameter betrachtet werden? Könnte die Stichprobengröße als …

2
Definition von "Perzentil"
Ich lese jetzt einen Hinweis zur Biostatistik von PMT Education und beachte die folgenden Sätze in Abschnitt 2.7: Ein Baby, das im 50. Massenperzentil geboren wurde, ist schwerer als 50% der Babys. Ein Baby, das im 25. Massenperzentil geboren wurde, ist schwerer als 75% der Babys. Ein Baby, das im …

1
Approximation zweiter Ordnung der Verlustfunktion (Deep Learning Book, 7.33)
In Goodfellow's (2016) Buch über tiefes Lernen sprach er über die Gleichwertigkeit eines frühen Stopps der L2-Regularisierung ( https://www.deeplearningbook.org/contents/regularization.html Seite 247). Die quadratische Approximation der Kostenfunktion jjj ist gegeben durch: J^(θ)=J(w∗)+12(w−w∗)TH(w−w∗)J^(θ)=J(w∗)+12(w−w∗)TH(w−w∗)\hat{J}(\theta)=J(w^*)+\frac{1}{2}(w-w^*)^TH(w-w^*) wobei HHH die hessische Matrix ist (Gl. 7.33). Fehlt dies mittelfristig? Taylorentwicklung sollte sein: f(w+ϵ)=f(w)+f′(w)⋅ϵ+12f′′(w)⋅ϵ2f(w+ϵ)=f(w)+f′(w)⋅ϵ+12f″(w)⋅ϵ2f(w+\epsilon)=f(w)+f'(w)\cdot\epsilon+\frac{1}{2}f''(w)\cdot\epsilon^2

2
Warum werden "Fehler in X" -Modellen nicht häufiger verwendet?
Wenn wir den Standardfehler eines Regressionskoeffizienten berechnen, erklärst wir nicht für die Zufälligkeit in der Design - Matrix XXX . In OLS wir zum Beispiel berechnen var(β^)var(β^)\text{var}(\hat{\beta}) als var((XTX)−1XTY)=σ2(XTX)−1var((XTX)−1XTY)=σ2(XTX)−1\text{var}((X^TX)^{-1}X^TY) = \sigma^2(X^TX)^{-1} Wenn die XXX als zufällig betrachtet würde, würde das Gesetz der Gesamtvarianz in gewissem Sinne auch den zusätzlichen Beitrag …


2
Wie verifizieren Bayesianer ihre Methoden mithilfe von Monte-Carlo-Simulationsmethoden?
Hintergrund : Ich habe einen Doktortitel in Sozialpsychologie, in dem theoretische Statistik und Mathematik in meinen quantitativen Kursen kaum behandelt wurden. Während des Studiums und der Graduiertenschule wurde ich (wahrscheinlich wie viele von Ihnen auch in den Sozialwissenschaften) durch das "klassische" frequentistische Rahmenwerk unterrichtet. Jetzt liebe ich auch R und …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.