Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren



1
Ist es eine falsche Idee, standardisierte Koeffizienten zu verwenden, um die relative Bedeutung von Regressionsprädiktoren zu bewerten?
Es gibt verschiedene Fragen, die sich auf die relativen Vorzüge verschiedener Methoden zur Bewertung der Bedeutung von Regressionsprädiktoren beziehen, zum Beispiel diese . Mir ist aufgefallen, dass @gung in diesem Kommentar die Praxis als "falsche Idee" bezeichnet und zur Unterstützung dieser Behauptung auf diese Antwort verweist . Der letzte Absatz …

1
So fügen Sie einen Interaktionsterm in ein zufälliges Waldmodell ein
Ich verwende die Funktion randomForestin Rs randomForestPaket, um eine Regression durchzuführen. Wenn ich jedoch versuche, einen Interaktionsbegriff in die folgenden Codes aufzunehmen: library(MASS) library(randomForest) Boston_f <- within(Boston, factor(rad)) mdl <- randomForest(lstat ~ rad * . , data = Boston_f) Das Ergebnis mdl$termbeinhaltet zwar Interaktion, aber wenn ich in die Bäume …


2
Einbeziehung der Wahrscheinlichkeitsverteilung früherer Klassen in die logistische Regression
Ich bin erstaunt, dass ich keine Artikel / Vorträge darüber finden kann, wie man Prior Class Probability Distributions in Klassifikatoren wie Logistic Regression oder Random Forest integrieren kann. Meine Frage lautet also: Wie kann die Wahrscheinlichkeitsverteilung früherer Klassen in logistische Regression oder zufällige Wälder einbezogen werden? Bedeutet die Einbeziehung der …

1
Modellbau: Wie baue ich ein aussagekräftiges Spielmodell? (verallgemeinertes additives Modell)
Ich habe gesehen, dass es verschiedene Fragen bezüglich der Interpretation und Konstruktion von Gams gibt, was die Schwierigkeit für Nicht-Statistiker zu veranschaulichen scheint, mit diesen umzugehen. Leider konnte ich aus keinem der von mir gelesenen Threads oder Tutorials ein klares Verständnis dafür gewinnen, wie man ein aussagekräftiges Modell erstellt. Derzeit …


1
Was ist der Gradienten-Log-Normalisierer?
Im Wiki wird die Softmax-Funktion als Gradient-Log-Normalisierer der kategorialen Wahrscheinlichkeitsverteilung definiert . Eine teilweise Erklärung zum Log-Normalizer finden Sie hier , aber wofür steht der Gradient-Log-Normalizer ?
9 softmax 

3
Stichprobeneffekte auf Zeitreihenmodelle
Ich arbeite intensiv mit finanziellen Zeitreihenmodellen, hauptsächlich AR (I) MA und Kalman. Ein Problem, mit dem ich immer wieder konfrontiert bin, ist die Abtastfrequenz. Anfangs dachte ich, wenn ich die Möglichkeit hätte, häufiger von einem zugrunde liegenden Prozess abzutasten, sollte ich so häufig wie möglich abtasten, damit ich eine viel …


4
Matthews Korrelationskoeffizient mit Mehrfachklasse
Der Matthews-Korrelationskoeffizient ( MCCMCC\textrm{MCC} ) ist eine Messung zur Messung der Qualität einer binären Klassifikation ([Wikipedia] [1]). MCCMCC\textrm{MCC} Formulierung wird für die binäre Klassifizierung unter Verwendung von wahr-positiven ( T.P.TPTP ), falsch positiven ( F.P.FPFP ), falsch negativen ( F.N.FNFN ) und wahr-negativen ( T.N.TNTN ) Werten angegeben, wie nachstehend …

1
Welche Beziehung besteht zwischen einer SVM und einem Scharnierverlust?
Mein Kollege und ich versuchen, uns mit dem Unterschied zwischen logistischer Regression und einer SVM auseinanderzusetzen. Offensichtlich optimieren sie verschiedene Zielfunktionen. Ist eine SVM so einfach wie zu sagen, dass sie ein diskriminierender Klassifikator ist, der einfach den Scharnierverlust optimiert? Oder ist es komplexer als das? Wie kommen die Unterstützungsvektoren …



Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.