Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Kolmogorov-Smirnov-Test vs. t-Test
Ich habe einige Schwierigkeiten, die Interpretation des 2-Stichproben-KS-Tests zu verstehen und festzustellen, wie sich dieser von einem regulären t-Test zwischen 2 Gruppen unterscheidet. Nehmen wir an, ich habe Männer und Frauen, die eine Aufgabe erledigen, und ich sammle einige Punkte von dieser Aufgabe. Mein letztendliches Ziel ist es festzustellen, ob …

2
bedeutet (x) Operator?
Ich habe das gesehen Betreiber überall in einiger Literatur ich auf Kausalitäts tue (siehe zum Beispiel des Wikipedia - Eintrag ). Ich kann jedoch keine formale und allgemeine Definition dieses Operators finden.do(x)do(x)do(x) Kann mir jemand einen guten Hinweis dazu geben? Ich interessiere mich eher für eine allgemeine Definition als für …

1
Verallgemeinerte additive Modell-Python-Bibliotheken
Ich weiß, dass R gam- und mgcv-Bibliotheken für verallgemeinerte additive Modelle hat. Aber ich habe Schwierigkeiten, ihre Gegenstücke im Python-Ökosystem zu finden (Statistikmodelle haben nur einen Prototyp in der Sandbox). Kennt jemand vorhandene Python-Bibliotheken? Wer weiß, dass dies ein gutes Projekt sein könnte, um Scikit-Lernen zu entwickeln / dazu beizutragen, …
14 gam 

1
GAM vs LOESS vs Splines
Kontext : Ich möchte eine Linie in einem Streudiagramm zeichnen, die nicht parametrisch erscheint, daher verwende ich geom_smooth()in ggplotin R. Es gibt automatisch geom_smooth: method="auto" and size of largest group is >=1000, so using gam with formula: y ~ s(x, bs = "cs"). Use 'method = x' to change the …

5
Ist es besser, eine explorative Datenanalyse nur für den Trainingsdatensatz durchzuführen?
Ich mache eine explorative Datenanalyse (EDA) für einen Datensatz. Dann werde ich einige Features auswählen, um eine abhängige Variable vorherzusagen. Die Frage ist: Soll ich die EDA nur für meinen Trainingsdatensatz durchführen? Oder sollte ich die Trainings- und Testdatensätze zusammenfügen und dann die EDA auf beiden durchführen und die Funktionen …


2
Was ist Thompson Sampling für Laien?
Ich kann Thompson Sampling und seine Funktionsweise nicht verstehen . Ich las über Multi Arm Bandit und nachdem ich den Upper Confidence Bound Algorithmus gelesen hatte, schlugen viele Texte vor, dass Thompson Sampling eine bessere Leistung als UCB erbringt. Was ist Thompson Sampling? Zögern Sie nicht, Referenzartikel zum besseren Verständnis …

3
Ist in einem GLM die Log-Wahrscheinlichkeit des gesättigten Modells immer Null?
Als Teil der Ausgabe eines verallgemeinerten linearen Modells werden die Null- und Restabweichung verwendet, um das Modell zu bewerten. Die Formeln für diese Größen werden häufig als Log-Wahrscheinlichkeit des gesättigten Modells ausgedrückt. Beispiel: /stats//a/113022/22199 , Logistic Regression: So erhalten Sie ein gesättigtes Modell Das gesättigte Modell ist, soweit ich es …


1
Beispiel für eine nicht langschwänzige Verbreitung mit schwerem Schwanz
Aus der Lektüre über Schwere- und Langschwanzverteilungen habe ich verstanden, dass alle Schwere-Verteilungen Schwere-Verteilungen sind , aber nicht alle Schwere-Verteilungen sind Langschwere-Verteilungen . Könnte jemand bitte ein Beispiel geben für: eine kontinuierliche, symmetrische Funktion mit mittlerer Dichte von Null, die langschwänzig ist Eine stetige, symmetrische Funktion mit einer mittleren Dichte …

2
Ausgabe der logistischen Regressionsvorhersage
Ich habe eine logistische Regression mit dem folgenden Code erstellt: full.model.f = lm(Ft_45 ~ ., LOG_D) base.model.f = lm(Ft_45 ~ IP_util_E2pl_m02_flg) step(base.model.f, scope=list(upper=full.model.f, lower=~1), direction="forward", trace=FALSE) Ich habe dann die Ausgabe verwendet, um ein endgültiges Modell zu erstellen: final.model.f = lm(Ft_45 ~ IP_util_E2pl_m02_flg + IP_util_E2_m02_flg + AE_NumVisit1_flg + OP_NumVisit1_m01_flg + …



2
Ist Genauigkeit = 1 - Testfehlerrate
Entschuldigung, wenn dies eine sehr offensichtliche Frage ist, aber ich habe verschiedene Beiträge gelesen und kann anscheinend keine gute Bestätigung finden. Ist bei der Klassifizierung die Genauigkeit eines Klassifikators = 1 - Testfehlerrate ? Ich verstehe, dass die Genauigkeit , aber meine Frage ist, wie genau Genauigkeit und Testfehlerrate zusammenhängen. …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.