Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


2
Woher stammt die Terminologie „Receiver Operating Characteristic“ (ROC)?
Keine Entschuldigung: Ich habe nicht versucht, dies zu untersuchen (abgesehen von der Überprüfung der Liste der Fragen im Lebenslauf, sofern diese Frage möglicherweise beantwortet wurde). Ich habe dies letzte Woche im Unterricht unterrichtet, um logistische multiple Regressionsmodelle zu diagnostizieren, und ich habe die Schüler im Voraus gewarnt, dass ich die …
9 logistic  roc  history 

1
Mehr Prädiktoren als Beobachtungen?
Was bedeutet es, wenn Statistiker davon sprechen, mehr Prädiktoren als Beobachtungen in einem Regressionsmodell zu haben? Wie könnte das überhaupt möglich sein? Warum ist es ein Problem bei der Regression? Entschuldigung, ich bin neu in der Quantanalyse und Statistik, also nicht ganz sicher, warum dies der Fall ist? Ich würde …


1
Was bedeutet es, dass die Trainingsdaten durch eine Wahrscheinlichkeitsverteilung über Datensätze generiert werden?
Ich habe das Deep Learning-Buch gelesen und bin auf folgenden Absatz gestoßen (Seite 109, zweiter Absatz): Die Trainings- und Testdaten werden durch eine Wahrscheinlichkeitsverteilung über Datensätze generiert, die als Datengenerierungsprozess bezeichnet wird. Wir machen normalerweise eine Reihe von Annahmen, die zusammen als iid-Annahmen bekannt sind. Diese Annahmen bestehen darin, dass …


2
Anpassung des exponentiellen Zerfalls mit negativen y-Werten
Ich versuche, eine exponentielle Abklingfunktion an y-Werte anzupassen, die bei hohen x-Werten negativ werden, kann meine nlsFunktion jedoch nicht richtig konfigurieren . Ziel Ich interessiere mich für die Steigung der Abklingfunktion (λλ\lambdanach einigen Quellen ). Wie ich diese Steigung erhalte, ist nicht wichtig, aber das Modell sollte so gut wie …
9 r  model  exponential 


2
Eine einfache und klare Erklärung der Gini-Verunreinigung?
Im Zusammenhang mit der Aufteilung des Entscheidungsbaums ist nicht ersichtlich, warum die Gini-Verunreinigung vorliegt i ( t ) = 1 -∑j = 1kp2( j | t )i(t)=1−∑j=1kp2(j|t) i(t)=1-\sum\limits_{j=1}^k p^2(j|t) ist ein Maß für die Verunreinigung des Knotens t . Gibt es eine einfache Erklärung dafür?
9 cart  intuition  gini 

3
Ist Feature Engineering wichtig, wenn Random Forest oder Gradient Boosting durchgeführt werden?
Für lineare Modelle (wie lineare Regression, logistische Regression usw.) ist das Feature-Engineering ein wichtiger Schritt, um die Leistung der Modelle zu verbessern. Meine Frage ist, ist es wichtig, ob wir Feature-Engineering durchführen, während wir zufällige Gesamtstruktur- oder Gradienten-Boosting verwenden? Zugegeben, diese Modelle sind keine Deep-Learning-Modelle. aber , es scheint, dass …

2
ANOVA zum Vergleichen von Modellen
Ich suche auf dieser Seite nach einem Workshop zu GAM in R: http://qcbs.ca/wiki/r_workshop8 Am Ende des Abschnitts 2. Multiple smooth termszeigen sie ein Beispiel, in anovadem drei verschiedene Modelle verglichen werden, um das am besten passende Modell zu ermitteln. Die Ausgabe ist Analysis of Deviance Table Model 1: y ~ …
9 r  anova  gam  mgcv 

1
So wählen Sie den Typ der GAM-Parameter
Ich habe begonnen, mit GAM in R zu arbeiten, und ich habe Simon Woods ausgezeichnetes Buch zum Thema ( "Generalisierte additive Modelle Eine Einführung mit R" ) erworben. Anhand eines seiner Beispiele betrachte ich Folgendes: library(mgcv) data(trees) ct1<-gam(log(Volume) ~ Height + s(Girth), data=trees) Ich habe zwei allgemeine Fragen zu diesem …


2
Wie kann LSTM mehrere Zeitschritte voraussagen?
Ich versuche, ein LSTM für die Vorhersage von Zeitreihen zu verwenden. Die Daten werden einmal pro Minute übertragen, aber ich würde gerne eine Stunde voraussagen. Ich kann mir zwei Möglichkeiten vorstellen, dies zu tun: Zerdrücken Sie die Daten stattdessen in stündliche Daten, wobei Sie den Durchschnitt über jeden Zeitraum von …
9 time-series  lstm  rnn 

4
Wie kann die Kollinearität kategorialer Variablen bei der logistischen Regression vermieden werden?
Ich habe das folgende Problem: Ich führe eine mehrfache logistische Regression für mehrere Variablen durch, von denen jede eine nominelle Skala hat. Ich möchte Multikollinearität in meiner Regression vermeiden. Wenn die Variablen kontinuierlich wären, könnte ich den Varianzinflationsfaktor (VIF) berechnen und nach Variablen mit einem hohen VIF suchen. Wenn die …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.