Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren



3
Zeitreihenanalyse vs. maschinelles Lernen?
Nur eine allgemeine Frage. Wenn Sie Zeitreihendaten haben, wann ist es besser, Zeitreihentechniken (auch bekannt als ARCH, GARCH usw.) gegenüber maschinellen / statistischen Lerntechniken (KNN, Regression) zu verwenden? Wenn es eine ähnliche Frage gibt, die bei crossvalidated vorhanden ist, weisen Sie mich bitte darauf hin - sie haben gesucht und …

1
Random Forest Probabilistic Prediction gegen Mehrheitswahl
Scikit Learn scheint für die Modellaggregationstechnik eine probabilistische Vorhersage anstelle einer Mehrheitsentscheidung zu verwenden, ohne zu erklären, warum (1.9.2.1. Random Forests). Gibt es eine klare Erklärung dafür, warum? Gibt es außerdem ein gutes Papier oder einen Übersichtsartikel für die verschiedenen Modellaggregationstechniken, die für das Absacken von Random Forest verwendet werden …

3
Wie extrahiere ich Informationen aus einer Streudiagramm-Matrix, wenn Sie große N, diskrete Daten und viele Variablen haben?
Ich spiele mit dem Brustkrebs-Datensatz herum und habe ein Streudiagramm aller Attribute erstellt, um eine Vorstellung davon zu bekommen, welche die meisten Auswirkungen auf die Vorhersage der Klasse malignant(blau) von benign(rot) haben. Ich verstehe, dass die Zeile die x-Achse und die Spalte die y-Achse darstellt, aber ich kann nicht sehen, …


1
Konsistenz von 2SLS mit binärer endogener Variable
Ich habe gelesen, dass der 2SLS-Schätzer auch mit binären endogenen Variablen konsistent ist ( http://www.stata.com/statalist/archive/2004-07/msg00699.html ). In der ersten Stufe wird anstelle eines linearen Modells ein Probit-Behandlungsmodell ausgeführt. Gibt es einen formalen Beweis dafür, dass 2SLS auch dann noch konsistent ist, wenn die 1. Stufe ein Probit- oder Logit-Modell ist? …

2
Die Ausgabe von Scikit SVM in der Klassifizierung mehrerer Klassen ergibt immer die gleiche Bezeichnung
Ich verwende derzeit Scikit Learn mit dem folgenden Code: clf = svm.SVC(C=1.0, tol=1e-10, cache_size=600, kernel='rbf', gamma=0.0, class_weight='auto') und passen Sie dann einen Datensatz mit 7 verschiedenen Beschriftungen an und sagen Sie ihn voraus. Ich habe eine seltsame Ausgabe. Unabhängig davon, welche Kreuzvalidierungstechnik ich verwende, wird das vorhergesagte Etikett auf dem …

2
Regression mit inverser unabhängiger Variable
Nehmen wir an, ich habe einen Vektor abhängiger Variablen und einen Vektor unabhängiger Variablen. Wenn gegen aufgetragen wird , sehe ich, dass zwischen beiden eine lineare Beziehung (Aufwärtstrend) besteht. Dies bedeutet nun auch, dass zwischen und ein linearer Abwärtstrend besteht .NNNYYYNNNXXXYYY1X1X\frac{1}{X}YYYXXX Wenn ich nun die Regression ausführe: und den angepassten …

1
Bayesglm (Arm) gegen MCMCpack
Sowohl bayesglm()(im Arm R-Paket) als auch verschiedene Funktionen im MCMCpack-Paket zielen darauf ab, die Bayes'sche Schätzung verallgemeinerter linearer Modelle durchzuführen, aber ich bin nicht sicher, ob sie tatsächlich dasselbe berechnen. Die MCMCpack-Funktionen verwenden die Markov-Kette Monte Carlo, um eine (abhängige) Probe vom Gelenk posterior für die Modellparameter zu erhalten. bayesglm()auf …

2
Warum Adaboost mit Entscheidungsbäumen?
Ich habe ein wenig über das Verbessern von Algorithmen für Klassifizierungsaufgaben und insbesondere von Adaboost gelesen. Ich verstehe, dass der Zweck von Adaboost darin besteht, mehrere "schwache Lernende" aufzunehmen und durch eine Reihe von Iterationen von Trainingsdaten die Klassifizierer dazu zu bringen, Klassen vorherzusagen, bei denen die Modelle wiederholt Fehler …


1
Verwirrt über die visuelle Erklärung von Eigenvektoren: Wie können visuell unterschiedliche Datensätze dieselben Eigenvektoren haben?
Viele Statistiklehrbücher bieten eine intuitive Illustration der Eigenvektoren einer Kovarianzmatrix: Die Vektoren u und z bilden die Eigenvektoren (also Eigenachsen). Das macht Sinn. Was mich jedoch verwirrt, ist, dass wir Eigenvektoren aus der Korrelationsmatrix extrahieren , nicht die Rohdaten. Darüber hinaus können sehr unterschiedliche Rohdatensätze identische Korrelationsmatrizen aufweisen. Zum Beispiel …


3
K-Mittelwerte für Kosinusähnlichkeiten vs. euklidischen Abstand (LSA)
Ich verwende die latente semantische Analyse, um einen Korpus von Dokumenten im Raum niedrigerer Dimensionen darzustellen. Ich möchte diese Dokumente mit k-means in zwei Gruppen zusammenfassen. Vor einigen Jahren habe ich dies mit Pythons Gensim gemacht und meinen eigenen k-means-Algorithmus geschrieben. Ich habe die Cluster-Schwerpunkte anhand des euklidischen Abstands bestimmt, …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.