Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Warum ist svm nicht so gut wie ein Entscheidungsbaum für dieselben Daten?
Ich bin neu im maschinellen Lernen und versuche, mit Scikit-Learn (sklearn) ein Klassifizierungsproblem zu lösen. Sowohl DecisionTree als auch SVM können einen Klassifikator für dieses Problem trainieren. Ich verwende sklearn.ensemble.RandomForestClassifierund sklearn.svm.SVCpasse die gleichen Trainingsdaten an (ca. 500.000 Einträge mit 50 Funktionen pro Eintrag). Der RandomForestClassifier bringt in etwa einer Minute …

3
Warum ist in meinen ROC-Kurven ein scharfer Ellbogen?
Ich habe einige EEG-Datensätze, die ich gegen zwei Klassen teste. Ich kann eine anständige Fehlerrate von LDA erhalten (die klassenbedingten Verteilungen sind nicht Gaußsch, haben aber ähnliche Schwänze und eine ausreichend gute Trennung), und deshalb möchte ich den ROC des LDA-Prädiktors gegen Datensätze anderer Subjekte zeichnen. Hier ist ein typisches …

4
Warum in der Bestätigungsfaktoranalyse die Gewichte auf 1 setzen?
Ich schreibe diese Frage unter Bezugnahme auf ein Beispiel auf Seite 138-142 des folgenden Dokuments: ftp://ftp.software.ibm.com/software/analytics/spss/documentation/amos/20.0/de/Manuals/IBM_SPSS_Amos_User_Guide.pdf . Hier sind illustrative Abbildungen und eine Tabelle: Ich verstehe, dass die latente Variable keine natürliche Metrik hat und dass das Laden eines Faktors auf 1 vorgenommen wird, um dieses Problem zu beheben. Es …

2
Wie zeichne ich einen 5D-Datensatz in „Sternkoordinaten“?
Ich lese den Artikel "Sternkoordinaten: Eine mehrdimensionale Visualisierungstechnik mit einheitlicher Behandlung von Dimensionen" und versuche, meine Daten zu zeichnen. Angenommen, ich habe , einen fünfdimensionalen Datenpunkt, und Punkte werden nach der in der Arbeit erläuterten Formel berechnet. A ( 2 , 5 , 3 , 1 , 8 )A(2,5,3,1,8)A(2,5,3,1,8) Die …


1
Vorhersage stark korrelierter Zeitreihen
Bei der Vorhersage von Zeitreihen mit verschiedenen Modellen wie AR, MA, ARMA usw. konzentrieren wir uns normalerweise auf die Modellierung der Daten im Zeitwechsel. Wenn wir jedoch zwei Zeitreihen haben, bei denen der Pearson-Korrelationskoeffizient zeigt, dass sie stark korreliert sind, ist es dann möglich, ihre Abhängigkeits- und Prognosewerte voneinander zu …

1
Lösungen zur ET Jaynes Wahrscheinlichkeitstheorie für das Selbststudium?
Ich mache ein Selbststudium von ETJaynes Wahrscheinlichkeitstheorie, der Logik der Wissenschaft. Ich wollte sehen, dass jemand von einer Webseite weiß, die Lösungen für die Übungen bietet? Ich habe keinen Lehrer oder jemanden, der Erfahrung mit diesem Buch hat. Ich muss sicherstellen, dass meine Lösungen für sie korrekt sind.


2
Berechnung der Wahrscheinlichkeit, wenn
Ich versuche diese hintere Verteilung zu berechnen: (θ|−)=∏ni=1pyii(1−pi)1−yi∑allθ,pi|θ∏ni=1pyii(1−pi)1−yi(θ|−)=∏i=1npiyi(1−pi)1−yi∑allθ,pi|θ∏i=1npiyi(1−pi)1−yi (\theta|-)=\frac{\prod_{i=1}^{n}p_i^{y_i}(1-p_i)^{1-y_i}}{\sum_{\text{all}\,\theta,p_i|\theta}\prod_{i=1}^{n}p_i^{y_i}(1-p_i)^{1-y_i}} Das Problem ist, dass der Zähler, der das Produkt einer Reihe von -Wahrscheinlichkeiten ist, zu klein ist. (Mein ist groß, ungefähr 1500).Bernoulli(pi,yi)Bernoulli(pi,yi)\text{Bernoulli}(p_i,y_i)nnn Daher werden die posterioren Werte für all all zu 0 berechnet (ich berechne in R).θθ\theta Zur Verdeutlichung hat jedes …

3
Name des Phänomens auf geschätzten CDF-Plots zensierter Daten
Mein Datensatz enthält zwei (ziemlich stark korrelierte) Variablen (Laufzeit des Algorithmus) und (Anzahl der untersuchten Knoten, was auch immer). Beide sind vom Design her stark korreliert, da der Algorithmus ungefähr Knoten pro Sekunde verwalten kann.n ctttnnnccc Der Algorithmus wurde bei mehreren Problemen ausgeführt, aber beendet, wenn nach einer Zeitüberschreitung keine …

1
Verwendung von Varimax-gedrehten PCA-Komponenten als Prädiktoren für die lineare Regression
Nach der PCA beschreibt die erste Komponente den größten Teil der Variabilität. Dies ist wichtig, z. B. bei der Untersuchung von Körpermaßen, bei denen allgemein bekannt ist (Jolliffe, 2002), dass die PC1-Achse Größenschwankungen erfasst. Meine Frage ist, ob PCA-Scores nach Varimax-Rotation dieselben Eigenschaften beibehalten oder sich unterscheiden, wie in diesem …

2
Welchen Test verwenden Sie, um die Proportionen zwischen 3 Gruppen zu vergleichen?
Wir testen eine E-Mail-Marketingkampagne. Bei unserem ersten Test haben wir zwei verschiedene E-Mail-Typen verschickt und hatten eine dritte Kontrollgruppe, die keine E-Mail erhalten hat. Jetzt erhalten wir "Ergebnisse" als Anteil der Benutzer zurück, die zu unserer App zurückgekehrt sind. Hier sind die Ergebnisse: Group | received e-mail | returned | …



2
R als Alternative zu SAS für große Datenmengen
Ich weiß, dass R für die Analyse großer Datenmengen nicht besonders hilfreich ist, da R alle Daten in den Speicher lädt, während SAS eine sequentielle Analyse durchführt. Es gibt jedoch Pakete wie bigmemory, mit denen Benutzer die Analyse großer Datenmengen (statistische Analysen) in R effizienter durchführen können. Ich wollte wissen, …
8 r  sas  large-data 

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.