Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren



3
Wie vergleiche ich zwei Datensätze mit dem QQ-Plot mit ggplot2?
Als Statistik- und R-Neuling hatte ich große Schwierigkeiten, qqplots mit einem Seitenverhältnis von 1: 1 zu erstellen. ggplot2 scheint weitaus mehr Kontrolle über das Plotten zu bieten als die Standard-R-Plot-Pakete, aber ich kann nicht sehen, wie ein qqplot in ggplot2 durchgeführt wird, um zwei Datensätze zu vergleichen. Also meine Frage, …

2
Einen Klassifikationsbaum (in rpart) in ein Regelwerk organisieren?
Gibt es eine Möglichkeit, nach Erstellung eines komplexen Klassifizierungsbaums mit rpart (in R) die für jede Klasse erstellten Entscheidungsregeln zu organisieren? Anstatt also einen riesigen Baum zu bekommen, bekommen wir eine Reihe von Regeln für jede der Klassen? (Wenn das so ist, wie?) Hier ist ein einfaches Codebeispiel, um Beispiele …
11 r  classification  cart  rpart 

3
Gibt es Bibliotheken für CART-ähnliche Methoden, die spärliche Prädiktoren und Antworten verwenden?
Ich arbeite mit einigen großen Datenmengen unter Verwendung des gbm-Pakets in R. Sowohl meine Prädiktormatrix als auch mein Antwortvektor sind ziemlich spärlich (dh die meisten Einträge sind Null). Ich hatte gehofft, Entscheidungsbäume mit einem Algorithmus zu erstellen, der diese Spärlichkeit ausnutzt, wie hier ). In diesem Artikel haben, wie in …

7
Datenreduktionstechnik zur Identifizierung von Ländertypen
Ich unterrichte einen Einführungskurs in Wirtschaftsgeographie. Um meinen Schülern zu helfen, ein besseres Verständnis für die Arten von Ländern in der heutigen Weltwirtschaft und ein Verständnis für Datenreduktionstechniken zu entwickeln, möchte ich eine Aufgabe erstellen, die eine Typologie verschiedener Arten von Ländern erstellt (z. B. einkommensstarke Länder mit hohem Einkommen) …

1
Fehler beim Melden mit mittleren und grafischen Darstellungen?
Ich habe eine breite Palette von Tests für meine Abschlussarbeiten verwendet, von parametrischen ANOVAs und t-Tests über nichtparametrische Kruskal-Wallis-Tests und Mann-Whitneys bis hin zu rangtransformierten 2-Wege-ANOVAs und GzLMs mit binären. Poisson und proportionale Daten. Jetzt muss ich alles melden, während ich das alles in meine Ergebnisse schreibe. Ich habe hier …

1
Modifizieren der LBA-Simulation (Linear Ballistic Accumulator) in R.
Das "Linear Ballistic Accumulator" -Modell (LBA) ist ein ziemlich erfolgreiches Modell für menschliches Verhalten bei beschleunigten einfachen Entscheidungsaufgaben. Donkin et al (2009, PDF ) zur Verfügung stellt Code, erlaubt es, die Parameter des Modells gegeben menschliche Verhaltensdaten zu schätzen, und ich habe diesen Code kopiert (mit einigen kleineren Formatierungsänderungen) auf …


2
Bedeutung der anfänglichen Übergangswahrscheinlichkeiten in einem Hidden-Markov-Modell
Was sind die Vorteile der Angabe bestimmter Anfangswerte für Übergangswahrscheinlichkeiten in einem Hidden-Markov-Modell? Irgendwann wird das System sie lernen. Was bringt es also, andere als zufällige Werte anzugeben? Macht der zugrunde liegende Algorithmus einen Unterschied wie Baum-Welch? Was würden Sie mir raten, wenn ich die Übergangswahrscheinlichkeiten zu Beginn sehr genau …



1
Was ist dieser „maximale Korrelationskoeffizient“?
Eine typische Bildverarbeitungsstatistik ist die Verwendung von Haralick-Texturmerkmalen (14). Ich wundere mich über das 14. dieser Merkmale: Bei gegebener Adjazenzkarte (die wir einfach als empirische Verteilung von zwei ganzen Zahlen i , j < 256 betrachten können ) ist sie definiert als: die Quadratwurzel des zweiten Eigenwerts von Q , …



Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.