Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren



1
Sind Regressionen mit Schülerfehlern nutzlos?
Bitte bearbeiten. Wenn Sie Daten mit starken Schwänzen haben, scheint es intuitiv zu sein, eine Regression mit Schülerfehlern durchzuführen. Während ich diese Möglichkeit erkundete, stieß ich auf dieses Papier: Breusch, TS, Robertson, JC & Welsh, AH (1. November 1997). Die neue Kleidung des Kaisers: eine Kritik des multivariaten Regressionsmodells. Statistica …

1
Verdoppelung der Schwänze im Permutationstest mit zwei Stichproben
Angenommen, wir haben zwei Stichproben und möchten feststellen, ob sie aus derselben Verteilung stammen, wobei die Stichproben A, B aus einigen ganzen Zahlen bestehen. Wenn wir dies mit einem Permutationstest mit zwei Stichproben testen, insbesondere indem wir Permutationen betrachten, bei denen die Unterschiede in den Mitteln der Stichproben so extrem …


3
Clustering-Verteilungen
Ich habe mehrere Verteilungen (10 Verteilungen in der Abbildung unten). Tatsächlich handelt es sich um Histogramme: Auf der x-Achse gibt es 70 Werte, die die Größe einiger Partikel in einer Lösung darstellen, und für jeden Wert von x ist der entsprechende Wert von y der Anteil der Partikel, deren Größe …
10 clustering 

3
In Bezug auf die Verwendung des Bigram-Modells (N-Gramm) zum Erstellen eines Merkmalsvektors für ein Textdokument
Ein traditioneller Ansatz der Feature-Konstruktion für das Text-Mining ist der Bag-of-Word-Ansatz und kann mithilfe von tf-idf zum Einrichten des Feature-Vektors, der ein bestimmtes Textdokument charakterisiert, erweitert werden. Gegenwärtig versuche ich, ein Bi-Gramm-Sprachmodell oder (N-Gramm) zum Erstellen eines Merkmalsvektors zu verwenden, weiß aber nicht genau, wie das geht? Können wir einfach …


2
Korrelation zwischen dichotomer und kontinuierlicher Variable
Ich versuche die Korrelation zwischen einer dichotomen und einer kontinuierlichen Variablen zu finden. Bei meinen Grundlagenarbeiten habe ich festgestellt, dass ich einen unabhängigen t-Test verwenden muss und die Voraussetzung dafür ist, dass die Verteilung der Variablen normal sein muss. Ich führte einen Kolmogorov-Smirnov-Test zum Testen der Normalität durch und stellte …

1
Unterschied zwischen Rand- und Bedingungsmodellen
Ein Randmodell berücksichtigt die Korrelation innerhalb jedes Clusters. Ein bedingtes Modell berücksichtigt auch die Korrelation innerhalb jedes Clusters. Meine Fragen sind: Modelliert ein Randmodell die Haupteffekte in einer Population, während ein bedingtes Modell die Haupteffekte innerhalb eines Clusters und in einer Population modelliert? Die Interpretation der Koeffizienten eines Randmodells entspricht …

2
Wie kann ich Zeichenfolgen nach gemeinsamen Themen gruppieren?
Ich versuche zum Beispiel, Strings über das Programmieren mit anderen Strings über das Programmieren, Strings über die Physik mit anderen Strings über die Physik usw. für eine breite Palette von Themen zu gruppieren. Trotz des krassen theoretischen sprachlichen Aspekts des Problems möchte ich dies tatsächlich mit Programmierung / Software tun. …



3
Online-Material zum Erlernen der Zeitreihenanalyse
Meine Frage ist, ob es gute Online-Materialien gibt, um dies zu lernen. Etwas, das die Dinge gut einführt, insbesondere ARMA-Modelle und die damit verbundene Mathematik. Bearbeiten: Ich suche etwas von der High-End-Bachelor-Ebene. So etwas wie in Brockwell und Davis ' Einführung in Zeitreihen und Prognosen


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.