Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren




2
Cox-Proportional-Hazard-Modell und nicht zufällig ausgewählte Stichprobe
Gibt es Methoden zur Korrektur von Verzerrungen im Cox-Proportional-Hazard-Modell, die durch nicht zufällig ausgewählte Stichproben verursacht werden (so etwas wie Heckmans Korrektur)? Hintergrund : Nehmen wir an, die Situation sieht wie folgt aus: - In den ersten zwei Jahren werden alle Kunden akzeptiert. - Nach diesen zwei Jahren wird ein …
9 bias  cox-model 

4
Wie gehe ich mit Lücken / NaNs in Zeitreihendaten um, wenn Matlab für Autokorrelation und neuronale Netze verwendet wird?
Ich habe eine Zeitreihe von Messungen (Höhen-eindimensionale Reihen). Im Beobachtungszeitraum ging der Messvorgang für einige Zeitpunkte zurück. Die resultierenden Daten sind also ein Vektor mit NaNs, bei dem es Lücken in den Daten gab. Bei Verwendung von MATLAB verursacht dies ein Problem bei der Berechnung der Autokorrelation ( autocorr) und …


4
Test auf signifikante Unterschiede in den Verhältnissen normalverteilter Zufallsvariablen
Bezogen auf das Analysieren von Verhältnissen von Variablen und Wie wird das Verhältnis von zwei normalverteilten Variablen oder die Umkehrung von einer parametrisiert? . Angenommen, ich habe eine Reihe von Stichproben aus vier verschiedenen kontinuierlichen Zufallsverteilungen, von denen wir alle annehmen können, dass sie ungefähr normal sind. In meinem Fall …

1
Erstellen eines Markov-Modells für maximale Entropie aus einem vorhandenen Klassifikator für maximale Entropie mit mehreren Eingängen
Ich bin fasziniert vom Konzept eines Maximum Entropy Markov-Modells (MEMM) und denke darüber nach, es für einen POS-Tagger (Part of Speech) zu verwenden. Im Moment verwende ich einen herkömmlichen ME-Klassifikator (Maximum Entropy), um jedes einzelne Wort zu kennzeichnen. Dies verwendet eine Reihe von Funktionen, einschließlich der beiden vorhergehenden Tags. MEMMs …

4
Am effizientesten, um LaTeX, Sweave, Beamer zu lernen? [geschlossen]
Geschlossen. Diese Frage ist nicht zum Thema . Derzeit werden keine Antworten akzeptiert. Möchten Sie diese Frage verbessern? Aktualisieren Sie die Frage so dass es beim Thema für Kreuz Validated. Geschlossen vor 3 Jahren . Ich bin sehr daran interessiert zu lernen, wie man wiederkehrende Berichte aus meinem R-Code und …
9 r 

7
Suche nach künstlichen 2D-Daten zur Demonstration der Eigenschaften von Clustering-Algorithmen
Ich suche nach Datensätzen von zweidimensionalen Datenpunkten (jeder Datenpunkt ist ein Vektor mit zwei Werten (x, y)), die unterschiedlichen Verteilungen und Formen folgen. Code zum Generieren solcher Daten wäre ebenfalls hilfreich. Ich möchte sie verwenden, um die Leistung einiger Clustering-Algorithmen zu zeichnen / zu visualisieren. Hier sind einige Beispiele: sternförmige …

1
Partikelfilter im R - trivialen Codebeispiel
Ich suche nach einem einfachen Codebeispiel für die Ausführung eines Partikelfilters in R. Das Pomp-Paket scheint das Zustandsraum-Mathematikbit zu unterstützen, aber die Beispiele sind für einen einfachen OO-Entwickler wie mich programmgesteuert etwas schwierig zu befolgen wie man die beobachteten Daten in ein Pomp-Objekt lädt. Beispiele hier: http://cran.r-project.org/web/packages/pomp/vignettes/intro_to_pomp.pdf Nehmen wir an, …
9 r 

1
Wie berechnet man ein Genauigkeitsmaß basierend auf RMSE? Ist mein großer Datensatz normal verteilt?
Ich habe mehrere Datensätze in der Größenordnung von Tausenden von Punkten. Die Werte in jedem Datensatz sind X, Y, Z und beziehen sich auf eine Koordinate im Raum. Der Z-Wert repräsentiert einen Höhenunterschied am Koordinatenpaar (x, y). In meinem GIS-Bereich wird der Höhenfehler in RMSE normalerweise durch Subtrahieren des Grundwahrheitspunkts …

1
Was ist der Unterschied zwischen GLM und GEE?
Was ist der Unterschied zwischen einem GLM-Modell (logistische Regression) mit einer binären Antwortvariablen, die Subjekt und Zeit als Kovariaten enthält, und dem analogen GEE-Modell, das die Korrelation zwischen Messungen zu mehreren Zeitpunkten berücksichtigt? Mein GLM sieht aus wie: Y(binary) ~ A + B1X1(subject id) + B2X2(time) + B3X3(interesting continuous covariate) …

4
Reduzieren der Anzahl von Variablen in einer multiplen Regression
Ich habe einen großen Datensatz, der aus den Werten mehrerer hundert Finanzvariablen besteht, die in einer multiplen Regression verwendet werden könnten, um das Verhalten eines Indexfonds im Zeitverlauf vorherzusagen. Ich möchte die Anzahl der Variablen auf etwa zehn reduzieren und dabei so viel Vorhersagekraft wie möglich behalten. Hinzugefügt: Die reduzierte …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.