Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


3
Wie ändere ich Spaltennamen im Datenrahmen in R? [geschlossen]
Geschlossen. Diese Frage ist nicht zum Thema . Derzeit werden keine Antworten akzeptiert. Möchten Sie diese Frage verbessern? Aktualisieren Sie die Frage so dass es beim Thema für Kreuz Validated. Geschlossen vor 6 Jahren . names(mydat)[c(name)]<-c("newname") Daraus weiß ich, dass der Spalten- / Variablenname "Name" des Datenrahmens mydat durch "neuer …
9 r 


1
Wie berechnet man den Standardfehler der Quotenverhältnisse?
Ich habe zwei Datensätze aus genomweiten Assoziationsstudien. Die einzigen verfügbaren Informationen sind das Odds Ratio und der p-Wert für den ersten Datensatz. Für den zweiten Datensatz habe ich das Odds Ratio, den p-Wert und die Allelfrequenzen (AFD = Krankheit, AFC = Kontrollen) (zB: 0,321). Ich versuche, eine Metaanalyse dieser Daten …




1
Wie sind die Ergebnisse der Dimensionsreduktion / mehrdimensionalen Skalierung zu interpretieren?
Ich habe sowohl eine SVD-Zerlegung als auch eine mehrdimensionale Skalierung einer 6-dimensionalen Datenmatrix durchgeführt, um die Struktur der Daten besser zu verstehen. Leider sind alle Singularwerte in derselben Größenordnung, was bedeutet, dass die Dimensionalität der Daten tatsächlich 6 beträgt. Ich möchte jedoch die Werte der Singularvektoren interpretieren können. Zum Beispiel …

3
Radfahren im k-means-Algorithmus
Laut Wiki ist das am häufigsten verwendete Konvergenzkriterium "Zuordnung hat sich nicht geändert". Ich habe mich gefragt, ob Radfahren auftreten kann, wenn wir ein solches Konvergenzkriterium verwenden. Ich würde mich freuen, wenn jemand auf einen Artikel verweist, der ein Beispiel für das Radfahren gibt oder beweist, dass dies unmöglich ist.

5
Automatische Schwellenwertbestimmung zur Erkennung von Anomalien
Ich arbeite mit einer Zeitreihe von Anomalie-Scores (Hintergrund ist die Anomalieerkennung in Computernetzwerken). Jede Minute erhalte ich einen Anomalie-Score der mir sagt, wie "unerwartet" oder abnormal der aktuelle Status des Netzwerks ist. Je höher die Punktzahl, desto abnormaler ist der aktuelle Zustand. Scores nahe 5 sind theoretisch möglich, treten jedoch …

3
Behandlung der Ebenen "Weiß nicht / Abgelehnt" von kategorialen Variablen
Ich modelliere die Diabetes-Vorhersage mithilfe der logistischen Regression. Der verwendete Datensatz ist das Behavioral Risk Factor Surveillance System (BRFSS) des Center for Disease Control (CDC). Eine der unabhängigen Variablen ist Bluthochdruck. Es ist kategorisch mit den folgenden Ebenen "Ja", "Nein", "Weiß nicht / Abgelehnt". Sollte ich diese Zeilen beim Erstellen …

3
Platzsparendes Clustering
Die meisten Clustering-Algorithmen, die ich gesehen habe, beginnen mit der Erstellung von Abständen zwischen allen Punkten, was bei größeren Datensätzen problematisch wird. Gibt es einen, der das nicht tut? Oder ist es eine Art partieller / ungefährer / gestaffelter Ansatz? Welcher Clustering-Algorithmus / welche Implementierung benötigt weniger als O (n …



2
Wie wendet man eine Kreuzvalidierung im Kontext der Auswahl von Lernparametern für Support-Vektor-Maschinen angemessen an?
Das wunderbare libsvm-Paket bietet eine Python-Oberfläche und eine Datei "easy.py", die automatisch nach Lernparametern (Kosten & Gamma) sucht, die die Genauigkeit des Klassifikators maximieren. Innerhalb eines bestimmten Kandidatensatzes von Lernparametern wird die Genauigkeit durch Kreuzvalidierung operationalisiert, aber ich denke, dies untergräbt den Zweck der Kreuzvalidierung. Das heißt, sofern die Lernparameter …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.