Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Imputation mit zufälligen Wäldern
Ich habe zwei Fragen zur Verwendung einer zufälligen Gesamtstruktur (insbesondere randomForest in R) für die Imputation fehlender Werte (im Prädiktorraum). 1) Wie funktioniert der Imputationsalgorithmus - insbesondere wie und warum wird die Klassenbezeichnung für die Imputation benötigt? Ist die Näherungsmatrix, die dazu dient, den Durchschnittswert zu gewichten, um einen fehlenden …

1
Vergleich der Entropie und Verteilung von Bytes in komprimierten / verschlüsselten Daten
Ich habe eine Frage, die mich eine Weile beschäftigt. Der Entropietest wird häufig verwendet, um verschlüsselte Daten zu identifizieren. Die Entropie erreicht ihr Maximum, wenn die Bytes der analysierten Daten gleichmäßig verteilt sind. Der Entropietest identifiziert verschlüsselte Daten, da diese Daten eine gleichmäßige Verteilung aufweisen - wie komprimierte Daten, die …

2
Welches R-Paket soll zur Durchführung einer Analyse der latenten Klassenwachstumsanalyse (LCGA) / Wachstumsmischung (GMM) verwendet werden?
Ich versuche, eine latente Klassenwachstumsanalyse (LCGA) und / oder Wachstumsmischungsmodelle (GMMs) in R durchzuführen. Die Daten, die ich verwende, sind eine zunehmende Anzahl von Gabeln von Git-Repositories (diskrete Variable, nicht kategorisch), wie Sie können siehe in diesem Datensatz . Ich habe versucht lavaan, ein Modell für latente Wachstumskurven anzupassen, aber …

2
Wie interpretiere ich ein Boxplot?
Ich habe einige Daten, in denen es 5 kategoriale erklärende Variablen ( concern, breath, weath, sleep, act) und 1 kontinuierliche Antwortvariable ( tto) gibt. Darüber hinaus ist jede kategoriale erklärende Variable in 5 Ebenen unterteilt, die zeigen, wie stark sich eine Person dabei fühlt. Level 1 und Level 5 zeigen …

3
Analoga der Sensitivität und Spezifität für kontinuierliche Ergebnisse
Wie kann ich die Sensitivität und Spezifität (oder analoge Maßnahmen) eines kontinuierlichen diagnostischen Tests zur Vorhersage eines kontinuierlichen Ergebnisses (z. B. Blutdruck) berechnen, ohne das Ergebnis zu dichotomisieren? Irgendwelche Ideen? Es scheint, dass Forscher dies mithilfe der Modellierung gemischter Effekte getan haben (siehe Link unten), aber ich bin mit ihrer …

3
Wie vergleiche ich Rangdaten?
Ich habe einige Fragen zur Analyse von Rangdaten. Die Daten sehen folgendermaßen aus: 4 Gruppen von Menschen mit HIV und 16 andere Gruppen von Menschen, die im selben Dorf leben, wurden gebeten, 12 Herausforderungen für Menschen mit HIV nach Wichtigkeit einzustufen. (zB körperliche Gesundheit - soziale Akzeptanz - geistige Gesundheit …


2
Zwei saisonale Perioden in ARIMA mit R.
Ich verwende derzeit R, um eine Zeitreihe mit den folgenden Anweisungen vorherzusagen: X <- ts(datas, frequency=24) X.arima <- Arima(X, order=c(2,1,0), seasonal=c(1,1,1)) pred <- predict(X.arima, n.ahead=24) plot.ts(pred$pred) Wie Sie sehen, habe ich stündlich Daten und habe den saisonalen Zeitraum von 24 (einen Tag) gewählt. Ich möchte meine Prognose mithilfe eines zusätzlichen …

1
Was sind die Vorteile von MKL-Methoden (Multiple Kernel Learning)?
Mehrere Kernel-Lernmethoden zielen darauf ab, ein Kernelmodell zu erstellen, bei dem der Kernel eine lineare Kombination von Kerneln mit fester Basis ist. Das Erlernen des Kernels besteht dann darin, die Gewichtungskoeffizienten für jeden Basiskern zu lernen, anstatt die Kernelparameter eines einzelnen Kernels zu optimieren. Die Nachteile des Lernens mehrerer Kernel …

5
Glätten von 2D-Daten
Die Daten bestehen aus optischen Spektren (Lichtintensität gegen Frequenz), die zu unterschiedlichen Zeiten aufgenommen wurden. Die Punkte wurden in einem regelmäßigen Raster in x (Zeit), y (Frequenz) erfasst. Um die zeitliche Entwicklung bei bestimmten Frequenzen zu analysieren (ein schneller Anstieg, gefolgt von einem exponentiellen Abfall), möchte ich einen Teil des …

1
Zufällige Erzeugung von Musiknoten
Ich arbeite an einem kleinen Projekt, das sich gerade in der frühen Entwicklungsphase befindet. Ich versuche herauszufinden, wie ich zufällige Musik generiere, insbesondere Noten. Durch Googeln habe ich nur Lösegeld- Notengenerator und viel zufällige Musik gefunden, wobei Wort-Zufall nichts mit der Definition von Zufallsvariablen zu tun hat :) Ich weiß …

2
Schätzung des vergleichenden Erfolgs verschiedener Broschüren
Das Problem der realen Welt Einer meiner Kunden bereitet sich darauf vor, einen Direktmailer an seine abonnierte Benutzerliste zu senden, und diese statistische Herausforderung wurde gestellt. Das Marketing-Team verfügt über 3 verschiedene Broschüren und möchte wissen, welche Broschüre die höchste Rücklaufquote erzielt. Sie möchten auch wissen, ob das Senden des …

2
Schätzer für eine Inzidenzrate
Während eines Statistikkurses für Medizinstudenten stieß ich auf ein Problem im Zusammenhang mit Inzidenzraten. Der Kontext des Problems ist ein Kapitel über die Poisson-Verteilung. In dem Problem werden 2300 Raucher über einen Zeitraum von 1 Jahr beobachtet, in dem 24 von ihnen Lungenkrebs entwickeln. Sie möchten dann die Inzidenzrate des …

1
Verwenden Sie die Mehrfachzuschreibung für Cox-Proportional-Gefahren und validieren Sie sie dann mit dem Effektivwertpaket?
Ich habe das Mäusepaket untersucht und noch keine Möglichkeit gefunden, die mehreren Imputationen zu verwenden, um ein Cox-Modell zu erstellen und dieses Modell dann mit der Funktion des Effektivpakets zu validieren validate(). Hier ist ein Beispielcode von dem, was ich bisher habe, unter Verwendung des Datensatzes veteran: library(rms) library(survival) library(mice) …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.