Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren




4
Irgendwelche Vorschläge für eine Clustering-Methode für eine unbekannte Anzahl von Clustern und eine nichteuklidische Entfernung?
Ich benötige einen Vorschlag für die Clustering-Methode (unbeaufsichtigte Klassifizierung) für ein Beratungsprojekt. Ich suche eine Methode, die hoffentlich die folgenden Eigenschaften hat: Das Thema meiner Studie hat drei Eigenschaften. Eine wird durch eine (nichteuklidische) Distanzmatrix dargestellt und die anderen beiden liegen in Form von Vektoren im euklidischen Raum vor. Die …



2
Sequentielle Muster identifizieren
Ich arbeite mit Sequenzdaten, bei denen es sich um lange Listen von Malware-Win-API-Aufrufen handelt. Ich versuche, das Problem der Identifizierung von "Malware-Verhalten" in eine Suche nach sequentiellen Mustern umzuwandeln. Ich behandle jeden API-Aufruf als einen einzelnen Artikel. Die Anzahl der verschiedenen möglichen Elemente (API-Aufrufe) ist ziemlich groß. Wenn ich nun …

1
Sind Entscheidungswälder und Zufallswälder dasselbe?
Basierend auf einer Antwort auf Cross Validated habe ich versucht , eine zufällige Gesamtstruktur in .NET / C # zu implementieren , um Textdokumente zu klassifizieren. Als ich mich im Internet umsah, um festzustellen, ob Implementierungen vorhanden sind, stieß ich auf einen Algorithmus für eine Entscheidungsstruktur in Alglib . Die …


2
k-facher Lebenslauf der Prognose finanzieller Zeitreihen - ist die Leistung beim letzten Falten relevanter?
Ich arbeite an einem ANN-basierten Prognosemodell für eine finanzielle Zeitreihe. Ich verwende eine 5-fache Kreuzvalidierung und die durchschnittliche Leistung ist so. Die Leistung in der letzten Falte (die Iteration, bei der das letzte Segment nicht trainiert und zur Validierung verwendet wird) ist besser als der Durchschnitt. Ist dies ein Zufall …

1
Bootstrapping mit einer kleinen Anzahl von Beobachtungen
Angenommen, ich habe eine kleine Anzahl (N) von Beobachtungen für eine Hypothese gesammelt , die ich testen möchte. Ich könnte die Bootstrap-Methode verwenden, um eine Stichprobenverteilung für das mittlere Ergebnis von N Beobachtungen zu erstellen, aber ich befürchte, dass dieses Modell zusammenbrechen könnte, wenn N sehr klein wird, was zu …
8 bootstrap 


2
Was ist bei geringer Interrater-Zuverlässigkeit (ICC) zu tun?
Hintergrund: Acht Ärzte bewerteten jeweils die gleichen 54 Patienten anhand einer Überzeugungsmaßnahme (1-7 Likert-Skala). Die mittlere Punktzahl für das Überzeugungsmaß wird schließlich das Ergebnismaß meines Experiments sein. Die Interrater-Zuverlässigkeit wurde als Intraclass-Korrelationskoeffizient (ICC) unter Verwendung des Zwei-Wege-Zufallseffektmodells mit Konsistenz quantifiziert. Leider war die Interrater-Zuverlässigkeit der acht Ärzte gering (ICC = …



Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.