Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Express-Antworten in Bezug auf Originaleinheiten in Box-Cox-transformierten Daten
Für einige Messungen werden die Ergebnisse einer Analyse auf der transformierten Skala angemessen dargestellt. In den meisten Fällen ist es jedoch wünschenswert, die Ergebnisse auf der ursprünglichen Messskala darzustellen (ansonsten ist Ihre Arbeit mehr oder weniger wertlos). Beispielsweise tritt bei log-transformierten Daten ein Problem bei der Interpretation auf der ursprünglichen …

3
Verwenden von Informationsgeometrie zum Definieren von Abständen und Volumina… nützlich?
Ich stieß auf eine große Menge an Literatur, die sich dafür einsetzte, die Fisher-Informationsmetrik als natürliche lokale Metrik im Raum der Wahrscheinlichkeitsverteilungen zu verwenden und dann darüber zu integrieren, um Entfernungen und Volumina zu definieren. Aber sind diese "integrierten" Größen tatsächlich für irgendetwas nützlich? Ich fand keine theoretischen Gründe und …

5
Kognitive Verarbeitung / Interpretation von Datenvisualisierungstechniken
Kennt jemand Forschungsergebnisse, die die Wirksamkeit (Verständlichkeit?) Verschiedener Visualisierungstechniken untersuchen? Wie schnell verstehen Menschen beispielsweise eine Form der Visualisierung über eine andere? Hilft die Interaktivität mit der Visualisierung beim Abrufen der Daten? Alles in diese Richtung. Ein Beispiel für Visualisierungen können sein: Streudiagramme, Diagramme, Zeitleisten, Karten, interaktive Schnittstellen (wie Parallele …


5
SVD-Dimensionsreduktion für Zeitreihen unterschiedlicher Länge
Ich verwende Singular Value Decomposition als Methode zur Reduzierung der Dimensionalität. Bei gegebenen NVektoren der Dimension Dbesteht die Idee darin, die Merkmale in einem transformierten Raum unkorrelierter Dimensionen darzustellen, der die meisten Informationen der Daten in den Eigenvektoren dieses Raums in abnehmender Reihenfolge der Wichtigkeit verdichtet. Jetzt versuche ich, dieses …

4
Trennen von zwei Populationen von der Probe
Ich versuche, zwei Wertegruppen von einem einzigen Datensatz zu trennen. Ich kann davon ausgehen, dass eine der Populationen normal verteilt ist und mindestens halb so groß wie die Stichprobe ist. Die Werte der zweiten sind beide niedriger oder höher als die Werte der ersten (Verteilung ist unbekannt). Was ich versuche, …

4
Daten Anonymisierungssoftware
Verschlossen . Diese Frage und ihre Antworten sind gesperrt, da die Frage nicht zum Thema gehört, aber von historischer Bedeutung ist. Derzeit werden keine neuen Antworten oder Interaktionen akzeptiert. Kennt jemand eine gute Datenanonymisierungssoftware? Oder vielleicht ein Paket für R, das Daten anonymisiert? Offensichtlich erwarten Sie keine unknackbare Anonymisierung - …
13 software 

3
Lineare Modelle mit gemischten Effekten
Ich habe allgemein gehört, dass LME-Modelle bei der Analyse von Genauigkeitsdaten (dh in Psychologieexperimenten) fundierter sind, da sie mit binomischen und anderen nicht normalen Verteilungen arbeiten können, die herkömmliche Ansätze (z. B. ANOVA) nicht können. Auf welcher mathematischen Grundlage können LME-Modelle diese anderen Distributionen einbeziehen, und welche nicht allzu technischen …


5
Wann werden mehrere Modelle für die Vorhersage verwendet?
Dies ist eine ziemlich allgemeine Frage: Ich habe in der Regel festgestellt, dass die Verwendung mehrerer verschiedener Modelle ein Modell übertrifft, wenn versucht wird, eine Zeitreihe anhand einer Stichprobe vorherzusagen. Gibt es gute Papiere, die belegen, dass die Kombination von Modellen ein einzelnes Modell übertrifft? Gibt es Best Practices für …

1
Wie hängt die Entropie von Ort und Maßstab ab?
Die Entropie einer stetigen Verteilung mit der Dichtefunktion fff ist definiert als das Negative der Erwartung von und ist daher gleichlog(f),log⁡(f),\log(f), Hf=−∫∞−∞log(f(x))f(x)dx.Hf=−∫−∞∞log⁡(f(x))f(x)dx.H_f = -\int_{-\infty}^{\infty} \log(f(x)) f(x)\mathrm{d}x. Wir sagen auch, dass jede Zufallsvariable deren Verteilung die Dichte hat, die Entropie (Dieses Integral ist auch dann gut definiert, wenn Nullen hat, weil …



1
Ist Genauigkeit eine falsche Bewertungsregel in einer binären Klassifizierungseinstellung?
Ich habe vor kurzem über die richtigen Bewertungsregeln für Wahrscheinlichkeitsklassifikatoren gelernt. In mehreren Beiträgen auf dieser Website wurde betont, dass Genauigkeit eine falsche Bewertungsregel ist und nicht zur Bewertung der Qualität von Vorhersagen verwendet werden sollte, die von einem probabilistischen Modell wie der logistischen Regression generiert werden. Einige wissenschaftliche Arbeiten, …

3
Statistische Signifikanz (p-Wert) für den Vergleich zweier Klassifikatoren hinsichtlich (mittlerer) ROC AUC, Sensitivität und Spezifität
Ich habe einen Testsatz von 100 Fällen und zwei Klassifikatoren. Ich erstellte Vorhersagen und berechnete die ROC AUC, Sensitivität und Spezifität für beide Klassifikatoren. Frage 1: Wie kann ich den p-Wert berechnen, um zu überprüfen, ob einer in Bezug auf alle Scores (ROC AUC, Sensitivität, Spezifität) signifikant besser als der …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.