Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Klassifikator-Leistungsmaß, das Sensitivität und Spezifität kombiniert?
Ich habe Daten mit 2 Klassen, für die ich eine Klassifizierung mit mehreren Klassifizierern durchführe. Und die Datensätze sind gut ausbalanciert. Bei der Beurteilung der Leistung der Klassifikatoren muss berücksichtigt werden, wie genau der Klassifikator nicht nur die wahren Positiven, sondern auch die wahren Negative bestimmt. Wenn ich Genauigkeit verwende …

3
Empfehlungen für Erstlehrer (Einführung in die Biostatistik)
Ich unterrichte diesen Herbst meine erste Klasse (Einführung in die Biostatistik). Hat jemand Vorschläge, wie man Statistik besser unterrichten kann? Vielleicht ein Beispiel, das Ihr erster Lehrer gerne verwendet hätte? Ich verwende Prinzipien der Biostatistik von Pagano und Gauvreau. DETAILS BEARBEITEN Diese Klasse ist eine Online-Klasse, die sich 1,5 Stunden …

1
Gute, nützliche und charakteristische Experimente zur (optimalen) statistischen Versuchsplanung
Es gibt mehr Phänomene, auf die experimentelles Design angewendet werden kann, als es alternative gültige Designstrategien gibt. Dies sollte zutreffen, obwohl es viele Möglichkeiten gibt, ein Experiment richtig zu gestalten. Was sind die besten "Probleme", die den Wert und die Nuance für die verschiedenen Arten der optimalen Versuchsplanung wirklich demonstrieren? …

5
Wie kann man die Leistung eines Klassifikators messen, wenn fast 100% der Klassenbezeichnungen zu einer Klasse gehören?
In meinen Daten habe ich eine Klassenvariable, bezeichnet als . Diese Klassenvariablenwerte sind 0 , 1 (binär). Fast alle Beobachtungen von C sind 0 (nahe 100%, genauer gesagt 97%). Ich möchte einen "Leistungstest" für verschiedene Klassifizierungsmodelle (dies könnte Genauigkeit sein). Was ich befürchte, ist, dass wenn ich ein Klassifizierungsmodell habe, …

1
SMOTE löst einen Fehler für ein Ungleichgewichtsproblem mit mehreren Klassen aus
Ich versuche, SMOTE zu verwenden, um das Ungleichgewicht in meinem Klassifizierungsproblem für mehrere Klassen zu korrigieren. Obwohl SMOTE gemäß dem SMOTE-Hilfedokument perfekt für das Iris-Dataset funktioniert, funktioniert es für ein ähnliches Dataset nicht. So sehen meine Daten aus. Beachten Sie, dass es drei Klassen mit den Werten 1, 2, 3 …

2
Verwirrung im Zusammenhang mit Gibbs-Probenahme
Ich bin auf diesen Artikel gestoßen, in dem steht, dass bei der Gibbs-Probenahme jede Probe akzeptiert wird. Ich bin etwas verwirrt. Wie kommt es, dass jede aufgenommene Probe zu einer stationären Verteilung konvergiert? Im allgemeinen Metropolis-Algorithmus akzeptieren wir als min (1, p (x *) / p (x)), wobei x * …

1
Perzentile als Prädiktoren verwenden - gute Idee?
Ich denke über ein Problem nach, das darin besteht, das Protokoll (die Ausgaben) eines Kunden mithilfe der linearen Regression vorherzusagen. Ich überlege, welche Funktionen als Eingabe verwendet werden sollen, und frage mich, ob es in Ordnung wäre, das Perzentil einer Variablen als Eingabe zu verwenden. Zum Beispiel könnte ich die …


1
Interaktionsterm mit hierarchischer Regressionsanalyse mit zentrierten Variablen? Welche Variablen sollten wir zentrieren?
Ich führe eine hierarchische Regressionsanalyse durch und habe einige kleine Zweifel: Berechnen wir den Interaktionsterm anhand der zentrierten Variablen? Müssen wir ALLE stetigen Variablen im Datensatz zentrieren, mit Ausnahme der abhängigen Variablen? Wenn wir einige Variablen protokollieren müssen (weil ihre SD viel höher als ihr Mittelwert ist), zentrieren wir dann …

2
Hinzufügen von Gewichten für stark verzerrte Datensätze in der logistischen Regression
Ich verwende eine Standardversion der logistischen Regression, um meine Eingabevariablen an binäre Ausgabevariablen anzupassen. In meinem Problem sind die negativen Ausgänge (0s) jedoch weitaus größer als die positiven Ausgänge (1s). Das Verhältnis beträgt 20: 1. Wenn ich also einen Klassifikator trainiere, scheinen selbst Merkmale, die stark auf die Möglichkeit einer …

3
LDA vs. Perzeptron
Ich versuche ein Gefühl dafür zu bekommen, wie LDA in andere überwachte Lerntechniken passt. Ich habe hier bereits einige der LDA-ähnlichen Beiträge über LDA gelesen. Ich bin bereits mit dem Perzeptron vertraut, lerne aber gerade LDA. Wie passt LDA in die Familie der überwachten Lernalgorithmen? Was könnten seine Nachteile gegenüber …


4
Kann ich bei vielen positiven, unbedeutenden Ergebnissen testen, ob mindestens dieser Ergebnisse positiv sind?
Angenommen, ich habe dieselbe Regression für 100 verschiedene Personen separat durchgeführt. Meine interessierenden Koeffizienten sind positiv (und sehr unterschiedlich), aber in allen 100 Ergebnissen statistisch nicht signifikant (sagen wir, jeder p-Wert = 0,11). Gibt es eine Möglichkeit, diese p-Werte zu kombinieren, um zu dem Schluss zu gelangen, dass "mindestens 80 …

2
Wie führt ein einheitlicher Prior zu denselben Schätzungen hinsichtlich der maximalen Wahrscheinlichkeit und der Art des Seitenzahns?
Ich studiere verschiedene Punktschätzungsmethoden und lese, dass bei Verwendung von MAP- und ML-Schätzungen, wenn wir einen "einheitlichen Prior" verwenden, die Schätzungen identisch sind. Kann jemand erklären, was ein "einheitlicher" Prior ist, und einige (einfache) Beispiele dafür geben, wann die MAP- und ML-Schätzer gleich wären?

2
Wie gehe ich am besten mit Unterpunkten in einer Metaanalyse um?
Ich führe eine Metaanalyse der Effektgrößen d in R unter Verwendung des Metafor-Pakets durch. d repräsentiert Unterschiede in den Gedächtniswerten zwischen Patienten und Gesunden. Einige Studien berichten jedoch nur über Unterpunkte des interessierenden Maßes d (z. B. mehrere unterschiedliche Speicherbewertungen oder Bewertungen aus drei getrennten Blöcken von Gedächtnistests). Bitte beachten …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.