Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Was ist das nicht parametrische Äquivalent einer Zwei-Wege-ANOVA, die Interaktionen enthalten kann?
Hallo, ich versuche, das nicht-parametrische Äquivalent einer Zwei-Wege-ANOVA (3x4-Design) zu finden, die Wechselwirkungen einschließen kann. Aus meiner Lektüre in Zar 1984 "Biostatistische Analyse" geht hervor, dass dies mit einer in Scheirer, Ray und Hare (1976) beschriebenen Methode möglich ist. Anderen Online-Beiträgen zufolge wurde jedoch gefolgert, dass diese Methode nicht mehr …

2
Umwandlung eines multivariaten linearen Modells in eine multiple Regression
Ist die Neugestaltung eines multivariaten linearen Regressionsmodells als multiple lineare Regression völlig gleichwertig? Ich beziehe mich nicht einfach laufen separate Regressionen.ttt Ich habe an einigen Stellen gelesen (Bayesian Data Analysis - Gelman et al. Und Multivariate Old School - Marden), dass ein multivariates lineares Modell leicht als multiple Regression umparametriert …


3
Maschinelles Lernen zur Vorhersage von Klassenwahrscheinlichkeiten
Ich suche nach Klassifikatoren, die Wahrscheinlichkeiten ausgeben, dass Beispiele zu einer von zwei Klassen gehören. Ich kenne logistische Regression und naive Bayes, aber können Sie mir von anderen erzählen, die auf ähnliche Weise arbeiten? Das heißt, Klassifizierer, die nicht die Klassen vorhersagen, zu denen Beispiele gehören, sondern die Wahrscheinlichkeit, dass …

4
Berechnen Sie den Mittelwert der Ordnungszahl
Ich habe an einer Reihe von Stellen gelesen, dass die Berechnung des Mittelwerts einer Ordnungszahl ungeeignet ist. Ich versuche, eine Vorstellung davon zu bekommen, warum es unangemessen sein könnte. Ich denke, das liegt daran, dass eine Ordinalvariable im Allgemeinen nicht normal verteilt ist und die Berechnung des Mittelwerts daher eine …

8
Statistik ist nicht Mathe?
Ist Statistik Mathematik oder nicht? Angesichts der Tatsache, dass es sich um Zahlen handelt, die zumeist von mathematischen Abteilungen unterrichtet werden und für die Sie Mathematik-Credits erhalten, frage ich mich, ob die Leute es nur halb im Scherz meinen, wenn sie es sagen, wie wenn sie sagen, es sei ein …

3
Konfidenzintervall von RMSE
Ich habe eine Stichprobe von Datenpunkten aus einer Population entnommen . Jeder dieser Punkte hat einen wahren Wert (bekannt aus der Grundwahrheit) und einen geschätzten Wert. Ich berechne dann den Fehler für jeden abgetasteten Punkt und berechne dann den RMSE der Probe.nnn Wie kann ich dann basierend auf der Stichprobengröße …

4
Unterschied zwischen ANOVA- und Kruskal-Wallis-Test
Ich lerne R und experimentiere mit der Varianzanalyse. Ich habe beide ausgeführt kruskal.test(depVar ~ indepVar, data=df) und anova(lm(depVar ~ indepVar, data=dF)) Gibt es einen praktischen Unterschied zwischen diesen beiden Tests? Nach meinem Verständnis bewerten beide die Nullhypothese, dass die Populationen den gleichen Mittelwert haben.

12
Beispiele aus der Praxis für Verteilungen mit negativer Schiefe
Inspiriert von " Beispielen gängiger Distributionen aus der Praxis ", frage ich mich, welche pädagogischen Beispiele Menschen verwenden, um eine negative Schiefe zu demonstrieren. Es gibt viele "kanonische" Beispiele für symmetrische oder Normalverteilungen im Unterricht - auch wenn solche wie Größe und Gewicht eine genauere biologische Prüfung nicht überstehen! Der …

2
Was ist die vielfältige Annahme beim teilüberwachten Lernen?
Ich versuche herauszufinden, was die mannigfaltige Annahme im semi-überwachten Lernen bedeutet. Kann jemand auf einfache Weise erklären? Ich kann die Intuition dahinter nicht verstehen. Es besagt, dass Ihre Daten auf einer niedrigdimensionalen Mannigfaltigkeit liegen, die in einem höherdimensionalen Raum eingebettet ist. Ich habe nicht verstanden, was das bedeutet.




2
Verwendung der Cross-Validation-Funktionen von scikit-learn für Multi-Label-Klassifikatoren
Ich teste verschiedene Klassifikatoren in einem Datensatz, in dem es 5 Klassen gibt und jede Instanz zu einer oder mehreren dieser Klassen gehören kann. Daher verwende ich speziell die Multi-Label-Klassifikatoren von scikit-learn sklearn.multiclass.OneVsRestClassifier. Jetzt möchte ich eine Kreuzvalidierung mit der durchführen sklearn.cross_validation.StratifiedKFold. Dies erzeugt den folgenden Fehler: Traceback (most recent …

1
Sandwich Estimator Intuition
Wikipedia und die Vignette des R-Sandwich-Pakets geben gute Informationen über die Annahmen, die OLS-Koeffizienten-Standardfehler stützen, und den mathematischen Hintergrund der Sandwich-Schätzer. Ich bin mir immer noch nicht sicher, wie das Problem der heteroskedastischen Residuen angegangen wird, wahrscheinlich, weil ich die Standard-Varianzschätzung der OLS-Koeffizienten überhaupt nicht vollständig verstehe. Was ist die …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.