Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Item Response Theory vs. Confirmatory Factor Analysis
Ich habe mich gefragt, was die wichtigsten, bedeutungsvollen Unterschiede zwischen der Item-Response-Theorie und der Bestätigungsfaktor-Analyse sind. Ich verstehe, dass es Unterschiede in den Berechnungen gibt (der Schwerpunkt liegt eher auf Item vs. Covariances; log-linear vs. linear). Ich habe jedoch keine Ahnung, was dies aus einer übergeordneten Perspektive bedeutet. Bedeutet dies, …


5
Was genau sind zensierte Daten?
Ich habe verschiedene Beschreibungen von zensierten Daten gelesen: A) Wie in diesem Thread erläutert , werden nicht quantifizierte Daten unterhalb oder oberhalb eines bestimmten Schwellenwerts zensiert. Nicht quantifiziert bedeutet, dass die Daten einen bestimmten Schwellenwert überschreiten oder unterschreiten, der genaue Wert ist uns jedoch nicht bekannt. Die Daten werden dann …

3
Bootstrap: das Problem der Überanpassung
Angenommen, man führt den sogenannten nichtparametrischen Bootstrap durch, indem man aus den ursprünglichen Beobachtungen jeweils Stichproben der Größe mit Ersetzung zieht . Ich glaube, dieses Verfahren entspricht der Schätzung der kumulativen Verteilungsfunktion durch das empirische cdf:BBBnnnnnn http://en.wikipedia.org/wiki/Empirical_distribution_function und dann Erhalten der Bootstrap-Abtastwerte durch Simulieren von Beobachtungen aus den geschätzten cdf …

1
Vertrauensbereiche für die QQ-Linie
Diese Frage bezieht sich nicht speziell auf R, aber ich habe sie gewählt, um sie Rzu veranschaulichen. Betrachten Sie den Code zum Erzeugen von Konfidenzbändern um eine (normale) qq-Linie: library(car) library(MASS) b0<-lm(deaths~.,data=road) qqPlot(b0$resid,pch=16,line="robust") Ich suche nach einer Erklärung (oder alternativ nach einem Link zu einem Papier- / Online-Dokument, das erklärt), …

2
k-bedeutet vs k-Median?
Ich weiß, dass es einen K-Mittelwert-Clustering-Algorithmus und einen K-Median gibt. Einer, der den Mittelwert als Mittelpunkt des Clusters verwendet, und der andere verwenden den Median. Meine Frage ist: wann / wo welche verwenden?


2
Subjektivität in der Frequenzstatistik
Ich höre oft die Behauptung, dass die Bayes'schen Statistiken sehr subjektiv sein können. Das Hauptargument ist, dass die Schlussfolgerung von der Wahl eines Priores abhängt (obwohl man das Prinzip der Gleichgültigkeit oder der maximalen Entropie anwenden könnte, um einen Prior zu wählen). Im Vergleich dazu, so die Behauptung, ist die …

3
Haben logistische Regressionskoeffizienten eine Bedeutung?
Ich habe ein Problem mit der binären Klassifizierung aufgrund verschiedener Merkmale. Haben die Koeffizienten einer (regularisierten) logistischen Regression eine interpretierbare Bedeutung? Ich dachte, sie könnten die Größe des Einflusses anzeigen, vorausgesetzt, die Funktionen wurden zuvor normalisiert. Bei meinem Problem scheinen die Koeffizienten jedoch empfindlich von den von mir ausgewählten Merkmalen …



1
Wie ist Karl Pearson auf die Chi-Quadrat-Statistik gekommen?
Wie kam Pearson 1900 auf die folgenden Pearson-Chi-Quadrat-Statistiken? K=∑(Oij−Eij)2EijK=∑(Oij−Eij)2Eij K = \sum \frac{(O_{ij} -E_{ij})^2}{E_{ij}} dass K∼χ2K∼χ2 K \sim \chi^2 Hatte er Chi-Quadrat im Sinn und entwickelte die Metrik KKK (Bottom-Up-Ansatz) oder entwickelte er die Statistik und bewies später, dass sie der Chi-Quadrat-Verteilung folgt (Top-Down)? Ich möchte wissen, warum er diese …

1
Maschinelles Lernen Klassifikatoren Big-O oder Komplexität
Um die Leistung eines neuen Klassifikator-Algorithmus zu bewerten, versuche ich, die Genauigkeit und die Komplexität (Big-O in Training und Klassifizierung) zu vergleichen. Aus dem maschinellen Lernen: Nach einer Überprüfung erhalte ich eine vollständige Liste der überwachten Klassifizierer, außerdem eine Genauigkeitstabelle zwischen den Algorithmen und 44 Testprobleme aus dem UCI-Daten-Repository . …

3
Wie berechnet man die Überlappung zwischen den empirischen Wahrscheinlichkeitsdichten?
Ich suche nach einer Methode zur Berechnung der Überlappungsfläche zwischen zwei Kerndichteschätzungen in R als Maß für die Ähnlichkeit zwischen zwei Stichproben. Um dies zu verdeutlichen, müsste ich im folgenden Beispiel die Fläche des violett überlappenden Bereichs quantifizieren: library(ggplot2) set.seed(1234) d <- data.frame(variable=c(rep("a", 50), rep("b", 30)), value=c(rnorm(50), runif(30, 0, 3))) …

3
Berechnen Sie die Kullback-Leibler-Divergenz in der Praxis?
Ich benutze KL Divergence als Maß für die Unähnlichkeit zwischen 2 p.m.f.p.m.f.p.m.f. PPP und QQQ . =-≤P(Xi)ln(Q(Xi))+≤P(Xi)ln(P(Xi))DKL(P||Q)=∑i=1Nln(PiQi)PiDKL(P||Q)=∑i=1Nln⁡(PiQi)PiD_{KL}(P||Q) = \sum_{i=1}^N \ln \left( \frac{P_i}{Q_i} \right) P_i =−∑P(Xi)ln(Q(Xi))+∑P(Xi)ln(P(Xi))=−∑P(Xi)ln(Q(Xi))+∑P(Xi)ln(P(Xi))=-\sum P(X_i)ln\left(Q(X_i)\right) + \sum P(X_i)ln\left(P(X_i)\right) Wenn ist, können wir leicht berechnen, dass P ( X i ) l n ( Q ( X i ) ) …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.