Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


1
Wilcoxon-Rangsummentest in R
Ich habe Ergebnisse aus dem gleichen Test auf zwei unabhängige Proben angewendet: x <- c(17, 12, 13, 16, 9, 19, 21, 12, 18, 17) y <- c(10, 6, 15, 9, 8, 11, 8, 16, 13, 7, 5, 14) Und ich möchte einen Wilcoxon-Rang-Summen-Test berechnen. Wenn ich die Statistik von Hand …

2
AR (1) -Prozess mit heteroskedastischen Messfehlern
1. Das Problem Ich habe einige Messungen einer Variablen ytyty_t , wobei t=1,2,..,nt=1,2,..,nt=1,2,..,n , für die ich eine Verteilung fyt(yt)fyt(yt)f_{y_t}(y_t) die über MCMC erhalten wurde. Der Einfachheit halber nehme ich an, dass es sich um einen Gaußschen Mittelwert von μtμt\mu_t und Varianz σ2tσt2\sigma_t^2 . Ich habe ein physikalisches Modell für …



3
Benötigen Sie einen Algorithmus, um die relative Wahrscheinlichkeit zu berechnen, dass Daten aus der Normal- oder der Lognormalverteilung stammen
Angenommen, Sie haben eine Reihe von Werten, und Sie möchten wissen, ob es wahrscheinlicher ist, dass sie aus einer Gaußschen (Normal-) Verteilung oder aus einer logarithmischen Normalverteilung entnommen wurden. Idealerweise wissen Sie etwas über die Grundgesamtheit oder über die Ursachen von experimentellen Fehlern und hätten daher zusätzliche Informationen, die für …


4
Boxplot-Äquivalent für Heavy-Tailed-Distributionen?
Bei annähernd normal verteilten Daten sind Boxplots eine großartige Möglichkeit, den Median und die Verbreitung der Daten sowie das Vorhandensein von Ausreißern schnell zu visualisieren. Bei stärker schwanzförmigen Verteilungen werden jedoch viele Punkte als Ausreißer angezeigt, da Ausreißer als außerhalb des festgelegten Faktors des IQR liegend definiert sind, und dies …

1
Berechnen Sie mit der k-fachen Kreuzvalidierung den Durchschnitt aller Modelle, um das endgültige Modell zu erstellen?
Wenn Sie eine Kreuzvalidierung mit k-fach durchführen, erhalten Sie die Genauigkeitsmetrik, indem Sie auf alle Falten mit Ausnahme einer auf diese eine Falte zeigen, Vorhersagen treffen und diesen Vorgang mal wiederholen . Sie können dann Genauigkeitsmetriken für alle Ihre Instanzen ausführen (Genauigkeit, Rückruf,% richtig klassifiziert), die gleich sein sollten, als …


3
Wann ist eine Fisher-Z-Transformation angebracht?
Ich möchte eine Stichprobenkorrelation mit p-Werten auf Signifikanz testenrrr H0:ρ=0,H1:ρ≠0.H0:ρ=0,H1:ρ≠0.H_0: \rho = 0, \; H_1: \rho \neq 0. Ich habe verstanden, dass ich die Fisher-Z-Transformation verwenden kann, um dies durch zu berechnen zobs=n−3−−−−−√2ln(1+r1−r)zobs=n−32ln⁡(1+r1−r)z_{obs}= \displaystyle\frac{\sqrt{n-3}}{2}\ln\left(\displaystyle\frac{1+r}{1-r}\right) und Finden des p-Wertes durch p=2P(Z>zobs)p=2P(Z>zobs)p = 2P\left(Z>z_{obs}\right) unter Verwendung der Standardnormalverteilung. Meine Frage ist: Wie …


2
Lineare vs. nichtlineare Regression
Ich habe eine Menge von Werten und y, die theoretisch exponentiell zusammenhängen:xxxyyy y=axby=axby = ax^b Eine Möglichkeit, die Koeffizienten zu erhalten, besteht darin, natürliche Logarithmen auf beiden Seiten anzuwenden und ein lineares Modell zu erstellen: > fit <- lm(log(y)~log(x)) > a <- exp(fit$coefficients[1]) > b <- fit$coefficients[2] Ein anderer Weg, …


1
Wenn Sie ein Regressionsmodell mit separaten Modellierungs- / Validierungssätzen erstellen, ist es angemessen, die Validierungsdaten erneut zu verteilen?
Angenommen, ich habe eine 80/20 Aufteilung zwischen Modellierungs- / Validierungsbeobachtungen. Ich habe ein Modell an den Modellierungsdatensatz angepasst und bin mit dem Fehler, den ich im Validierungsdatensatz sehe, einverstanden. Ist es angebracht, die Validierung mit den Modellierungsdaten zu kombinieren, um aktualisierte Parameterschätzungen für die 100% -Daten zu erhalten, bevor ich …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.