Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren



4
Graph-Clustering-Algorithmen, die negative Gewichte berücksichtigen
Ich habe eine Diagramminstanz mit gewichteten gerichteten Kanten, deren Werte im Bereich [-1,1] liegen können. Ich muss Clustering in diesem Diagramm durchführen, um Gruppen herauszufinden, in denen Eckpunkte stärker korreliert sind. Ich habe nach mehreren Algorithmen gesucht, die auf Clustering oder Community-Erkennungsgraphen basieren, aber die meisten funktionieren aufgrund der negativen …

1
X, Y univariate Zufallsvariable mit : Sind sie unabhängig?
Sei und univariate Zufallsvariablen mit CDF so dass: wobei , sind bekannte Funktionen.X:Ω→RX:Ω→RX:\Omega\to\mathbb{R}Y:Ω→RY:Ω→RY:\Omega\to\mathbb{R}FX,Y(x,y)FX,Y(x,y)F_{X,Y}(x,y)FX,Y(x,y)=G1(x)G2(y),∀(x,y)∈R×RFX,Y(x,y)=G1(x)G2(y),∀(x,y)∈R×R F_{X,Y}(x,y)=G_1(x)G_2(y),\forall (x,y)\in\mathbb{R}\times\mathbb{R} G1:R→RG1:R→RG_1:\mathbb{R}\to\mathbb{R}G2:R→RG2:R→RG_2:\mathbb{R}\to\mathbb{R} Frage : Stimmt es, dass und unabhängige Wohnmobile sind?XXXYYY Kann mir jemand ein paar Tipps geben? Ich habe versucht: aber ich weiß nicht warum (oder ob) \ lim_ {y \ to \ infty} G_2 …

1
Bayesianische Regression mit Singular - Ist der Posterior gut definiert?
SE-Community, ich hoffe, einige Einblicke in das folgende Problem zu bekommen. Bei einem einfachen linearen Regressionsmodell ist Unter einer Gaußschen Wahrscheinlichkeitsfunktion mit homoskedastischen Fehlertermen nimmt die bedingte Verteilung der abhängigen Variablen die Form Ich weise ein bedingtes (nicht informatives) Konjugat vor und waren . Es ist ein Standardergebnis, dass die …


1
Schätzung der Kernel-Dichte des np-Pakets mit dem Epanechnikov-Kernel
Ich arbeite mit dem "Geysir" -Datensatz aus dem MASS-Paket und vergleiche Kernel-Dichteschätzungen des np-Pakets. Mein Problem ist es, die Dichteschätzung unter Verwendung der Kreuzvalidierung der kleinsten Quadrate und des Epanechnikov-Kernels zu verstehen: blep<-npudensbw(~geyser$waiting,bwmethod="cv.ls",ckertype="epanechnikov") plot(npudens(bws=blep)) Für den Gaußschen Kernel scheint es in Ordnung zu sein: blga<-npudensbw(~geyser$waiting,bwmethod="cv.ls",ckertype="gaussian") plot(npudens(bws=blga)) Oder wenn ich den …


2
Schiefe, Kurtosis und wie viele Standardabweichungen vom Mittelwert abweichen
Wie für die Normalverteilung bekannt ist, liegen 68% der Wahrscheinlichkeitsmasse innerhalb einer Standardabweichung des Mittelwerts, 95% innerhalb von zwei Standardabweichungen und 99,7% innerhalb von 3 Standardabweichungen. Ich habe jedoch einige empirische Verteilungen, die leptokurtisch und negativ verzerrt sind. Gibt es unter solchen Umständen eine Formel, die auf ihren Momenten höherer …

1
Kann ich die Parameter einer logarithmischen Normalverteilung aus dem Stichprobenmittelwert und dem Median ermitteln?
Ich habe die Mittel- und Medianwerte für eine Stichprobe aus einer logarithmischen Normalverteilung. Beachten Sie, dass dies nicht der Mittelwert und der Median der Protokolle der Variablen ist, obwohl ich natürlich die Protokolle des Mittelwerts und des Medians berechnen kann. Gibt es aus diesen Informationen eine geschlossene Lösung für μ …


3
Warum sagen GLMs den Mittelwert und nicht den Modus voraus?
Warum sagt ein GLM den Mittelwert und nicht den Modus eines Signals voraus? Widerspricht dies nicht der Grundlage des GLM, dh der maximalen Wahrscheinlichkeit? Die zu lösenden Gleichungen für die Modellparameter in einem GLM basieren auf der Maximierung der Wahrscheinlichkeit, wie durch die Wahrscheinlichkeitsverteilung des modellierten Signals beschrieben. Diese Wahrscheinlichkeitsverteilung …

4
Wäre ein
Nehmen wir an, wir kennen den Mittelwert einer bestimmten Verteilung. Beeinflusst dies die Intervallschätzung der Varianz einer Zufallsvariablen (die ansonsten anhand der Stichprobenvarianz berechnet wird)? Können wir wie in ein kleineres Intervall für das gleiche Konfidenzniveau erhalten?

1
Können Sie den Kolmogorov-Smirnov-Test verwenden, um die Äquivalenz zweier Verteilungen direkt zu testen?
Es wurde über andere Fragen gesprochen, wie man den TOST-Ansatz (Two One-Sided Tests) für den Kolmogorov-Smirnov (KS) -Test verwenden könnte, aber ich habe mich gefragt, ob es möglich ist, die Teststatistik direkt zu verwenden, um diese beiden zu zeigen Verteilungen waren ähnlich? Soweit ich weiß, stellt die KS-Teststatistik den größten …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.