Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Verteilungen auf dem Simplex mit korrelierten Komponenten
Ich suche nach einer Art Verteilung über den Simplex, in der Komponenten auf ordinale Weise korreliert werden. Das heißt, wenn p=(p1,...,pJ)p=(p1,...,pJ)p = (p_1, ..., p_J) aus unserer Verteilung auf dem Simplex gezogen wird, ich möchte pipip_i positiv mit seinen Nachbarn korreliert werden und , sag. Ein Vanille-Dirichlet kann diese Anforderung …

2
Lösen einer einfachen Integralgleichung durch Zufallsstichprobe
Sei eine nichtnegative Funktion. Ich bin daran interessiert, so zu finden, dass Die Einschränkung : Alles was ich tun kann, ist an Punkten in . Ich kann jedoch die Orte, an denen ich zufällig probiere, nach Belieben auswählen . fffz∈[0,1]z∈[0,1]z \in [0,1]∫z0f(x)dx=12∫10f(x)dx∫0zf(x)dx=12∫01f(x)dx \int_0^{z} f(x)\,dx = \frac{1}{2}\int_0^1 f(x)\,dxfff[0,1][0,1][0,1]fff Fragen: Ist es …



1
Erkennung von Plagiaten im Multiple-Choice-Test
Angenommen, ein Aufsichtspersonal vermutet, dass ein Schüler während einer Multiple-Choice-Prüfung Antworten von der Arbeit eines anderen Schülers kopiert. Sie überprüft später ihre Antworten und findet einige Ähnlichkeiten - aber andererseits gibt es aufgrund der Art der Prüfung zwangsläufig Ähnlichkeiten. Wie sollte sie feststellen, ob ihr Verdacht begründet war? Mit anderen …

1
Vielfältige Regularisierung unter Verwendung eines Laplace-Graphen in SVM
Ich versuche, die Manifold-Regularisierung in Support Vector Machines (SVMs) in Matlab zu implementieren. Ich folge den Anweisungen in der Arbeit von Belkin et al. (2006), da ist die Gleichung drin: f∗=argminf∈Hk∑li=1V(xi,yi,f)+γA∥f∥2A+γI∥f∥2If∗=argminf∈Hk∑i=1lV(xi,yi,f)+γA‖f‖A2+γI‖f‖I2f^{*} = \text{argmin}_{f \in H_k}\sum_{i=1}^{l}V\left(x_i,y_i,f\right)+\gamma_{A}\left\| f \right\|_{A}^{2}+\gamma_{I}\left\| f \right\|_{I}^{2} wobei V eine Verlustfunktion ist und das Gewicht der Norm der …

1
Das Behrens-Fisher-Problem verstehen
Dieser Abschnitt von diesem Artikel sagt: Ronald Fisher führte 1935 eine Referenzinferenz ein, um sie auf dieses Problem anzuwenden. Er bezog sich auf eine frühere Arbeit von WV Behrens von 1929. Behrens und Fisher vorgeschlagen , um die Wahrscheinlichkeitsverteilung zu finden wobeiˉx1undˉx2die beiden Stichprobenmittel sind unds1unds2ihre Standardabweichungen sind. [. . …

1
Welche anderen Verteilungen auf [0,1] als die Beta-Verteilung bilden schöne Verbindungen mit der Binomialverteilung?
Für welche Distributionen x außer Beta ist die X-Binomial-Distribution gut? Die Beta- und Binomialverteilungen sind bekanntermaßen konjugiert, aber ich bin gespannt, ob andere nicht konjugierte Verteilungen vergleichsweise einfache zusammengesetzte pmfs ergeben. Mit nett meine ich, dass die pmf schön zu berechnen ist, ohne auf numerische Integration zurückzugreifen; Ich beziehe mich …

1
Konfidenzintervalle bei Verwendung des Bayes-Theorems
Ich berechne einige bedingte Wahrscheinlichkeiten und zugehörige 95% -Konfidenzintervalle. In vielen meiner Fälle habe ich eine einfache Anzahl von xErfolgen aus nVersuchen (aus einer Kontingenztabelle), sodass ich ein Binomial-Konfidenzintervall verwenden kann, wie es binom.confint(x, n, method='exact')in in angegeben ist R. In anderen Fällen habe ich solche Daten jedoch nicht, daher …

4
p-Wert als Abstand?
Können p-Werte zwischen mehreren paarweisen Tests als Ähnlichkeits- / Abstandsmaß betrachtet und eine mehrdimensionale Skalierung auf eine paarweise Matrix von p-Werten angewendet werden, um die Dimensionalität zu verringern? Dies ist eine weiche Frage, aber was wäre hier das größte Problem, und wie könnte dies am besten überwunden werden? (Beispiel: dreieckige …

2
Dirichlet-Prozesse für betreutes Lernen?
Wenn ich mich hier umschaue, scheinen die modischen Lernalgorithmen Dinge wie neuronale Netze, verstärkte Bäume, Support-Vektor-Maschinen, zufällige Wälder und Freunde für überwachte Lernprobleme zu fördern. Dirichlet-Prozesse und ihre Art scheinen hauptsächlich bei unbeaufsichtigten Lernproblemen wie Dokumenten- oder Bildclustern erwähnt zu werden. Ich sehe, dass sie für Regressionsprobleme oder als Allzweckprioren …

1
Mittlere Vergleiche nach mehrfacher Imputation
Ich muss einige einfache Mittelwertvergleiche zwischen Gruppen (grundlegende ANOVA F-Tests) mit Daten mit fehlenden Werten durchführen. Ich verwende das Mäusepaket in R für die Mehrfachimputation, kann aber nur Ergebnisse für die linearen Modellkoeffizienten oder bündeln .R.2R2R^2 Weiß jemand, wie man kombiniert, um mehrere F-Statistiken aus jeder linearen Modellanpassung zu bündeln? …


3
OLS: in der 1. Gleichung spannt Standardfehler in der 2. Gleichung vor?
Angenommen, Xit,YitXit,Yit{X_{it}},{Y_{it}} sind Zeitreihen mit Xit∼N(0.1,1)Xit∼N(0.1,1)X_{it}\sim N(0.1,1) , ( σ2(Yit)=1σ2(Yit)=1\sigma^2(Y_{it}) = 1 und mean(Yit)mean(Yit)mean(Y_{it}) ähnelt dem für XitXitX_{it} , ändert sich jedoch, wenn der Dummy = 1) ist. und t∈{1,2,...,200}t∈{1,2,...,200}t \in \{1,2,...,200\} , i∈{1,2,...,N}i∈{1,2,...,N}i \in \{1,2,...,N\} . In einer realen Welt sind dies periodische Börsenrenditen gegenüber NNN Unternehmen (aber Sie …

2
Wie hängt die inverse Gammaverteilung mit
Vorausgesetzt, dass die hintere Schätzung von einer normalen Wahrscheinlichkeit und eines inversen Gammas vor σ 2 ist:σ′2σ′2\sigma'^{2}σ2σ2\sigma^2 σ′2∼IG(α+n2,β+∑ni=1(yi−μ)22)σ′2∼IG(α+n2,β+∑i=1n(yi−μ)22)\sigma'^{2}\sim\textrm{IG}\left(\alpha + \frac{n}{2}, \beta +\frac{\sum_{i=1}^n{(y_i-\mu)^2}}{2}\right) das ist äquivalent zu σ′2∼IG(n2,nσ22)σ′2∼IG(n2,nσ22)\sigma'^{2}\sim\textrm{IG}\left( \frac{n}{2}, \frac{n\sigma^2}{2}\right) da eine schwache , bevor sie auf σ 2 entfernt & alpha und β aus Gleichung 1:IG(α,β)IG(α,β)\textrm{IG}(\alpha, \beta)σ2σ2\sigma^2αα\alphaββ\beta σ′2∼IG(n2,∑ni=1(yi−μ)22)σ′2∼IG(n2,∑i=1n(yi−μ)22)\sigma'^{2}\sim\textrm{IG}\left( \frac{n}{2}, \frac{\sum_{i=1}^n{(y_i-\mu)^2}}{2}\right) …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.