Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Was bedeutet Theta?
Ich bin ein Neuling in der Statistik und habe dies gefunden . In der Statistik ist θ, der griechische Kleinbuchstabe 'Theta', der übliche Name für einen (Vektor von) Parameter (n) einer allgemeinen Wahrscheinlichkeitsverteilung. Ein häufiges Problem besteht darin, den oder die Werte von Theta zu finden. Beachten Sie, dass die …

2
Leidet die GBM-Klassifizierung unter unausgewogenen Klassengrößen?
Ich habe es mit einem Problem der überwachten binären Klassifizierung zu tun. Ich möchte das GBM-Paket verwenden, um Personen als nicht infiziert / infiziert zu klassifizieren. Ich habe 15-mal mehr nicht infizierte als infizierte Personen. Ich habe mich gefragt, ob GBM-Modelle unter unausgeglichenen Klassengrößen leiden? Ich habe keine Referenzen gefunden, …

1
Geschlossene Form für die Quantile von
Ich habe zwei Zufallsvariablen, wobei U ( 0 , 1 ) die gleichmäßige 0-1-Verteilung ist.αi∼iid U(0,1),i=1,2αich∼iid U(0,1),ich=1,2\alpha_i\sim \text{iid }U(0,1),\;\;i=1,2U(0,1)U(0,1)U(0,1) Dann ergeben diese einen Prozess, sagen wir: P(x)=α1sin(x)+α2cos(x),x∈(0,2π)P(x)=α1Sünde⁡(x)+α2cos⁡(x),x∈(0,2π)P(x)=\alpha_1\sin(x)+\alpha_2\cos(x), \;\;\;x\in (0,2\pi) Nun habe ich mich gefragt, ob es einen Ausdruck in geschlossener Form für das theoretische 75 - Prozent - Quantil von …

1
Erwarteter Wert der Log-Determinante einer Wishart-Matrix
Sei , dh verteilt nach einer D × D- dimensionalen Wishart-Verteilung mit dem Mittelwert ν Ψ und Freiheitsgraden ν . Ich möchte einen Ausdruck für E ( log | Λ | ) wo | Λ |Λ ~ WD( ν, Ψ )Λ∼WD(ν,Ψ)\Lambda \sim \mathcal W_D(\nu, \Psi)D × DD×DD \times DνΨνΨ\nu \Psiνν\nuE( …

3
Rastersuche zur k-fachen Kreuzvalidierung
Ich habe einen Datensatz von 120 Proben in einer 10-fachen Kreuzvalidierungseinstellung. Derzeit wähle ich die Trainingsdaten des ersten Holdouts aus und führe eine 5-fache Kreuzvalidierung durch, um die Werte von Gamma und C durch Gittersuche zu ermitteln. Ich verwende SVM mit RBF-Kernel. Führen Sie diese Rastersuche in den Trainingsdaten jedes …

2
Messungen der Restheteroskedastizität
Dieser Wikipedia- Link listet eine Reihe von Techniken auf, um die Heteroskedastizität von OLS-Resten zu erkennen. Ich möchte erfahren, welche praktische Technik bei der Erkennung von Regionen, die von Heteroskedastizität betroffen sind, effizienter ist. Zum Beispiel hat hier die zentrale Region in der OLS-Darstellung "Residuals vs Fitted" eine höhere Varianz …


3
Auto.arima vs Autobox unterscheiden sie sich?
Aus dem Lesen von Beiträgen auf dieser Site weiß ich, dass es eine R- Funktion gibt auto.arima (im forecast Paket ). Ich weiß auch, dass IrishStat , ein Mitglied dieser Site, Anfang der 1980er Jahre das kommerzielle Paket autobox erstellt hat . Da diese beiden Pakete heute existieren und automatisch …

1
Gaußscher Prozess: Eigenschaften der Funktionsnäherung
Ich lerne etwas über den Gaußschen Prozess und habe nur Kleinigkeiten gehört. Würde mich sehr über Kommentare und Antworten freuen. Stimmt es, dass eine Gaußsche Prozessfunktionsnäherung für jeden Datensatz an den Datenpunkten null oder einen vernachlässigbaren Anpassungsfehler ergibt? An anderer Stelle hörte ich auch, dass der Gauß-Prozess besonders gut für …

2
Was sind R-Struktur G-Struktur in einem glmm?
Ich habe das MCMCglmmPaket vor kurzem benutzt. Ich bin verwirrt von dem, was in der Dokumentation als R-Struktur und G-Struktur bezeichnet wird. Diese scheinen sich auf die zufälligen Effekte zu beziehen - insbesondere die Angabe der Parameter für die vorherige Verteilung auf sie, aber die Diskussion in der Dokumentation scheint …

2
Wie führe ich eine bidirektionale ANOVA für Daten durch, bei denen weder Normalität noch Varianzgleichheit in R vorliegen?
Ich arbeite gerade an meiner Masterarbeit und habe vor, die Statistik mit SigmaPlot zu erstellen. Nachdem ich einige Zeit mit meinen Daten verbracht hatte, kam ich jedoch zu dem Schluss, dass SigmaPlot möglicherweise nicht für mein Problem geeignet ist (ich könnte mich irren), und startete meine ersten Versuche in R, …

3
Benötigt MLE ID-Daten? Oder nur unabhängige Parameter?
Das Schätzen von Parametern unter Verwendung der Maximum-Likelihood-Schätzung (MLE) umfasst das Bewerten der Likelihood-Funktion, die die Wahrscheinlichkeit des Auftretens der Stichprobe (X) auf Werte (x) im Parameterraum (θ) bei gegebener Verteilungsfamilie (P (X = x | θ) abbildet Alle Beispiele, die ich gesehen habe, beinhalten die Berechnung von P (X …

2
Rücktransformation von Regressionskoeffizienten
Ich mache eine lineare Regression mit einer transformierten abhängigen Variablen. Die folgende Transformation wurde durchgeführt, damit die Annahme der Normalität der Residuen gelten würde. Die nicht transformierte abhängige Variable war negativ verzerrt, und die folgende Transformation hat sie nahezu normalisiert: Y=50−Yorig−−−−−−−−√Y=50−YorigY=\sqrt{50-Y_{orig}} wobei YorigYorigY_{orig} ist die abhängige Variable auf dem Originalmaßstab. …


3
Finden der MLE für einen univariaten exponentiellen Hawkes-Prozess
Der univariate exponentielle Hawkes-Prozess ist ein aufregender Punktprozess mit einer Ereignisankunftsrate von: λ ( t ) = μ + ∑tich&lt; tα e- β( t - tich)λ(t)=μ+∑ti&lt;tαe−β(t−ti) \lambda(t) = \mu + \sum\limits_{t_i<t}{\alpha e^{-\beta(t-t_i)}} Dabei sind die Ereignisankunftszeiten.t1, . . tnt1,..tn t_1,..t_n Die Log Likelihood Funktion ist - tnμ + αβ∑ ( …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.