Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


3
Konzeptionelle Unterscheidung zwischen Heteroskedastizität und Nichtstationarität
Ich habe Probleme, zwischen den Konzepten der Skedastizität und der Stationarität zu unterscheiden. Nach meinem Verständnis ist die Heteroskedastizität eine unterschiedliche Variabilität in Subpopulationen, und die Nichtstationarität ist ein sich im Laufe der Zeit ändernder Mittelwert / Varianz. Wenn dies ein korrektes (wenn auch vereinfachtes) Verständnis ist, ist Nichtstationarität einfach …


1
Unbekannte p-Wert-Berechnung
Ich habe kürzlich ein R-Skript debuggt und fand etwas sehr Seltsames. Der Autor hat seine eigene p-Wert-Funktion definiert pval <- function(x, y){ if (x+y<20) { # x + y is small, requires R.basic p1<- nChooseK(x+y,x) * 2^-(x+y+1); p2<- nChooseK(x+y,y) * 2^-(x+y+1); pvalue = max(p1, p2) } else { # if …


1
Finden der Verteilung einer Statistik
Studieren für einen Test. Konnte diesen nicht beantworten. Sei iid N ( 0 , 1 ) Zufallsvariablen. DefinierenX.1 , ich, X.2 , ich, X.3 , ich, i = 1 , … , nX.1,ich,X.2,ich,X.3,ich,ich=1,…,nX_{1,i},X_{2,i},X_{3,i}, i=1,\ldots,nN.( 0 , 1 )N.(0,1)\mathcal{N}(0,1) W.ich= ( X.1 , ich+ X.2 , ichX.3 , ich) / 1 …

2
"Vergesslichkeit" des Prior in der Bayes'schen Umgebung?
Es ist bekannt, dass der Bayes'sche Prior "vergessen" wird , wenn Sie mehr Beweise haben (z. B. in Form eines größeren für iid-Beispiele), und der größte Teil der Schlussfolgerung wird durch die Beweise (oder die Wahrscheinlichkeit) beeinflusst.nnnnnn Es ist leicht, es für verschiedene spezielle Fälle zu sehen (wie Bernoulli mit …
9 bayesian  prior 


2
Intervallzensiertes Cox-Proportional-Hazards-Modell in R.
Wie führe ich bei intervallzensierten Überlebenszeiten ein intervallzensiertes Cox-PH-Modell durch R? Bei einer erneuten Suche wird das Paket angezeigt intcox, das nicht mehr im RRepository vorhanden ist. Ich bin mir fast sicher, dass die coxphFunktion im survivalPaket keine intervallzensierten Überlebensdaten verarbeiten kann. Außerdem möchte ich die Daten nicht unterstellen und …

1
Ist dies eine korrekte Methode, um eine Wahrscheinlichkeit mithilfe des Bayes-Theorems kontinuierlich zu aktualisieren?
Nehmen wir an, ich versuche herauszufinden, mit welcher Wahrscheinlichkeit Vanille das beliebteste Eis ist. Ich weiß, dass die Person auch Horrorfilme mag. Ich möchte die Wahrscheinlichkeit herausfinden, dass das Lieblingseis der Person Vanille ist, da sie Horrorfilme mag. Ich weiß folgendes: 5%5%5\% der Menschen wählen Vanille als ihren Lieblingseisgeschmack. (Dies …

1
Verwirrung in Bezug auf lineare dynamische Systeme
Ich habe dieses Buch Mustererkennung und maschinelles Lernen von Bishop gelesen. Ich hatte eine Verwirrung in Bezug auf eine Ableitung des linearen dynamischen Systems. In LDS nehmen wir an, dass die latenten Variablen kontinuierlich sind. Wenn Z die latenten Variablen und X die beobachteten Variablen bezeichnet p(zn|zn−1)=N(zn|Azn−1,τ)p(zn|zn−1)=N(zn|Azn−1,τ)p(z_n|z_{n-1}) = N(z_n|Az_{n-1},\tau) p(xn|zn)=N(xn,Czn,Σ)p(xn|zn)=N(xn,Czn,Σ)p(x_n|z_n) …

1
Zentrale Momente symmetrischer Verteilungen
Ich versuche zu zeigen, dass das zentrale Moment einer symmetrischen Verteilung: für ungerade Zahlen Null ist. So zum Beispiel das dritte zentrale MomentIch habe zunächst versucht zu zeigen, dassIch bin mir nicht sicher, wohin ich von hier aus gehen soll, irgendwelche Vorschläge? Gibt es einen besseren Weg, dies zu beweisen?E …

2
SVM-Regression mit Längsschnittdaten
Ich habe ungefähr 500 Variablen pro Patient, jede Variable hat einen kontinuierlichen Wert und wird zu drei verschiedenen Zeitpunkten (nach 2 Monaten und nach 1 Jahr) gemessen. Mit der Regression möchte ich das Behandlungsergebnis für neue Patienten vorhersagen. Ist es möglich, die SVM-Regression mit solchen Längsschnittdaten zu verwenden?


2
Wie verwendet man eine einfache exponentielle Glättung in R?
Ich bin Anfänger in R, Könnten Sie bitte erklären, wie man ses im Prognosepaket der R- Prognose verwendet ? Ich möchte die Anzahl der Anfangsperioden und die Glättungskonstante wählen. d <- c(3,4,41,10,9,86,56,20,18,36,24,59,82,51,31,29,13,7,26,19,20,103,141,145,24,99,40,51,72,58,94,78,11,15,17,53,44,34,12,15,32,14,15,26,75,110,56,43,19,17,33,26,40,42,18,24,69,18,18,25,86,106,104,35,43,12,4,20,16,8) Ich habe 70 Perioden, ich möchte 40 Perioden für die anfängliche und 30 für die Out-of-Sample verwenden. ses(d, …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.