Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Formale Rechtfertigung der Bayes'schen Folgerung als Modell für den Glauben
Ich erinnere mich an einen Beweis, dass die Bayes'sche Wahrscheinlichkeitstheorie die einzig gültige Methode zur Darstellung von Überzeugungen ist Wir repräsentieren den Glauben durch eine nicht negative Funktion in einem Bereich von Ergebnissen Überzeugungen sind subadditiv ... Daher ist die Bayes'sche Wahrscheinlichkeitstheorie der einzig gültige Ansatz zur Darstellung von Überzeugungen. …

3
Kann eine multivariate Verteilung mit einer singulären Kovarianzmatrix eine Dichtefunktion haben?
Angenommen, eine multivariate Verteilung über hat eine singuläre Kovarianzmatrix. Können wir daraus schließen, dass es keine Dichtefunktion hat?RnRn\mathbb R^n Zum Beispiel ist dies bei der multivariaten Normalverteilung der Fall, aber ich bin nicht sicher, ob dies für alle anderen multivariaten Verteilungen zutrifft. Ich denke, dies ist eine Frage der Existenz …

1
Testen auf Überdispersion in der logistischen Regression
R in Action (Kabacoff, 2011) schlägt die folgende Routine vor, um die Überdispersion in einer logistischen Regression zu testen: Passen Sie die logistische Regression mithilfe der Binomialverteilung an: model_binom <- glm(Species=="versicolor" ~ Sepal.Width, family=binomial(), data=iris) Anpassung der logistischen Regression mithilfe der Quasibinomverteilung: model_overdispersed <- glm(Species=="versicolor" ~ Sepal.Width, family=quasibinomial(), data=iris) Verwenden …

1
Variationsinferenzmaschinen
Nach einigen Recherchen zu diesem Thema habe ich ein überraschendes Defizit an Inferenzpaketen und Bibliotheken festgestellt, die auf Nachrichtenübermittlungs- oder Optimierungsmethoden für Python und R beruhen. Nach meinem besten Wissen sind diese Methoden äußerst nützlich. Zum Beispiel sollte für ein Bayes-Netzwerk (gerichtet, azyklisch) die Glaubensausbreitung allein in der Lage sein, …

2
Warum gibt es keine Datenmodelle mit einer aufgeblasenen Anzahl?
Ich arbeite mit dem psclPaket an Datenmodellen mit Null-Inflation . Ich frage mich nur, warum es keine Entwicklung von Modellen für Datenmodelle mit einer aufgeblasenen Anzahl gibt! Auch, warum es keine Entwicklung von bimodalen, sagen wir null und zwei aufgeblasenen Zähldatenmodellen gibt! Einmal habe ich einmal aufgeblasene Poisson-Daten generiert und …

2
Erstellen eines Klassifizierungsmodells für streng binäre Daten
Ich habe einen Datensatz, der streng binär ist. Der Wertesatz jeder Variablen befindet sich in der Domäne: true, false. Die "besondere" Eigenschaft dieses Datensatzes ist, dass eine überwältigende Mehrheit der Werte "falsch" ist. Ich habe bereits einen Bayes'schen Netzwerk-Lernalgorithmus verwendet, um ein Netzwerk aus den Daten zu lernen. Für einen …


1
Was bedeutet "PCA (Principal Component Analysis) Sphären der Daten"?
Ich habe einige Notizen gelesen und es heißt, dass PCA "die Daten kugeln" kann. Was sie für mich als "Sphärieren der Daten" definieren, ist das Teilen jeder Dimension durch die Quadratwurzel des entsprechenden Eigenwerts. Ich gehe davon aus, dass mit "Dimension" jeder Basisvektor gemeint ist, in den wir projizieren (dh …
8 pca 

2
Gradient der multivariaten Gaußschen Log-Wahrscheinlichkeit
Ich versuche, die MAP-Schätzung für ein Modell durch Gradientenabstieg zu finden. Mein Prior ist ein multivariater Gaußscher mit einer bekannten Kovarianzmatrix. Auf konzeptioneller Ebene glaube ich zu wissen, wie man das macht, aber ich hatte auf Hilfe bei den Details gehofft. Insbesondere wenn es einen einfacheren Weg gibt, sich dem …

1
Vorhersage unregelmäßiger Zeitreihen (mit R)
Es gibt verschiedene Methoden, um Vorhersagen für äquidistante Zeitreihen zu treffen (z. B. Holt-Winters, ARIMA, ...). Derzeit arbeite ich jedoch an dem folgenden Datensatz mit unregelmäßigen Abständen, der eine unterschiedliche Anzahl von Datenpunkten pro Jahr und keine regelmäßigen Zeitintervalle zwischen diesen Punkten aufweist: Plot: Beispieldaten: structure(list(date = structure(c(664239600, 665449200, 666658800, …

1
Muss ich bei Verwendung von 'lmerTest' 'lme4' zitieren?
Ich verwende lmerTest, um lineare gemischte Modelle (LMM) auszuführen, um die p-Werte zu erhalten. In den Artikeln, die ich geschrieben habe, werden sie jedoch sowohl lme4als auch zeigen lmerTest. Dann bin ich mir nicht sicher, ob ich auch zitieren muss, lme4wenn ich nur lmerTestLMM-Modelle verwende. Hast du eine Idee dazu?
8 r 

1
Ermittlung der am besten korrelierten Zeitreihen
Bevor ich frage, lese ich ähnliche Fragen, aber keine davon führt zu zufriedenstellenden Antworten für mein spezifisches Interesse. Ich möchte eine Klimazeitreihe der Niederschläge der Dominikanischen Republik über 64 Jahre (1940-2003) homogenisieren. Dafür ist es wirklich wichtig, eine Referenzserie aus einer Gruppe von Kandidaten auszuwählen. Angenommen, es sjohandelt sich um …


1
Wahrscheinlichkeitsrätsel über Zombies [geschlossen]
Geschlossen . Diese Frage erfordert Details oder Klarheit . Derzeit werden keine Antworten akzeptiert. Möchten Sie diese Frage verbessern? Fügen Sie Details hinzu und klären Sie das Problem, indem Sie diesen Beitrag bearbeiten . Geschlossen vor 9 Monaten . Ich denke darüber nach, ein einfaches Spiel über Zombies zu schreiben. …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.