Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Erklärung für nicht ganzzahlige Freiheitsgrade bei t-Test mit ungleichen Varianzen
Das SPSS t-Test-Verfahren meldet 2 Analysen, wenn 2 unabhängige Mittelwerte verglichen werden, eine Analyse mit angenommenen gleichen Abweichungen und eine mit nicht angenommenen gleichen Abweichungen. Die Freiheitsgrade (df) bei Annahme gleicher Varianzen sind immer ganzzahlige Werte (und gleich n-2). Die df, wenn gleiche Varianzen nicht angenommen werden, sind nicht ganzzahlig …

3
Wie wählt man eine optimale Anzahl latenter Faktoren bei der nicht-negativen Matrixfaktorisierung?
Bei gegebener Matrix findet die nicht negative Matrixfaktorisierung (NMF) zwei nicht negative Matrizen und ( dh mit allen Elementen ) zur Darstellung der zerlegten Matrix als:Vm×nVm×n\mathbf V^{m \times n}Wm×kWm×k\mathbf W^{m \times k}Hk×nHk×n\mathbf H^{k \times n}≥0≥0\ge 0 V≈WH,V≈WH,\mathbf V \approx \mathbf W\mathbf H, Zum Beispiel, indem Sie verlangen, dass nicht negative …

4
Bedeutung latenter Merkmale?
Ich versuche, Matrixfaktorisierungsmodelle für Empfehlungssysteme zu verstehen und lese immer "latente Merkmale", aber was bedeutet das? Ich weiß, was eine Funktion für einen Trainingsdatensatz bedeutet, kann aber die Idee latenter Funktionen nicht verstehen. Jedes Papier zu dem Thema, das ich finden kann, ist einfach zu flach. Bearbeiten: wenn Sie mir …

3
Warum muss man REML (anstelle von ML) verwenden, um unter verschachtelten Var-Covar-Modellen zu wählen?
Verschiedene Beschreibungen zur Modellauswahl für zufällige Effekte von linearen gemischten Modellen weisen an, REML zu verwenden. Ich kenne den Unterschied zwischen REML und ML auf einer bestimmten Ebene, aber ich verstehe nicht, warum REML verwendet werden sollte, weil ML voreingenommen ist. Ist es beispielsweise falsch, mit ML eine LRT für …

1
Wie berechne ich die Reinheit?
Wie berechnen wir in der Clusteranalyse die Reinheit? Wie lautet die Gleichung? Ich suche keinen Code, um das für mich zu tun. Sei ωkωk\omega_k der Cluster k und cjcjc_j die Klasse j. Ist Reinheit also praktisch genau? Es sieht so aus, als würde die Menge der wirklich klassifizierten Klassen pro …
15 clustering 

4
So halten Sie zeitinvariante Variablen in einem Modell mit festen Effekten
Ich habe Daten über die Angestellten eines großen italienischen Unternehmens über zehn Jahre und möchte sehen, wie sich das geschlechtsspezifische Gefälle zwischen Männern und Frauen im Laufe der Zeit verändert hat. Zu diesem Zweck laufen I OLS gepoolt: yit=X′itβ+δmalei+∑t=110γtdt+εityit=Xit′β+δmalei+∑t=110γtdt+εit y_{it} = X'_{it}\beta + \delta {\rm male}_i + \sum^{10}_{t=1}\gamma_t d_t + …


1
Multivariate biologische Zeitreihen: VAR und Saisonalität
Ich habe einen multivariaten Zeitreihendatensatz, der interagierende biologische Variablen und Umgebungsvariablen (plus möglicherweise einige exogene Variablen) enthält. Neben der Saisonalität gibt es in den Daten keinen eindeutigen langfristigen Trend. Mein Ziel ist es zu sehen, welche Variablen miteinander in Beziehung stehen. Prognosen werden nicht wirklich gesucht. Als Neuling in der …

1
Qualitativ was ist Kreuzentropie
Diese Frage gibt eine quantitative Definition der Kreuzentropie in Bezug auf ihre Formel. Ich suche nach einer eher fiktiven Definition, sagt Wikipedia: In der Informationstheorie misst die Kreuzentropie zwischen zwei Wahrscheinlichkeitsverteilungen die durchschnittliche Anzahl von Bits, die zum Identifizieren eines Ereignisses aus einer Menge von Möglichkeiten erforderlich sind, wenn ein …

3
Wie wählt man bei der Bayes'schen Parameterschätzung vor
Ich kenne 3 Methoden zur Parameterschätzung, ML, MAP und Bayes Ansatz. Und für den MAP- und Bayes-Ansatz müssen wir Prioritäten für die Parameter festlegen, richtig? Angenommen, ich habe dieses Modell , in dem α , β Parameter sind. Um die Schätzung unter Verwendung von MAP oder Bayes durchzuführen, habe ich …

1
Warum kann ich die Ausgabe von glmer (family = binomial) nicht mit der manuellen Implementierung des Gauss-Newton-Algorithmus abgleichen?
Ich möchte die Ausgaben von lmer (wirklich glmer) mit einem Spielzeugbinomialbeispiel abgleichen. Ich habe die Vignetten gelesen und glaube zu verstehen, was los ist. Aber anscheinend mache ich nicht. Nachdem ich stecken geblieben war, habe ich die "Wahrheit" in Bezug auf die zufälligen Effekte korrigiert und mich nur um die …



1
Hessisch logistische Funktion
Ich habe Schwierigkeiten die Hessian der Zielfunktion, abzuleiten l ( θ )l(θ)l(\theta) , in logistischer Regression , wo L ( θ )l(θ)l(\theta) ist: L ( θ ) = m Σ i = 1 [ y i log ( h θ ( x i ) ) + ( 1 - y …
15 logistic 

2
Verwechselt mit MCMC Metropolis-Hastings-Variationen: Random-Walk, Non-Random-Walk, Independent, Metropolis
In den letzten Wochen habe ich versucht, MCMC und die Metropolis-Hastings-Algorithmen zu verstehen. Jedes Mal, wenn ich denke, dass ich es verstehe, stelle ich fest, dass ich falsch liege. Die meisten Codebeispiele, die ich online finde, implementieren etwas, das nicht mit der Beschreibung übereinstimmt. Dh: Sie sagen, sie implementieren Metropolis-Hastings, …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.