Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


7
Warum sollte man sich in Naive Bayes mit Laplace-Glättung beschäftigen, wenn das Testset unbekannte Wörter enthält?
Ich habe heute über die Naive Bayes-Klassifikation gelesen. Ich las unter der Überschrift Parameterschätzung mit add 1 Glättung : Verweisen Sie mit ccc auf eine Klasse (z. B. Positiv oder Negativ) und mit www auf ein Token oder Wort. Der Maximum - Likelihood - Schätzer für P(w|c)P(w|c)P(w|c) ist count(w,c)count(c)=counts w …

3
Verteilung von Skalarprodukten zweier zufälliger Einheitsvektoren in Dimensionen
Wenn und zwei unabhängige zufällige Einheitsvektoren in (gleichmäßig auf einer Einheitskugel verteilt), wie lautet die Verteilung ihres Skalarprodukts (Skalarprodukt) ?xx\mathbf{x}yy\mathbf{y}RDRD\mathbb{R}^Dx⋅yx⋅y\mathbf x \cdot \mathbf y Ich vermute, als wächst, wird die Verteilung schnell normal (?), Wobei der Mittelwert Null und die Varianz in höheren Dimensionen abnehmen. aber gibt es eine explizite …

4
Erkennen von Ausreißern anhand von Standardabweichungen
Wenn ich hier meine Frage beantworte , frage ich mich, ob es starke Ansichten für oder gegen die Verwendung der Standardabweichung zur Erkennung von Ausreißern gibt (z. B. ist jeder Datenpunkt mit mehr als 2 Standardabweichungen ein Ausreißer). Ich weiß, dass dies vom Kontext der Studie abhängt, zum Beispiel wird …
27 outliers 


2
Varianzschätzungen in der k-fachen Kreuzvalidierung
Die K-fache Kreuzvalidierung kann verwendet werden, um die Verallgemeinerungsfähigkeit eines gegebenen Klassifikators abzuschätzen. Kann (oder sollte) ich aus allen Validierungsläufen auch eine gepoolte Varianz berechnen, um eine bessere Schätzung der Varianz zu erhalten? Wenn nein, warum? Ich habe Papiere gefunden, die die gepoolte Standardabweichung über Kreuzvalidierungsläufe verwenden . Ich habe …

3
Ist Bleaching immer gut?
Ein üblicher Vorverarbeitungsschritt für maschinelle Lernalgorithmen ist das Aufhellen von Daten. Es scheint, dass es immer gut ist, das Weißmachen durchzuführen, da die Daten dekorreliert werden, was die Modellierung vereinfacht. Wann wird Bleaching nicht empfohlen? Hinweis: Ich beziehe mich auf die Dekorrelation der Daten.

1
Was ist der Unterschied zwischen verallgemeinerten Schätzgleichungen und GLMM?
Ich verwende ein GEE mit 3-Level-Daten, die nicht ausbalanciert sind, und benutze einen Logit-Link. Wie unterscheidet sich dies (in Bezug auf die Schlussfolgerungen, die ich ziehen kann, und die Bedeutung der Koeffizienten) von einem GLM mit gemischten Effekten (GLMM) und einem Logit-Link? Weitere Einzelheiten: Die Beobachtungen sind einzelne Bernoulli-Versuche. Sie …




2
Was ist der Unterschied zwischen der Varianz und dem mittleren quadratischen Fehler?
Ich bin überrascht, dass dies noch nicht gestellt wurde, aber ich kann die Frage nicht auf stats.stackexchange finden. Dies ist die Formel zur Berechnung der Varianz einer normalverteilten Stichprobe: ∑(X−X¯)2n−1∑(X−X¯)2n−1\frac{\sum(X - \bar{X}) ^2}{n-1} Dies ist die Formel zur Berechnung des mittleren quadratischen Fehlers von Beobachtungen in einer einfachen linearen Regression: …
27 variance  error 




Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.