Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


5
Warum verwenden wir eine voreingenommene und irreführende Standardabweichungsformel für
Es war ein kleiner Schock für mich, als ich zum ersten Mal eine Monte-Carlo-Normalverteilungssimulation durchführte und feststellte, dass der Mittelwert von 100100100 Standardabweichungen von 100100100 Stichproben, die alle nur eine Stichprobengröße von n=2n=2n=2 , viel geringer war als, dh Mittelung 2π−−√2π \sqrt{\frac{2}{\pi }} mal dasσσ\sigmadas zur Erzeugung der Grundgesamtheit verwendet …



3
Verteilung der Differenz zwischen zwei Normalverteilungen
Ich habe zwei Wahrscheinlichkeitsdichtefunktionen von Normalverteilungen: f1(x1|μ1,σ1)=1σ12π−−√e−(x−μ1)22σ21f1(x1|μ1,σ1)=1σ12πe−(x−μ1)22σ12f_1(x_1 \; | \; \mu_1, \sigma_1) = \frac{1}{\sigma_1\sqrt{2\pi} } \; e^{ -\frac{(x-\mu_1)^2}{2\sigma_1^2} } und f2(x2|μ2,σ2)=1σ22π−−√e−(x−μ2)22σ22f2(x2|μ2,σ2)=1σ22πe−(x−μ2)22σ22f_2(x_2 \; | \; \mu_2, \sigma_2) = \frac{1}{\sigma_2\sqrt{2\pi} } \; e^{ -\frac{(x-\mu_2)^2}{2\sigma_2^2} } Ich suche nach der Wahrscheinlichkeitsdichtefunktion der Trennung zwischen und x 2 . Ich denke, das heißt, ich …

1
Hat Steins Paradox noch Gültigkeit, wenn anstelle der Norm die
Steins Paradoxon zeigt, dass bei gleichzeitiger Schätzung von drei oder mehr Parametern kombinierte Schätzer existieren, die im Durchschnitt genauer sind (dh einen geringeren erwarteten mittleren quadratischen Fehler aufweisen) als jede Methode, die die Parameter separat behandelt. Dies ist ein sehr eingängiges Ergebnis. Gilt das gleiche Ergebnis, wenn anstelle der Norm …

5
Müssen wir immer noch Features auswählen, während wir Regularisierungsalgorithmen verwenden?
Ich habe eine Frage zum Erfordernis, Merkmalsauswahlmethoden (Wichtigkeitswert für zufällige Gesamtstrukturen oder Auswahlmethoden für univariate Merkmale usw.) zu verwenden, bevor ein statistischer Lernalgorithmus ausgeführt wird. Wir wissen, dass wir Regularisierungsstrafen für die Gewichtsvektoren einführen können, um eine Überanpassung zu vermeiden. Wenn ich also eine lineare Regression durchführen möchte, könnte ich …

1
Beispiele aus der Praxis für Markov-Entscheidungsprozesse
Ich habe viele Tutorial-Videos gesehen und sie sehen gleich aus. Dieses Beispiel: https://www.youtube.com/watch?v=ip4iSMRW5X4 Sie erklären Zustände, Handlungen und Wahrscheinlichkeiten, die in Ordnung sind. Die Person erklärt es ok, aber ich kann einfach nicht in den Griff bekommen, wofür es im wirklichen Leben verwendet werden würde. Bisher habe ich noch keine …

1
Was ist der "Hufeiseneffekt" und / oder der "Bogeneffekt" in der PCA / Korrespondenzanalyse?
In der ökologischen Statistik gibt es viele Techniken zur explorativen Datenanalyse mehrdimensionaler Daten. Dies nennt man "Ordinations" -Techniken. Viele sind die gleichen oder eng mit gängigen Techniken in anderen Bereichen der Statistik verwandt. Vielleicht wäre das prototypische Beispiel die Hauptkomponentenanalyse (PCA). Ökologen könnten PCA und verwandte Techniken verwenden, um „Farbverläufe“ …

4
Lehrbücher zur Matrixrechnung?
Siehe diese Frage auf Math SE . Kurzgeschichte: Ich habe die Elemente des statistischen Lernens gelesen und war frustriert, als ich versuchte, einige der Ergebnisse zu überprüfen, z. B. RSS(β)=(y−Xβ)T(y−Xβ),RSS(β)=(y−Xβ)T(y−Xβ),\text{RSS}(\beta) = \left(\mathbf{y}-\mathbf{X}\beta\right)^{T}\left(\mathbf{y}-\mathbf{X}\beta\right)\text{,} dann ∂RSS∂β=−2XT(y−Xβ)∂2RSS∂β ∂βT=2XTX.∂RSS∂β=−2XT(y−Xβ)∂2RSS∂β ∂βT=2XTX.\begin{align}&\dfrac{\partial\text{RSS}}{\partial \beta} = -2\mathbf{X}^{T}\left(\mathbf{y}-\mathbf{X}\beta\right) \\ &\dfrac{\partial^2\text{RSS}}{\partial \beta\text{ }\partial \beta^{T}} = 2\mathbf{X}^{T}\mathbf{X}\text{.} \end{align} Ich suche ein …




1
Wurde die nach dem neuesten Stand der Technik gemeldete Leistung bei der Verwendung von Absatzvektoren für die Stimmungsanalyse wiederholt?
Ich war beeindruckt von den Ergebnissen des ICML-Papiers 2014 " Distributed Representations of Sentences and Documents " von Le und Mikolov. Die beschriebene Technik, "Absatzvektoren" genannt, lernt unbeaufsichtigte Darstellungen von beliebig langen Absätzen / Dokumenten, basierend auf einer Erweiterung des word2vec-Modells. Der Aufsatz berichtet über die neuesten Erkenntnisse zur Stimmungsanalyse …

1
Warum unterscheiden sich die geschätzten Werte eines Best Linear Unbias Predictor (BLUP) von einem Best Linear Unbias Estimator (BLUE)?
Ich verstehe, dass der Unterschied zwischen ihnen damit zusammenhängt, ob die Gruppierungsvariable im Modell als fester oder zufälliger Effekt geschätzt wird, aber mir ist nicht klar, warum sie nicht gleich sind (wenn sie nicht gleich sind). Ich bin speziell daran interessiert, wie dies bei der Verwendung der Schätzung kleiner Flächen …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.