Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Unterschied zwischen Randomisierungstest und Permutationstest
In der Literatur werden die Begriffe Randomisierung und Permutation synonym verwendet. Bei vielen Autoren, die "Permutationstests (auch als Randomisierungstests bezeichnet)" oder umgekehrt angeben. Bestenfalls glaube ich, dass der Unterschied subtil ist und in ihren Annahmen über die Daten und möglichen Schlussfolgerungen liegt, die gezogen werden können. Ich muss nur überprüfen, …


1
Zeitreihenprognose mit täglichen Daten: ARIMA mit Regressor
Ich verwende eine tägliche Zeitreihe von Verkaufsdaten, die etwa 2 Jahre tägliche Datenpunkte enthält. Anhand einiger Online-Tutorials / Beispiele habe ich versucht, die Saisonalität in den Daten zu identifizieren. Es scheint eine wöchentliche, monatliche und wahrscheinlich jährliche Periodizität / Saisonalität zu geben. Beispielsweise gibt es Zahltage, insbesondere am ersten Zahltag …

3
Kann das Neyman-Pearson-Lemma auf den Fall angewendet werden, dass einfache Null und Alternative nicht zur selben Verteilungsfamilie gehören?
Kann das Neyman-Pearson-Lemma auf den Fall angewendet werden, dass eine einfache Null und eine einfache Alternative nicht zu derselben Verteilungsfamilie gehören? Ich verstehe nicht, warum es nicht geht. Zum Beispiel, wenn die einfache Null eine Normalverteilung und die einfache Alternative eine Exponentialverteilung ist. Ist der Likelihood-Ratio-Test eine gute Möglichkeit, eine …

3
Cox-Modell vs. logistische Regression
Nehmen wir an, wir haben das folgende Problem: Sagen Sie voraus, welche Kunden in den nächsten 3 Monaten am wahrscheinlichsten aufhören, in unserem Shop einzukaufen. Wir kennen für jeden Kunden den Monat, in dem der Kauf in unserem Shop begonnen hat, und haben darüber hinaus viele Verhaltensmerkmale in monatlichen Aggregaten. …

1
Kann ich eine Kovarianzmatrix in Unsicherheiten für Variablen umwandeln?
Ich habe ein GPS-Gerät, das eine Rauschmessung über die Kovarianzmatrix ausgibt :ΣΣ\Sigma Σ = ⎡⎣⎢σx xσyxσx zσx yσyyσyzσx zσyzσzz⎤⎦⎥Σ=[σxxσxyσxzσyxσyyσyzσxzσyzσzz]\Sigma = \left[\begin{matrix} \sigma_{xx} & \sigma_{xy} & \sigma_{xz} \\ \sigma_{yx} & \sigma_{yy} & \sigma_{yz} \\ \sigma_{xz} & \sigma_{yz} & \sigma_{zz} \end{matrix}\right] (Es ist auch beteiligt, aber lassen Sie uns das für eine …

2
Wie wählt man den richtigen Optimierungsalgorithmus?
Ich muss das Minimum einer Funktion finden. Wenn ich die Dokumente unter http://docs.scipy.org/doc/scipy/reference/optimize.html lese, sehe ich, dass es mehrere Algorithmen gibt, die dasselbe tun, dh das Minimum finden. Woher weiß ich, welches ich wählen soll? Einige der aufgelisteten Algorithmen Minimieren Sie eine Funktion mit dem Downhill-Simplex-Algorithmus. Minimieren Sie eine Funktion …

1
Welche statistischen Methoden sind archaisch und sollten in Lehrbüchern weggelassen werden? [geschlossen]
Aus heutiger Sicht passt diese Frage nicht zu unserem Q & A-Format. Wir erwarten, dass die Antworten durch Fakten, Referenzen oder Fachwissen gestützt werden, aber diese Frage wird wahrscheinlich Debatten, Argumente, Abstimmungen oder erweiterte Diskussionen hervorrufen. Wenn Sie der Meinung sind, dass diese Frage verbessert und möglicherweise erneut geöffnet werden …

2
Kanonische Korrelationsanalyse mit Rangkorrelation
Die kanonische Korrelationsanalyse (CCA) zielt darauf ab, die übliche Pearson-Produkt-Moment-Korrelation (dh den linearen Korrelationskoeffizienten) der linearen Kombinationen der beiden Datensätze zu maximieren. Betrachten wir nun die Tatsache, dass dieser Korrelationskoeffizient nur lineare Assoziationen misst - genau aus diesem Grund verwenden wir beispielsweise auch Spearman- rho- oder Kendall- Korrelationskoeffizienten (Rang), die …


2
Abschätzung der Kovarianz-Posterior-Verteilung eines multivariaten Gaußschen
Ich muss die Verteilung eines bivariaten Gaußschen mit wenigen Stichproben "lernen", aber eine gute Hypothese zur vorherigen Verteilung, also möchte ich den Bayes'schen Ansatz verwenden. Ich habe meinen Prior definiert: P(μ)∼N(μ0,Σ0)P(μ)∼N(μ0,Σ0) \mathbf{P}(\mathbf{\mu}) \sim \mathcal{N}(\mathbf{\mu_0},\mathbf{\Sigma_0}) μ0=[00] Σ0=[160027]μ0=[00] Σ0=[160027] \mathbf{\mu_0} = \begin{bmatrix} 0 \\ 0 \end{bmatrix} \ \ \ \mathbf{\Sigma_0} = \begin{bmatrix} …

1
Wie kann man den Poisson-Prozess mit R abschätzen? (Oder: Wie verwende ich das NHPoisson-Paket?)
Ich habe eine Datenbank von Ereignissen (dh eine Variable von Daten) und zugehörigen Kovariaten. Die Ereignisse werden durch den nicht stationären Poisson-Prozess erzeugt, wobei Parameter eine unbekannte (aber möglicherweise lineare) Funktion einiger Kovariaten sind. Ich denke, das NHPoisson-Paket gibt es nur für diesen Zweck; aber nach 15 stunden erfolgloser recherche …

2
Schätzparameter einer Normalverteilung: Median statt Mittelwert?
Der übliche Ansatz zur Schätzung der Parameter einer Normalverteilung besteht darin, den Mittelwert und die Standardabweichung / Varianz der Stichprobe zu verwenden. Wenn es jedoch einige Ausreißer gibt, sollten der Median und die mediane Abweichung vom Median viel robuster sein, oder? Bei einigen Datensätzen, die ich ausprobiert habe, scheint die …

1
Warum stabilisieren wir die Varianz?
Beim Lesen der Kaggle-Essay-Eval-Methode bin ich auf eine varianzstabilisierende Transformation gestoßen . Sie verwenden eine Varianzstabilisierungstransformation, um Kappa-Werte zu transformieren, bevor sie ihren Mittelwert bilden und sie dann zurücktransformieren. Obwohl ich das Wiki über Varianzstabilisierende Transformationen gelesen habe, kann ich nicht verstehen, warum wir Varianzen tatsächlich stabilisieren. Welchen Nutzen ziehen …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.