Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Verwechslung mit Augmented Dickey Fuller Test
Ich arbeite an dem electricityim R-Paket verfügbaren Datensatz TSA. Mein Ziel ist es, herauszufinden, ob ein arimaModell für diese Daten geeignet ist, und es schließlich anzupassen. Also ging ich wie folgt vor: 1. Zeichne die Zeitreihen auf, die sich aus der folgenden Grafik ergeben: 2. Ich wollte ein Logbuch electricityzur …

3
Cholesky versus eigendecomposition für die Entnahme von Stichproben aus einer multivariaten Normalverteilung
Ich würde gerne eine Probe ziehen x∼N(0,Σ)x∼N(0,Σ)\mathbf{x} \sim N\left(\mathbf{0}, \mathbf{\Sigma} \right) . Wikipedia schlägt vor, entweder Cholesky oder Eigendecomposition zu verwenden , dh Σ=D1DT1Σ=D1D1T \mathbf{\Sigma} = \mathbf{D}_1\mathbf{D}_1^T oder Σ=QΛQTΣ=QΛQT \mathbf{\Sigma} = \mathbf{Q}\mathbf{\Lambda}\mathbf{Q}^T Und daher kann die Probe gezogen werden über: x=D1vx=D1v \mathbf{x} = \mathbf{D}_1 \mathbf{v} oder x = Q Λ−-√vx=Q.Λv …

7
Problem mit zwei Umschlägen überarbeitet
Ich habe an dieses Problem gedacht. http://en.wikipedia.org/wiki/Two_envelopes_problem Ich glaube an die Lösung und denke, ich verstehe sie, aber wenn ich den folgenden Ansatz verfolge, bin ich völlig verwirrt. Problem 1: Ich werde dir folgendes Spiel anbieten. Du bezahlst mir 10 Dollar und ich werfe eine faire Münze. Köpfe gebe ich …

2
R Sprache, was ist der Unterschied zwischen Rnorm und Runif
Geschlossen. Diese Frage ist nicht zum Thema . Derzeit werden keine Antworten akzeptiert. Möchten Sie diese Frage verbessern? Aktualisieren Sie die Frage so dass es beim Thema für Kreuz Validated. Geschlossen vor 6 Jahren . Was ist der Unterschied zwischen den Funktionen rnormund runifin R?
16 r 

1
Bedingte Erwartung von R-Quadrat
Betrachten Sie das einfache lineare Modell: yy=X′ββ+ϵyy=X′ββ+ϵ\pmb{y}=X'\pmb{\beta}+\epsilon wo ϵi∼i.i.d.N(0,σ2)ϵi∼i.i.d.N(0,σ2)\epsilon_i\sim\mathrm{i.i.d.}\;\mathcal{N}(0,\sigma^2) und X∈Rn×pX∈Rn×pX\in\mathbb{R}^{n\times p} ,p≥2p≥2p\geq2 undXXX enthalten eine Spalte von Konstanten. Meine Frage ist: Gibt es bei E(X′X)E(X′X)\mathrm{E}(X'X) , ββ\beta und σσ\sigma eine Formel für eine nicht triviale Obergrenze für E(R2)E(R2)\mathrm{E}(R^2) *? (unter der Annahme, dass das Modell von OLS geschätzt wurde). …


2
Pearson's Reste
Eine Anfängerfrage zum Pearson-Residuum im Rahmen des Chi-Quadrat-Tests für die Anpassungsgüte: Neben der Teststatistik gibt die chisq.testFunktion von R den Pearson-Residuum an: (obs - exp) / sqrt(exp) Ich verstehe, warum ein Blick auf den rohen Unterschied zwischen beobachteten und erwarteten Werten nicht so aussagekräftig ist, da eine kleinere Stichprobe zu …


3
Testen Sie, ob Variablen der gleichen Verteilung folgen
Wenn Sie testen möchten, ob zwei Variablen der gleichen Verteilung folgen, ist es ein guter Test, einfach beide Variablen zu sortieren und dann ihre Korrelation zu überprüfen? Wenn es hoch ist (mindestens 0,9?), Stammen die Variablen höchstwahrscheinlich aus derselben Verteilung. Mit Verteilung meine ich hier "normal", "Chi-Quadrat", "Gamma" usw.

1
Obergrenzen für die Copuladichte?
Die Fréchet-Hoeffding-Obergrenze gilt für die Kopula-Verteilungsfunktion und ist gegeben durch C( u1, . . . , ud) ≤ min { u1, . . , ud} .C(u1,...,ud)≤Mindest{u1,..,ud}.C(u_1,...,u_d)\leq \min\{u_1,..,u_d\}. Gibt es eine ähnliche (in dem Sinne, dass es von den Randdichten abhängt) Obergrenze für die anstelle der CDF?c ( u1, . . …


1
Kriterien zur Einstellung der AWL ab Fensterbreite
Steuert mithilfe Rder STL-Zerlegung, s.windowwie schnell sich die saisonale Komponente ändern kann. Kleine Werte ermöglichen eine schnellere Änderung. Das Festlegen des Saisonfensters auf unendlich entspricht dem Erzwingen, dass die Saisonkomponente periodisch ist (dh über Jahre hinweg identisch ist). Meine Fragen: Wenn ich eine monatliche Zeitreihe habe (das entspricht einer Häufigkeit …

2
Trainingsansätze für stark unausgeglichene Datensätze
Ich habe einen stark unausgeglichenen Testdatensatz. Die positive Menge besteht aus 100 Fällen, während die negative Menge aus 1500 Fällen besteht. Auf der Trainingsseite habe ich einen größeren Kandidatenpool: Der positive Trainingssatz umfasst 1200 Fälle und der negative Trainingssatz umfasst 12000 Fälle. Für diese Art von Szenario habe ich mehrere …

1
Verteilung mit tem Kumulanten gegeben durch ?
Gibt es irgendwelche Informationen über die Verteilung, deren tes Kumulat durch ? Die kumulativ erzeugende Funktion hat die Form Ich habe es als einschränkende Verteilung einiger Zufallsvariablen angesehen, konnte jedoch keine Informationen dazu finden. 1nnn κ(t)=∫ 1 0 e t x -11n1n\frac 1 nκ(t)=∫10etx−1x dx.κ(t)=∫01etx−1x dx. \kappa(t) = \int_0 ^ …

1
Richtige Bootstrapping-Technik für Cluster-Daten?
Ich habe eine Frage zur richtigen Bootstrapping-Technik für Daten, bei denen eine starke Clusterbildung vorliegt. Ich wurde beauftragt, ein Vorhersagemodell mit multivariaten gemischten Effekten für Versicherungsfalldaten zu evaluieren, indem ich das aktuelle Basismodell für neuere Schadensfalldaten ausgewertet habe, um zu bestimmen, wie gut das Modell vorhersagt, welche Behandlungsepisoden die höchste …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.