Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Zeichnen einer Diskriminante als Linie auf dem Streudiagramm
Bei einem gegebenen Datenstreudiagramm kann ich die Hauptkomponenten der Daten als Achsen darstellen, die mit Punkten gekachelt sind, die Hauptkomponentenwerte sind. Sie können ein Beispieldiagramm mit der Cloud (bestehend aus 2 Clustern) und ihrer ersten Hauptkomponente sehen. Es ist leicht zu zeichnen: Rohkomponenten-Scores werden als Datenmatrix x Eigenvektor (en) berechnet …

1
Berechnung von 2D-Konfidenzregionen aus MCMC-Proben
Ich möchte 2D-Konfidenzbereiche (bei 1-Sigma, 2-Sigma) für ein Modell zeichnen, das ich an Daten angepasst habe. Ich habe PyMC verwendet, um 50.000 MCMC-Posterior-Samples für mein Modell mit 6 Parametern zu generieren. Ich weiß, dass der Prozess zum Erstellen von Vertrauensbereichen ähnlich ist wie: 1.) Erstellen eines Histogramms der Proben im …


1
Vergleich der Backtesting-Renditen mit den realen Handelsrenditen
Ich habe 10 Jahre simulierte Performance einer Handelsstrategie (unter Verwendung historischer Preise) und N Monate tatsächliche Handelsperformance. Welchen statistischen Test kann ich herausfinden, wenn ich mit den Backtesting-Zahlen im Ziel bin? (sowohl in Bezug auf die erwarteten jährlichen Renditen als auch auf die erwartete jährliche Sharpe Ratio)



2
Dichteschätzung mit abgeschnittener Verteilung?
Ich habe einige Daten, die links deutlich abgeschnitten sind. Ich möchte es mit einer Dichteschätzung ausstatten, die es irgendwie handhabt, anstatt zu versuchen, es zu glätten. Welche bekannten Methoden (wie in R üblich) können dies beheben? Beispielcode: set.seed(1341) x <- c(runif(30, 0, 0.01), rnorm(100,3)) hist(x, br = 10, freq = …

2
Wie ist die Verteilung des Maximums eines Paares von iid-Zügen, wobei das Minimum eine Ordnungsstatistik anderer Minima ist?
Betrachten Sie n⋅mn⋅mn\cdot m unabhängige Draws aus cdf F(x)F(x)F(x) , das über 0-1 definiert ist, wobei nnn und mmm ganze Zahlen sind. Gruppieren Sie die Draws willkürlich in nnn Gruppen mit m Werten in jeder Gruppe. Sehen Sie sich den Mindestwert in jeder Gruppe an. Nehmen Sie die Gruppe, die …

1
Erklärungskraft einer Variablen
Ich habe ein einfaches lineares Regressionsmodell. Was ich berechnen möchte, ist, wie "wichtig" jede meiner Eingabevariablen ist, dh um eine Aussage wie diese zu machen: "60% der Vorhersagekraft in diesem Modell stammt von der Variablen var1, wobei var2 und var3 30% bzw. 10% haben." Was muss ich tun, um diese …

1
Zur Verwendung gewichteter Korrelationen in aggregierten Umfragedaten
Ich analysiere Daten aus zwei Umfragen, die ich zusammengeführt habe: Schulpersonalbefragung für die Jahre 2005-06 und 2007-08 Schülerbefragung für die Jahre 2005-06 bis 2008-09 Für beide Datensätze habe ich Beobachtungen (auf Schüler- oder Personalebene) aus 3 verschiedenen Schulbezirken, die jeweils repräsentative Stichproben pro Jahr in ihrem jeweiligen Schulbezirk enthalten. Zur …

3
Signifikanz- und Glaubwürdigkeitsintervalle für den Interaktionsbegriff in der logistischen Regression
Ich habe eine Bayes'sche logistische Regression in WinBugs eingebaut und sie hat einen Interaktionsbegriff. Etwa so: P r o b ( yich=1)=logit−1(a+b1∗xi+b2∗wi+b3∗xi∗wi)P.rÖb(yich=1)=lÖGicht- -1(ein+b1∗xich+b2∗wich+b3∗xich∗wich)\mathrm{Prob}(y_{i}=1) = \mathrm{logit}^{-1} (a + b_{1}*x_{i} + b_{2}*w_{i} + b_{3}*x_{i}*w_{i}) Dabei ist eine standardisierte kontinuierliche Variable und eine Dummy-Variable. In Wirklichkeit ist das Modell komplizierter, aber ich möchte …

3
Modellvergleich zwischen einem ARIMA-Modell und einem Regressionsmodell
Ich habe wirklich Probleme herauszufinden, wie man ARIMA- und Regressionsmodelle vergleicht. Ich verstehe, wie ARIMA-Modelle gegeneinander und verschiedene Arten von Regressionsmodellen (dh Regression gegen dynamische Regression mit AR-Fehlern) gegeneinander bewertet werden, sehe jedoch nicht viele Gemeinsamkeiten zwischen Bewertungsmetriken für ARIMA-Modelle und Regressionsmodelle. Die einzigen zwei Metriken, die sie gemeinsam nutzen, …



1
Ungefähre logarithmische Summe pdf (in R)
Ich habe eine Anwendung, für die ich eine Annäherung an die lognormale Summe pdf zur Verwendung als Teil einer Wahrscheinlichkeitsfunktion benötige. Die logarithmische Normalverteilung hat keine geschlossene Form, und es gibt eine Reihe von Artikeln in Signalverarbeitungsjournalen über verschiedene Näherungen. Ich habe eine der einfachsten Näherungen verwendet (Fenton 1960), bei …
8 r  lognormal 

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.