Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Cluster in einer binären Sequenz erkennen
Ich habe eine binäre Sequenz wie 11111011011110101100000000000100101011011111101111100000000000011010100000010000000011101111 Wo auf Cluster von meistens Einsen eine größere Anzahl von Nullen folgt, wie im Bild unten (Schwarz steht für 1): Ich möchte eine Technik anwenden (vorzugsweise in R oder in Python), bei der ich diese Cluster von Einsen automatisch erkennen und Bereiche erzeugen …

2
Simulieren Sie prognostizierte Beispielpfade aus dem tbats-Modell
Unter Verwendung des hervorragenden Prognosepakets von Rob Hyndman stieß ich auf die Notwendigkeit, nicht nur Vorhersageintervalle zu haben, sondern auch eine Reihe zukünftiger Pfade zu simulieren, wenn man frühere Beobachtungen einer Zeitreihe mit komplexen Saisonalitäten berücksichtigt. Es gibt etwas für weniger komplexe Zeitreihen mit nur einer oder zwei Saisonalitäten (simulate.ets …

4
Wie kann ich von einer Distribution mit inkompatiblem CDF probieren?
Semi-Computer Science Simulation bezogenes Problem hier. Ich habe eine Verteilung wo P (x) =(eb−1)eb(n−x)ebn+b−1(eb−1)eb(n−x)ebn+b−1\frac{(e^b-1) e^{b (n-x)}}{e^{b n+b}-1} für einige Konstanten b und n ist x eine ganze Zahl, so dass .0≤x≤n0≤x≤n0\leq x \leq n Jetzt muss ich aus dieser Distribution probieren. Es hat eine invertierbare CDF, so dass dies theoretisch …

1
Anwenden von Aktualität in der logistischen Regression
Gibt es statistische Konzepte oder Theorien, wie die Aktualität effektiv gemessen werden kann, wenn jüngsten Ereignissen mehr Gewicht beigemessen wird als älteren. Ich erstelle ein logistisches Regressionsmodell und möchte verschiedene Faktoren basierend auf der Aktualität der Ereignisse anpassen. ... oder liegt es nur an mir, eine willkürliche Formel zu finden? …



1
Hat jedes logarithmische lineare Modell eine vollkommen äquivalente logistische Regression?
Ich versuche, ein logarithmisch lineares Modell an eine große Anzahl von Variablen aus Umfragedaten anzupassen. Es gibt einige Gründe, warum es möglicherweise vorzuziehen ist, stattdessen logistische Regressionen an diese Daten anzupassen. Mehrere Behörden schlagen vor, dass diese gleichwertig sind. Ich habe jedoch einige Gründe, dies zu bezweifeln. Log-lineare Modelle behandeln …

2
Für welche Verteilung ist ein getrimmter Mittelwert der Maximum-Likelihood-Schätzer?
Der Stichprobenmittelwert ist der Maximum-Likelihood-Schätzer von für eine Normalverteilung . Der Stichprobenmedian ist der Maximum-Likelihood-Schätzer von für eine Laplace-Verteilung (auch als doppelte Exponentialverteilung bezeichnet).μμ\muNormal ( μ , σ)Normal(μ,σ)\text{Normal}(\mu,\sigma)mmm Laplace ( m , s )Laplace(m,s)\text{Laplace}(m,s) Existiert eine Verteilung mit einem Standortparameter, für den der getrimmte Stichprobenmittelwert der Maximum-Likelihood-Schätzer ist?


3
Gegenbeispiel für die für die Konsistenz erforderliche ausreichende Bedingung
Wir wissen, dass wenn ein Schätzer ein unverzerrter Schätzer von Theta ist und seine Varianz gegen 0 tendiert, während n gegen unendlich tendiert, er ein konsistenter Schätzer für Theta ist. Dies ist jedoch eine ausreichende und keine notwendige Bedingung. Ich suche ein Beispiel für einen Schätzer, der konsistent ist, dessen …


1
Vorhersage des Gewinners eines Fußballspiels nur anhand des Ergebnisses früherer Spiele zwischen den beiden Teams
Ich bin ein großer Fußballfan und auch an maschinellem Lernen interessiert. Als Projekt für meinen ML-Kurs versuche ich, ein Modell zu entwickeln, das die Gewinnchance für die Heimmannschaft unter Berücksichtigung der Namen der Heimmannschaft und der Auswärtsmannschaft vorhersagt. (Ich frage meinen Datensatz ab und erstelle dementsprechend Datenpunkte basierend auf früheren …

1
Negative binomiale Regression in R kann nicht angepasst werden (Versuch, veröffentlichte Ergebnisse zu replizieren)
Der Versuch, die Ergebnisse des kürzlich veröffentlichten Artikels zu replizieren, Aghion, Philippe, John Van Reenen und Luigi Zingales. 2013. "Innovation und institutionelles Eigentum." American Economic Review, 103 (1): 277-304. (Daten- und Datencode finden Sie unter http://www.aeaweb.org/aer/data/feb2013/20100973_data.zip ). Ich habe kein Problem damit, die ersten 5 Regressionen in R neu zu …

2
Anova von R Output Interpretation
Ich habe eine Frage, wie ein Statistiker normalerweise eine Anova-Ausgabe interpretieren würde. Angenommen, ich habe eine Anova-Ausgabe von R. > summary(fitted_data) Call: lm(formula = V1 ~ V2) Residuals: Min 1Q Median 3Q Max -2.74004 -0.33827 0.04062 0.44064 1.22737 Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) 2.11405 0.32089 6.588 1.3e-09 …

1
Vom Standard-HMM zum Bayes-HMM
Ich versuche zu verstehen, was der Unterschied zwischen einem Standard-HMM und einem Bayes-HMM ist. Wikipedia erwähnt nur kurz, wie das Modell aussieht, aber ich brauche ein detaillierteres Tutorial. Kennt jemand ein Papier oder eine Implementierung, die ich mir ansehen kann? Ich habe auch Probleme mit der verwendeten Terminologie. Was bedeutet …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.