Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


1
Erhebungsmethode zu persönlichen Fragen
Ein statistischer Freund von mir erzählte mir von einer interessanten Technik, mit der ehrliche Antworten auf Umfragen erhalten wurden, die sich mit sensiblen Themen befassten. Ich erinnere mich an den allgemeinen Kern der Methode, frage mich aber, ob jemand die Details kennt und ob irgendwo darauf verwiesen wird. Die Geschichte …

2
Wie bewertet man die Anpassungsgüte für Überlebensfunktionen?
Ich bin ein Neuling in der Überlebensanalyse, obwohl ich einige Kenntnisse in Klassifikation und Regression habe. Für die Regression haben wir MSE- und R-Quadrat-Statistiken. Aber wie können wir sagen, dass das Überlebensmodell A neben einigen grafischen Darstellungen (KM-Kurve) dem Überlebensmodell B überlegen ist? Wenn möglich, erläutern Sie den Unterschied anhand …

4
Wie nützlich ist Minitab in der realen Welt? [geschlossen]
Geschlossen . Diese Frage basiert auf Meinungen . Derzeit werden keine Antworten akzeptiert. Möchten Sie diese Frage verbessern? Aktualisieren Sie die Frage, damit sie durch Bearbeiten dieses Beitrags mit Fakten und Zitaten beantwortet werden kann . Geschlossen vor 5 Jahren . Ich bin derzeit ein Statistikstudent in einem sehr guten …
9 sas  minitab 

2
Wie kann man beweisen, dass die vielfältige Annahme richtig ist?
Beim maschinellen Lernen wird häufig angenommen, dass ein Datensatz auf einer glatten niedrigdimensionalen Mannigfaltigkeit liegt (die Mannigfaltigkeitsannahme), aber gibt es eine Möglichkeit zu beweisen, dass unter der Annahme, dass bestimmte Bedingungen erfüllt sind, der Datensatz tatsächlich (ungefähr) erzeugt wird von einem niedrigdimensionalen glatten Verteiler? Zum Beispiel gegeben eine Datensequenz wobei …

2
Visuelles Zusammenfassen eines Durcheinanders gerichteter Liniensegmente
Ich habe einen Datensatz von Millionen gerichteter Liniensegmente. Die Liniensegmente sind sequentiell - es handelt sich um eine Klimavariable (fühlbare Wärme) mit beobachteten und simulierten Werten in halbstündlichen Intervallen. Ich versuche nach Mustern für die Leistung der Simulation zu suchen. Ich betrachte ein Streudiagramm von obs gegen Simulationswerte und verknüpfe …


4
Berechnung der Prognosegenauigkeit
Wir verwenden STL (R-Implementierung) zur Vorhersage von Zeitreihendaten. Jeden Tag führen wir tägliche Prognosen durch. Wir möchten Prognosewerte mit realen Werten vergleichen und durchschnittliche Abweichungen ermitteln. Zum Beispiel haben wir Prognosen für morgen erstellt und Prognosepunkte erhalten. Wir möchten diese Prognosepunkte mit realen Daten vergleichen, die wir morgen erhalten. Mir …

1
Erhalten von Kointegrationsvektoren mit der Johansen-Methode
Ich versuche, die Johansen-Methode besser zu verstehen, deshalb habe ich ein Beispiel 3.1 aus dem Buch Likelihood-Based-Inference-Cointegrated-Autoregressive-Econometrics entwickelt, in dem wir drei Prozesse haben: X1t=∑i=1tϵ1i+ϵ2tX1t=∑i=1tϵ1i+ϵ2tX_{1t} = \sum_{i=1}^t \epsilon_{1i} + \epsilon_{2t} X2t=α∑i=1tϵ1i+ϵ3tX2t=α∑i=1tϵ1i+ϵ3t X_{2t} = \alpha \sum_{i=1}^t \epsilon_{1i} + \epsilon_{3t} X3t=ϵ4tX3t=ϵ4t X_{3t} = \epsilon_{4t} Die Kointegrationsvektoren sollten also [a, -1, 0] und …

4
Kann der Mann-Whitney-Test für Post-hoc-Vergleiche nach Kruskal-Wallis verwendet werden?
Ich habe eine Simulation, in der ein Tier in eine feindliche Umgebung gebracht wird und zeitlich festgelegt ist, wie lange es mit einem Überlebensansatz überleben kann. Es gibt drei Ansätze, mit denen es überleben kann. Ich habe 300 Simulationen des Tieres mit jedem Überlebensansatz durchgeführt. Alle Simulationen finden in derselben …

1
Warum müssen Sie beim Kriging ein Variogrammmodell bereitstellen?
Ich bin sehr neu in der räumlichen Statistik und schaue mir viele Tutorials an. Aber ich verstehe nicht wirklich, warum Sie ein Variogrammmodell bereitstellen müssen, wenn Sie krige. Ich verwende das gstat-Paket in R, und dies ist das Beispiel, das sie geben: library(sp) data(meuse) coordinates(meuse) = ~x+y data(meuse.grid) str(meuse.grid) gridded(meuse.grid) …
9 spatial 

1
Wie man mit R Überlebensdaten mit zeitabhängigen Kovariaten generiert
Ich möchte die Überlebenszeit aus einem Cox-Proportional-Hazards-Modell generieren, das eine zeitabhängige Kovariate enthält. Das Modell ist h(t|Xi)=h0(t)exp(γXi+αmi(t))h(t|Xi)=h0(t)exp⁡(γXi+αmi(t))h(t|X_i) =h_0(t) \exp(\gamma X_i + \alpha m_{i}(t)) wobei aus Binomial (1,0.5) und .m i ( t ) = β 0 + β 1 X i + β 2 X i tXiXiX_imi(t)=β0+β1Xi+β2Xitmi(t)=β0+β1Xi+β2Xitm_{i}(t)=\beta_0 + \beta_1 X_{i} …


2
Clustering von verrauschten Daten oder mit Ausreißern
Ich habe verrauschte Daten von zwei Variablen wie diesen. x1 <- rep(seq(0,1, 0.1), each = 3000) set.seed(123) y1 <- rep (c(0.2, 0.8, 0.3, 0.9, 0.65, 0.35,0.7,0.1,0.25, 0.3, 0.95), each = 3000) set.seed(1234) e1 = rnorm(length(x1), 0.07,0.07) set.seed(1223) e2 = rnorm(length(x1), 0.07,0.07) set.seed(1334) yn <- rnorm(20000, 0.5,0.9) set.seed(2344) xn <- rnorm(20000, …

1
Standardisierung von Funktionen bei Verwendung von LDA als Vorverarbeitungsschritt
Wenn eine lineare Diskriminanzanalyse mit mehreren Klassen (oder ich lese manchmal auch eine Mehrfachdiskriminanzanalyse) zur Dimensionsreduktion (oder Transformation nach Dimensionsreduktion über PCA) verwendet wird, verstehe ich im Allgemeinen eine "Z-Score-Normalisierung" (oder Standardisierung) von Funktionen werden nicht benötigt, auch wenn sie in völlig unterschiedlichen Maßstäben gemessen werden, richtig? Da LDA einen …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.