Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

4
Interpretation des Unterschieds zwischen lognormaler und Potenzgesetzverteilung (Netzgradverteilung)
Zunächst einmal bin ich kein Statistiker. Ich habe jedoch eine statistische Netzwerkanalyse für meine Promotion durchgeführt. Im Rahmen der Netzwerkanalyse habe ich eine CCDF (Complementary Cumulative Distribution Function) mit Netzwerkabschlüssen aufgezeichnet. Was ich fand, war, dass im Gegensatz zu herkömmlichen Netzwerkverteilungen (z. B. WWW) die Verteilung am besten durch eine …



3
Unterstützung der Vektorregression für die Vorhersage multivariater Zeitreihen
Hat jemand versucht, Zeitreihen mithilfe der Support-Vektor-Regression vorherzusagen? Ich verstehe Support-Vektor-Maschinen und teilweise Support-Vektor-Regression, aber ich verstehe nicht, wie sie zum Modellieren von Zeitreihen, insbesondere multivariaten Zeitreihen, verwendet werden können. Ich habe versucht, ein paar Artikel zu lesen, aber sie sind zu hoch. Kann mir jemand erklären, wie sie funktionieren …

2
Von der „Stärke“ schwacher Lernender
Ich habe einige eng verwandte Fragen zu schwachen Lernenden im Ensemble-Lernen (z. B. Boosten). Das hört sich vielleicht dumm an, aber was sind die Vorteile von schwachen Lernenden gegenüber starken Lernenden? (zB warum nicht mit "starken" Lernmethoden aufladen?) Gibt es eine Art "optimale" Stärke für die schwachen Lernenden (z. B. …



2
Gute Online-Ressource mit Tipps zur grafischen Zuordnung zwischen zwei numerischen Variablen unter verschiedenen Bedingungen
Kontext: Im Laufe der Zeit habe ich eine Reihe von Heuristiken zur effektiven Darstellung der Assoziation zwischen zwei numerischen Variablen entwickelt. Ich stelle mir vor, dass die meisten Leute, die mit Daten arbeiten, ähnliche Regeln haben würden. Beispiele für solche Regeln könnten sein: Wenn eine der Variablen positiv verzerrt ist, …

1
Warum geben die R-Funktionen 'princomp' und 'prcomp' unterschiedliche Eigenwerte an?
Sie können den Zehnkampf-Datensatz {FactoMineR} verwenden, um dies zu reproduzieren. Die Frage ist, warum sich die berechneten Eigenwerte von denen der Kovarianzmatrix unterscheiden. Hier sind die Eigenwerte mit princomp: > library(FactoMineR);data(decathlon) > pr <- princomp(decathlon[1:10], cor=F) > pr$sd^2 Comp.1 Comp.2 Comp.3 Comp.4 Comp.5 Comp.6 1.348073e+02 2.293556e+01 9.747263e+00 1.117215e+00 3.477705e-01 1.326819e-01 …
22 r  pca 

2
Bester Ansatz für die Modellauswahl Bayesian oder Kreuzvalidierung?
Wenn ich versuche, zwischen verschiedenen Modellen oder der Anzahl von Merkmalen zu wählen, für die eine Vorhersage erforderlich ist, kann ich mir zwei Ansätze vorstellen. Teilen Sie die Daten in Trainings- und Testsätze auf. Besser noch, verwenden Sie Bootstrapping oder k-fach Kreuzvalidierung. Trainieren Sie jedes Mal am Trainingssatz und berechnen …

4
Wie kann man die Eigenschaften der Kovarianzmatrix sicherstellen, wenn man ein multivariates normales Modell mit maximaler Wahrscheinlichkeit anpasst?
Angenommen, ich habe das folgende Modell yi=f(xi,θ)+εiyi=f(xi,θ)+εiy_i=f(x_i,\theta)+\varepsilon_i Dabei ist , ein Vektor erklärender Variablen, die Parameter der nichtlinearen Funktion und , wobei natürlich Matrix.x i θ f ≤ i ≤ N ( 0 , ≤ ) ≤ K × Kyi∈RKyi∈RKy_i\in \mathbb{R}^Kxixix_iθθ\thetafffεi∼N(0,Σ)εi∼N(0,Σ)\varepsilon_i\sim N(0,\Sigma)ΣΣ\SigmaK×KK×KK\times K Das Ziel ist die übliche Schätzung von …


2
Vorschläge zur Verbesserung eines Wahrscheinlichkeits- und Statistik-Spickzettel
Kontext: Um die zentralen Elemente zu strukturieren, auf die ich in der Wahrscheinlichkeitstheorie und -statik gestoßen bin, habe ich ein Referenzdokument erstellt, das sich auf die mathematischen Grundlagen konzentriert ( hier verfügbar ). Durch die Weitergabe dieses Dokuments hoffe ich, Statistikstudenten eine umfassende Zusammenfassung des Kernmaterials zukommen zu lassen, das …
22 teaching 



Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.