Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


1
Bedeutung einer Konvergenzwarnung in glmer
Ich verwende die glmerFunktion aus dem lme4Paket in R und verwende den bobyqaOptimierer (dh die Standardeinstellung in meinem Fall). Ich bekomme eine Warnung und bin gespannt, was das bedeutet. Warning message: In optwrap(optimizer, devfun, start, rho$lower, control = control, : convergence code 3 from bobyqa: bobyqa -- a trust region …


2
stochastischer vs. deterministischer Trend / Saisonalität in der Zeitreihenvorhersage
Ich habe einen moderaten Hintergrund in der Vorhersage von Zeitreihen. Ich habe mehrere Prognosebücher angeschaut und sehe in keinem die folgenden Fragen. Ich habe zwei Fragen: Wie würde ich objektiv (über einen statistischen Test) feststellen, ob eine bestimmte Zeitreihe Folgendes aufweist: Stochastische Saisonalität oder deterministische Saisonalität Stochastischer Trend oder deterministischer …

4
Erwarteter Wert des Stichprobenmedians bei gegebenem Stichprobenmittelwert
Lassen den Median bezeichnen und lassen das Mittel bezeichnet, eine Stichprobe der Größe aus einer Verteilung , das ist . Wie kann ich berechnen ?YYYX¯X¯\bar{X}n=2k+1n=2k+1n=2k+1N(μ,σ2)N(μ,σ2)N(\mu,\sigma^2)E(Y|X¯=x¯)E(Y|X¯=x¯)E(Y|\bar{X}=\bar{x}) Aufgrund der Normalitätsannahme ist es intuitiv sinnvoll zu behaupten, dass und dies ist in der Tat die richtige Antwort. Kann das konsequent gezeigt werden?E(Y|X¯=x¯)=x¯E(Y|X¯=x¯)=x¯E(Y|\bar{X}=\bar{x})=\bar{x} Mein …

4
Was zu glauben: Kolmogorov-Smirnov-Test oder QQ-Plot?
Ich versuche festzustellen, ob mein Datensatz mit kontinuierlichen Daten einer Gammaverteilung mit den Parametern shape 1.7 und rate 0.000063 folgt.====== Das Problem ist, wenn ich mit R ein QQ-Diagramm meines Datensatzes gegen die theoretische Verteilung Gamma (1,7, 0,000063) erstelle, bekomme ich ein Diagramm, das zeigt, dass die empirischen Daten in …

2
Featureauswahl mit zufälligen Wäldern
Ich habe einen Datensatz mit hauptsächlich finanziellen Variablen (120 Features, 4k-Beispiele), die größtenteils stark korreliert und sehr verrauscht sind (z. B. technische Indikatoren). Daher möchte ich für die spätere Verwendung beim Modelltraining (binäre Klassifizierung) maximal 20-30 auswählen - erhöhen verringern). Ich dachte darüber nach, zufällige Wälder für das Feature-Ranking zu …




2
Einklassen-SVM vs. exemplarische SVM
Ich verstehe, dass Ein-Klassen-SVMs (OSVMs) ohne Berücksichtigung negativer Daten vorgeschlagen wurden und dass sie nach Entscheidungsgrenzen suchen, die eine positive Menge und einen negativen Ankerpunkt, beispielsweise den Ursprung, trennen. Eine Arbeit aus dem Jahr 2011 schlägt beispielhafte SVMs (ESVMs) vor, die einen "einzelnen Klassifikator pro Kategorie" ausbilden, der sich von …



3
Wie kann man das r-Quadrat zwischen Prädiktorvariablen in multipler Regression aufteilen?
Ich habe gerade einen Artikel gelesen, in dem die Autoren eine multiple Regression mit zwei Prädiktoren durchgeführt haben. Der gesamte r-Quadrat-Wert betrug 0,65. Sie stellten eine Tabelle zur Verfügung, die das Quadrat zwischen den beiden Prädiktoren aufteilte. Die Tabelle sah so aus: rsquared beta df pvalue whole model 0.65 NA …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.