Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Bartlett-Test gegen Levene-Test
Ich versuche derzeit, Verstöße gegen ANOVA-Annahmen zu beheben. Ich habe Shapiro-Wilk verwendet, um die Normalität zu testen, und mich sowohl mit dem Levene-Test als auch mit dem Bartlett-Test der Varianzgleichheit beschäftigt. Ich habe seitdem meine Daten protokolliert, um zu versuchen, die ungleichen Abweichungen zu beheben. Ich wiederholte den Bartlett-Test für …

1
R - Lasso-Regression - unterschiedliche Lambda pro Regressor
Ich möchte Folgendes tun: 1) OLS-Regression (kein Bestrafungsterm), um Beta-Koeffizienten ; steht für die zur Regression verwendeten Variablen. Ich mache das durch jb∗jbj∗b_{j}^{*}jjj lm.model = lm(y~ 0 + x) betas = coefficients(lm.model) 2) Lasso-Regression mit einem Bestrafungsbegriff, die Auswahlkriterien sind die Bayesian Information Criteria (BIC), angegeben durch λj=log(T)T|b∗j|λj=log⁡(T)T|bj∗|\lambda _{j} = …
11 r  regression  glmnet  lars 

1
Überdispersion und Unterdispersion bei negativer Binomial / Poisson-Regression
Ich führte eine Poisson-Regression in SAS durch und stellte fest, dass der Pearson-Chi-Quadrat-Wert geteilt durch die Freiheitsgrade etwa 5 betrug, was auf eine signifikante Überdispersion hinweist. Also habe ich ein negatives Binomialmodell mit proc genmod angepasst und festgestellt, dass der Pearson-Chi-Quadrat-Wert geteilt durch die Freiheitsgrade 0,80 beträgt. Wird dies nun …

2
Was ist die Nullhypothese einer MANOVA?
Hintergrund Um Unterschiede in einer kontinuierlichen Variablen zwischen verschiedenen Gruppen zu analysieren (gegeben durch eine kategoriale Variable), kann eine Einweg-ANOVA durchgeführt werden. Wenn es mehrere erklärende (kategoriale) Variablen gibt, kann eine faktorielle ANOVA durchgeführt werden. Wenn man Unterschiede zwischen Gruppen in mehreren kontinuierlichen Variablen (dh mehreren Antwortvariablen) analysieren möchte, muss …

2
Schätzen Sie die Rate, mit der die Standardabweichung mit einer unabhängigen Variablen skaliert
Ich habe ein Experiment, in dem ich Messungen einer normalverteilten Variablen .YYY Y∼N(μ,σ)Y∼N(μ,σ)Y \sim N(\mu,\sigma) Frühere Experimente haben jedoch einige Beweise dafür geliefert, dass die Standardabweichung eine affine Funktion einer unabhängigen Variablen X ist , d. H.σσ\sigmaXXX σ=a|X|+bσ=a|X|+b\sigma = a|X| + b Y∼N(μ,a|X|+b)Y∼N(μ,a|X|+b)Y \sim N(\mu,a|X| + b) Ich möchte die …

2
Ist es „okay“, eine Regressionslinie für Rangdaten zu zeichnen (Spearman-Korrelation)?
Ich habe Daten, für die ich die Spearman-Korrelation berechnet habe, und möchte sie für eine Veröffentlichung visualisieren. Die abhängige Variable wird eingestuft, die unabhängige Variable nicht. Was ich visualisieren möchte, ist eher der allgemeine Trend als die tatsächliche Steigung, daher habe ich die unabhängige Rangfolge eingestuft und die Spearman-Korrelation / …

1
Binomial glmm mit einer kategorialen Variablen mit vollem Erfolg
Ich führe ein glmm mit einer binomialen Antwortvariablen und einem kategorialen Prädiktor aus. Der zufällige Effekt ergibt sich aus dem verschachtelten Design, das für die Datenerfassung verwendet wird. Die Daten sehen folgendermaßen aus: m.gen1$treatment [1] sucrose control protein control no_injection ..... Levels: no_injection control sucrose protein m.gen1$emergence [1] 1 0 …


1
Hypothesentest und die wissenschaftliche Methode
Als ich die Antworten auf diesen Thread las , fragte ich mich, wie sich das Testen von Hypothesen auf die wissenschaftliche Methode bezieht . Obwohl ich beide gut verstehe, fällt es mir schwer, die genaue Verbindung zwischen ihnen herzustellen. Auf hohem Niveau läuft die wissenschaftliche Methode auf Folgendes hinaus: Machen …


2
Was ist dieser Trick mit dem Hinzufügen von 1 hier?
Ich habe mir diese Seite über die Monte-Carlo-Implementierung des Lillefors-Tests angesehen. Ich verstehe diesen Satz nicht: Bei dieser Berechnung aus der Simulation liegt ein zufälliger Fehler vor. Aufgrund des Tricks, 1 zum Zähler und Nenner bei der Berechnung des P-Werts zu addieren, kann es jedoch ohne Berücksichtigung der Zufälligkeit direkt …

3
Erklärung der Formel für den Median, der dem Ursprung von N Proben aus der Einheitskugel am nächsten liegt
In Elements of Statistical Learning wird ein Problem eingeführt, um Probleme mit k-nn in hochdimensionalen Räumen hervorzuheben. Es gibt NNN Datenpunkte, die gleichmäßig in einer ppp dimensionalen Einheitskugel verteilt sind. Der mittlere Abstand vom Ursprung zum nächsten Datenpunkt wird durch den Ausdruck angegeben: d(p,N)=(1−(12)1N)1pd(p,N)=(1−(12)1N)1pd(p,N) = \left(1-\left(\frac{1}{2}\right)^\frac{1}{N}\right)^\frac{1}{p} Wenn N=1N=1N=1 , zerfällt …



2
Algorithmen für maschinelles Lernen für Paneldaten
In dieser Frage - Gibt es eine Methode zum Erstellen von Entscheidungsbäumen, die strukturierte / hierarchische / mehrstufige Prädiktoren berücksichtigt? - Sie erwähnen eine Paneldatenmethode für Bäume. Gibt es spezielle Paneldatenmethoden zur Unterstützung von Vektormaschinen und neuronalen Netzen? Wenn ja, können Sie einige Artikel zu den Algorithmen und (falls verfügbar) …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.