Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Wie kann ein lineares Mischeffektmodell für diejenigen gemeldet werden, die nicht vertraut und skeptisch sind?
Ich bin jetzt einige Male auf dieses Problem gestoßen, wobei Prüfer mehr Rechtfertigung für die Verwendung von LMMs, herkömmliche Tests anstelle oder zusätzlich zu LMMs und vollständige Tabellen mit Parameterschätzungen anfordern, die denen entsprechen, die Sie mit einem regulären linearen Modell melden würden . Im Moment ist mein spezielles Problem …

2
Ist die Fehlerrate von Typ I gleich Alpha oder höchstens Alpha?
Laut der p-Wert-Wikipedia-Seite : Wenn der p-Wert korrekt berechnet wird, garantiert dieser Test, dass die Fehlerrate vom Typ I höchstens beträgt .αα\alpha Jedoch weiter unten auf der Seite wird diese Formel: Pr(RejectH|H)=Pr(p≤α|H)=αPr(RejectH|H)=Pr(p≤α|H)=α\Pr(\mathrm{Reject}\; H|H) = \Pr(p \leq \alpha|H) = \alpha Unter der Annahme, dass die Fehlerrate vom Typ 1 = Pr(RejectH|H)Pr(RejectH|H)\Pr(\mathrm{Reject}\; …




1
Konfidenzintervall für xgb-Prognose
Experten! Vielleicht wissen Sie, wie man das Konfidenzintervall für xgboost berechnet? Eine klassische Formel mit T-Verteilung kann nicht helfen, da meine Daten nicht normal verteilt sind. Oder spielt das keine Rolle? Wenn Sie Literatur vorschlagen, ist dies sehr nützlich, aber auch Ansätze in R und Python (im Kontext der Bibliothek …


1
Wie erhalte ich optimale Hyperparameter nach verschachtelter Kreuzvalidierung?
Wenn wir einen großen Datensatz haben, können wir ihn im Allgemeinen in (1) Training, (2) Validierung und (3) Test aufteilen. Wir verwenden die Validierung, um die besten Hyperparameter bei der Kreuzvalidierung zu identifizieren (z. B. C in SVM), und trainieren dann das Modell unter Verwendung der besten Hyperparameter mit dem …

2
Seltsames Muster bei der Schätzung des Standardabweichungs-Konfidenzintervalls über Bootstrapping
Ich wollte das Konfidenzintervall für die Standardabweichung für einige Daten schätzen. Der R-Code sieht wie folgt aus: library(boot) sd_boot <- function (x, ind) { res <- sd(x$ReadyChange[ind], na.rm = TRUE) return(res) } data_boot <- boot::boot(data, statistic = sd_boot, R = 10000) plot(data_boot) Und ich habe die nächste Handlung: Ich kann …

1
Wie interpretiere ich den Plot von cv.glmnet ()?
Ich führte Lasso durch und ließ dann eine einmalige Kreuzvalidierung aus cv<-cv.glmnet(df, df$Price, nfolds = 1500) Wenn ich einen Lebenslauf zeichne, erhalte ich Folgendes: Mir ist auch aufgefallen, dass ich 2 verschiedene Lambdas bekomme: lambda.minundlambda.1se Was ist der Unterschied zwischen diesen Lambdas? Was kann ich aus der obigen Darstellung im …

1
Compressed Sensing-Beziehung zur L1-Regularisierung
Ich verstehe , dass die Drucksensor sparsamsten Lösung findet wobei x ∈ R D , A ∈ R k × D und y ∈ R k , k &lt; &lt; D .y=Axy=Axy = Axx∈RDx∈RDx \in \mathbb{R}^DA∈Rk×DA∈Rk×DA \in \mathbb{R}^{k \times D}y∈Rky∈Rky \in \mathbb{R}^{k}k&lt;&lt;Dk&lt;&lt;Dk << D Auf diese Weise können wir xxx …
8 lasso  sparse 




2
Verwendung der segmentierten linearen Regression als Beweis für die Grenze der menschlichen Lebensdauer
Nature veröffentlichte in diesem Jahr das folgende Papier: Hinweise auf eine Begrenzung der menschlichen Lebensdauer 1 , in denen die Autoren argumentieren , dass "die Ergebnisse stark darauf hindeuten, dass die maximale Lebensdauer des Menschen festgelegt ist und natürlichen Einschränkungen unterliegt". Eine der statistischen Analysen dieses Papiers wurde bereits an …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.