Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Warum ist es wichtig, einen Bias-Korrektur-Term für den Adam-Optimierer für Deep Learning einzufügen?
Ich habe über den Adam-Optimierer für Deep Learning gelesen und bin in dem neuen Buch Deep Learning von Begnio, Goodfellow und Courtville auf folgenden Satz gestoßen: Adam schließt Vorspannungskorrekturen an den Schätzungen sowohl der Momente erster Ordnung (dem Impulsausdruck) als auch der (nicht zentrierten) Momente zweiter Ordnung ein, um ihre …

2
Unterschied zwischen der Auswahl von Merkmalen basierend auf „F-Regression“ und basierend auf
Wird beim Vergleichen von Features F-regressiondasselbe verwendet wie beim Korrelieren von Features mit der Beschriftung und beim Beobachten des Werts?R2R2R^2 Ich habe oft gesehen, dass meine Kollegen F regressionin ihrer Pipeline für maschinelles Lernen eine für die Featureauswahl verwenden sklearn: sklearn.feature_selection.SelectKBest(score_func=sklearn.feature_selection.f_regression...)` Einige sagen mir bitte - warum gibt es die …


1
Bayesianisches Lasso gegen Spitze und Platte
Frage: Was sind die Vor- und Nachteile einer vorherigen Verwendung für die Variablenauswahl? Angenommen , ich habe die Wahrscheinlichkeit: , wo ich setzen kann entweder eine der priors: oder: y∼N(Xw,σ2I)y∼N(Xw,σ2I)y\sim\mathcal{N}(Xw,\sigma^2I)wi∼πδ0+(1−π)N(0,100)π=0.9,wi∼πδ0+(1−π)N(0,100)π=0.9, w_i\sim \pi\delta_0+(1-\pi)\mathcal{N}(0,100)\\ \pi=0.9\,, wi∼exp(−λ|wi|)λ∼Γ(1,1).wi∼exp⁡(−λ|wi|)λ∼Γ(1,1). w_i\sim \exp(-\lambda|w_i|)\\ \lambda \sim \Gamma(1,1)\,. Ich setze , um zu betonen, dass die meisten Gewichte Null …


3
Neuronales Netzwerk - Binäre vs diskrete / kontinuierliche Eingabe
Gibt es gute Gründe, Binärwerte (0/1) gegenüber diskreten oder kontinuierlichen normalisierten Werten, z. B. (1; 3), als Eingänge für ein Feedforward-Netzwerk für alle Eingangsknoten (mit oder ohne Backpropagation) zu bevorzugen ? Natürlich spreche ich nur von Eingaben, die in beide Formen umgewandelt werden könnten. Wenn Sie beispielsweise eine Variable haben, …

4
Warum sagen wir "Reststandardfehler"?
Ein Standardfehler ist die geschätzte Standardabweichung σ ( θ ) eines Schätzers θ für einen Parameter θ .σ^(θ^)σ^(θ^)\hat \sigma(\hat\theta)θ^θ^\hat\thetaθθ\theta Warum heißt die geschätzte Standardabweichung der Residuen "Reststandardfehler" (z. B. in der Ausgabe der R- summary.lmFunktion) und nicht "Reststandardabweichung"? Welche Parameterschätzung statten wir hier mit einem Standardfehler aus? Betrachten wir jedes …

2
Warum wird der quadratische Unterschied so häufig verwendet?
Sehr oft stoße ich bei der Untersuchung neuer statistischer Methoden und Konzepte auf die quadratische Differenz (oder den mittleren quadratischen Fehler oder eine Vielzahl anderer Epitheta). Nur als Beispiel wird Pearsons r auf der Grundlage der mittleren quadratischen Differenz von der Regressionslinie, auf der die Punkte liegen, bestimmt. Bei ANOVAs …


1
Beziehung zwischen Gamma und Chi-Quadrat-Verteilung
Wenn Y.= ∑i = 1NX2ichY.=∑ich=1NXich2Y=\sum_{i=1}^{N}X_i^2 wobei Xich∼ N( 0 , σ2)Xich∼N(0,σ2)X_i \sim \mathcal{N}(0,\sigma^2) , dh alle XichXichX_i sind, bedeuten normale Zufallsvariablen von Null mit gleichen Varianzen, dann Y∼Γ(N2,2σ2).Y.∼Γ(N2,2σ2).Y \sim \Gamma\left(\frac{N}{2},2\sigma^2\right). Ich weiß, dass die Chi-Quadrat-Verteilung ein Sonderfall der Gamma-Verteilung ist, konnte aber die Chi-Quadrat-Verteilung für die Zufallsvariable nicht ableiten YY.Y. …

4
Soll der Mittelwert verwendet werden, wenn die Daten schief sind?
Häufig wird in einführenden Texten zur angewandten Statistik der Mittelwert vom Median unterschieden (häufig im Kontext der deskriptiven Statistik und zur Begründung der Zusammenfassung der zentralen Tendenz anhand von Mittelwert, Median und Modus), indem erläutert wird, dass der Mittelwert für Ausreißer in Stichprobendaten empfindlich ist und / oder Dies wird …


3
Wie kann ich interpretieren, was ich von PCA bekomme?
Im Rahmen eines Universitätsauftrages muss ich eine Datenvorverarbeitung für einen ziemlich großen, multivariaten (> 10) Rohdatensatz durchführen. Ich bin kein Statistiker im wahrsten Sinne des Wortes, also bin ich ein wenig verwirrt, was los ist. Entschuldigung im Voraus für die wahrscheinlich lächerlich einfache Frage - mein Kopf dreht sich, nachdem …
14 pca 

4
ROC- und MultiROC-Analyse: Wie berechnet man den optimalen Schnittpunkt?
Ich versuche zu verstehen, wie der optimale Schnittpunkt für eine ROC-Kurve berechnet wird (der Wert, bei dem die Empfindlichkeit und Spezifität maximiert werden). Ich verwende den Datensatz aSAHaus dem Paket pROC. Die outcomeVariable könnte durch zwei unabhängige Variablen erklärt werden: s100bund ndka. Unter Verwendung der Syntax des EpiPakets habe ich …

2
Multiple lineare Regressionssimulation
Ich bin neu in der R-Sprache. Ich möchte wissen, wie man aus einem multiplen linearen Regressionsmodell simuliert, das alle vier Annahmen der Regression erfüllt. OK danke. Angenommen, ich möchte die Daten basierend auf diesem Datensatz simulieren: y<-c(18.73,14.52,17.43,14.54,13.44,24.39,13.34,22.71,12.68,19.32,30.16,27.09,25.40,26.05,33.49,35.62,26.07,36.78,34.95,43.67) x1<-c(610,950,720,840,980,530,680,540,890,730,670,770,880,1000,760,590,910,650,810,500) x2<-c(1,1,3,2,1,1,3,3,2,2,1,3,3,2,2,2,3,3,1,2) fit<-lm(y~x1+x2) summary(fit) dann bekomme ich die Ausgabe: Call: lm(formula = y …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.