Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Wie macht es Sinn, OLS nach der LASSO-Variablenauswahl durchzuführen?
Kürzlich habe ich festgestellt, dass es in der angewandten ökonometrischen Literatur nicht ungewöhnlich ist, LASSO durchzuführen, gefolgt von einer OLS-Regression unter Verwendung der ausgewählten Variablen. Ich habe mich gefragt, wie wir die Gültigkeit eines solchen Verfahrens beurteilen können. Wird es Probleme wie ausgelassene Variablen verursachen? Gibt es Beweise dafür, dass …

2
PCA in Numpy und Sklearn führt zu unterschiedlichen Ergebnissen
Verstehe ich etwas falsch? Das ist mein Code mit sklearn import numpy as np import matplotlib.pyplot as plt from mpl_toolkits.mplot3d import Axes3D from sklearn import decomposition from sklearn import datasets from sklearn.preprocessing import StandardScaler pca = decomposition.PCA(n_components=3) x = np.array([ [0.387,4878, 5.42], [0.723,12104,5.25], [1,12756,5.52], [1.524,6787,3.94], ]) pca.fit_transform(x) Ausgabe: array([[ -4.25324997e+03, …

2
Von der Gleichverteilung zur Exponentialverteilung und umgekehrt
Dies ist wahrscheinlich eine triviale Frage, aber meine Suche war bisher erfolglos, einschließlich dieses Wikipedia-Artikels und des Dokuments "Compendium of Distributions" . Wenn eine gleichmäßige Verteilung hat, bedeutet dies, dass einer Exponentialverteilung folgt?e XXXXeXeXe^X Wenn einer Exponentialverteilung folgt, heißt das dann, dass einer gleichmäßigen Verteilung folgt?l n ( Y )Y.Y.Yl …

2
Was in einem Namen steckt: Präzision (Inverse der Varianz)
Der Mittelwert ist intuitiv nur der Durchschnitt der Beobachtungen. Die Varianz ist, wie stark diese Beobachtungen vom Mittelwert abweichen. Ich möchte wissen, warum die Umkehrung der Varianz als Präzision bekannt ist. Welche Intuition können wir daraus ziehen? Und warum ist die Präzisionsmatrix in der multivariaten (Normal-) Verteilung so nützlich wie …

2
Warum sollten Sie in neuronalen Netzen Gradientenmethoden anstelle anderer Metaheuristiken verwenden?
Warum werden beim Training tiefer und flacher neuronaler Netze im Gegensatz zu anderen Metaheuristiken häufig Gradientenmethoden (z. B. Gradientenabstieg, Nesterov, Newton-Raphson) verwendet? Mit Metaheuristik meine ich Methoden wie simuliertes Tempern, Optimierung von Ameisenkolonien usw., die entwickelt wurden, um zu vermeiden, dass sie in einem lokalen Minimum hängen bleiben.


2
Residuendiagramme: Warum Diagramm gegen angepasste Werte, nicht beobachtete Werte?
Im Zusammenhang mit der OLS-Regression verstehe ich, dass ein Residuendiagramm (gegen angepasste Werte) herkömmlicherweise betrachtet wird, um auf konstante Varianz zu testen und die Modellspezifikation zu bewerten. Warum werden die Residuen gegen die Anpassungen und nicht gegen die Werte aufgetragen ? Inwiefern unterscheiden sich die Informationen von diesen beiden Darstellungen?Y.Y.Y …

4
Clustering einer Korrelationsmatrix
Ich habe eine Korrelationsmatrix, die angibt, wie jedes Objekt mit dem anderen Objekt korreliert ist. Daher habe ich für N Elemente bereits eine N * N Korrelationsmatrix. Wie gruppiere ich mit dieser Korrelationsmatrix die N Elemente in M ​​Fächern, damit ich sagen kann, dass sich die Nk Elemente im k-ten …

3
Warum ist im Bayes-Theorem ein Normalisierungsfaktor erforderlich?
Der Bayes-Satz P(model|data)=P(model)×P(data|model)P(data)P(model|data)=P(model)×P(data|model)P(data) P(\textrm{model}|\textrm{data}) = \frac{P(\textrm{model}) \times P(\textrm{data}|\textrm{model})}{P(\textrm{data})} Das ist alles in Ordnung. Aber ich habe irgendwo gelesen: Grundsätzlich ist P (Daten) nichts anderes als eine Normalisierungskonstante, dh eine Konstante, die die posteriore Dichte zu eins integriert. Wir wissen, dass und . 0 ≤ P ( Daten | Modell ) …


2
Wahl zwischen Test und Test
Hintergrund: Ich präsentiere Kollegen bei der Arbeit am Testen von Hypothesen und verstehe das meiste in Ordnung, aber es gibt einen Aspekt, den ich zu verstehen und anderen zu erklären versuche. Dies ist, was ich glaube zu wissen (bitte korrigieren, wenn falsch!) Statistiken, die normal wären, wenn die Varianz bekannt …


2
Funktioniert der Caret Train für glmnet für Alpha und Lambda?
Kann das R- caretPaket sowohl für das Modell alphaals auch lambdafür das glmnetModell eine Kreuzvalidierung durchführen? Diesen Code ausführen, eGrid <- expand.grid(.alpha = (1:10) * 0.1, .lambda = (1:10) * 0.1) Control <- trainControl(method = "repeatedcv",repeats = 3,verboseIter =TRUE) netFit <- train(x =train_features, y = y_train, method = "glmnet", tuneGrid …


3
Schonenderer Zugang zur Bayes'schen Statistik
Ich habe kürzlich angefangen, "Introduction to Bayesian Statistics" (Einführung in die Bayes'sche Statistik), 2. Ausgabe von Bolstad, zu lesen. Ich hatte eine Einführungs-Statistik-Klasse, die hauptsächlich statistische Tests abdeckte und fast durch eine Klasse in Regressionsanalyse geht. Welche anderen Bücher kann ich verwenden, um mein Verständnis dieses zu ergänzen? Ich habe …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.