Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

5
Lehrbuch für Bayesianische Ökonometrie
Ich suche nach einem theoretisch strengen Lehrbuch zur Bayes'schen Ökonometrie, das ein solides Verständnis der frequentistischen Ökonometrie voraussetzt. Ich würde gerne eine Arbeit pro Antwort vorschlagen, damit die Empfehlungen einzeln nach oben oder unten abgestimmt werden können.

3
Formel zum Würfeln (non-brute force)
Zunächst bin ich mir nicht sicher, wo diese Frage veröffentlicht werden soll. Ich frage, ob ein Statistikproblem NP-Complete ist und ob es nicht programmgesteuert gelöst werden soll. Ich poste es hier, weil das Statistikproblem der Mittelpunkt ist. Ich versuche eine bessere Formel zu finden, um ein Problem zu lösen. Das …
14 dice  np 




3
Angemessenheit der ANOVA nach k-Means-Cluster-Analyse
Die Meldung nach der ANOVA-Tabelle nach der K-Mittelwert-Analyse zeigt, dass Signifikanzniveaus nicht als Test gleicher Mittelwerte betrachtet werden sollten, da die Cluster-Lösung basierend auf dem euklidischen Abstand abgeleitet wurde, um den Abstand zu maximieren. Welchen Test sollte ich verwenden, um zu zeigen, ob sich die Mittelwerte der Clustervariablen zwischen den …
14 anova  k-means 


2
AIC, BIC und GCV: Was ist am besten geeignet, um bei bestraften Regressionsmethoden eine Entscheidung zu treffen?
Mein allgemeines Verständnis ist, dass sich AIC mit dem Kompromiss zwischen der Anpassungsgüte des Modells und der Komplexität des Modells befasst. AIC=2k−2ln(L)AIC=2k−2ln(L)AIC =2k -2ln(L) kkk = Anzahl der Parameter im Modell LLL = Wahrscheinlichkeit Das Bayes'sche Informationskriterium BIC ist eng mit dem AIC verwandt. Der AIC benachteiligt die Anzahl der …

2
Verwendung von verschachtelter Kreuzvalidierung
Die Seite von Scikit Learn zur Modellauswahl erwähnt die Verwendung von verschachtelter Kreuzvalidierung: >>> clf = GridSearchCV(estimator=svc, param_grid=dict(gamma=gammas), ... n_jobs=-1) >>> cross_validation.cross_val_score(clf, X_digits, y_digits) Zwei Kreuzvalidierungsschleifen werden parallel ausgeführt: eine vom GridSearchCV-Schätzer zum Festlegen von Gamma und eine vom cross_val_score zum Messen der Vorhersageleistung des Schätzers. Die resultierenden Scores sind …

2
Was ist die Definition von Top-n-Genauigkeit?
Ich lese eine wissenschaftliche Arbeit über die Klassifizierung von Bildern. In den experimentellen Ergebnissen sprechen sie von Top-1- und Top-5-Genauigkeit, aber ich habe noch nie von dem Begriff gehört und kann ihn auch nicht mit Google finden. Kann mir jemand eine Definition geben oder mich irgendwo hinweisen? :)

2
Warum bedeutet die durch Bartlett-Test diagnostizierte Sphärizität, dass eine PCA unangemessen ist?
Ich verstehe, dass es bei Bartletts Test darum geht, festzustellen, ob Ihre Proben aus Populationen mit gleichen Varianzen stammen. Wenn die Stichproben aus Populationen mit gleichen Varianzen stammen, wird die Nullhypothese des Tests nicht zurückgewiesen, und daher ist eine Hauptkomponentenanalyse ungeeignet. Ich bin nicht sicher, wo das Problem mit dieser …


1
Kernel-Bandbreite: Regeln von Scott vs. Silverman
Kann jemand im Klartext erklären, worin der Unterschied zwischen den Daumenregeln von Scott und Silverman für die Bandbreitenauswahl besteht? Insbesondere wenn ein besser als die anderen? Hängt es mit der zugrunde liegenden Distribution zusammen? Anzahl von Beispielen? PS Ich beziehe mich auf den Code in SciPy .

1
Gibt es eine intuitive Charakterisierung der Distanzkorrelation?
Ich habe auf der Wikipedia-Seite nach Entfernungskorrelationen gestarrt, bei denen es darum zu gehen scheint, wie sie berechnet werden können. Während ich die Berechnungen durchführen konnte, kämpfe ich darum , welche Entfernungskorrelationsmaße und warum die Berechnungen so aussehen, wie sie aussehen. Gibt es eine (oder mehrere) intuitivere Charakterisierung der Entfernungskorrelation, …

4
Welche Variablen erklären welche PCA-Komponenten und umgekehrt?
Verwendung dieser Daten: head(USArrests) nrow(USArrests) Ich kann eine PCA wie folgt durchführen: plot(USArrests) otherPCA <- princomp(USArrests) Ich kann die neuen Komponenten bekommen otherPCA$scores und der Anteil der Varianz erklärt durch Komponenten mit summary(otherPCA) Aber was ist, wenn ich wissen möchte, welche Variablen hauptsächlich durch welche Hauptkomponenten erklärt werden? Und umgekehrt: …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.