Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


2
Warum funktioniert Wilks 'Beweis von 1938 nicht für falsch spezifizierte Modelle?
In der berühmten Arbeit von 1938 (" Die Verteilung des Wahrscheinlichkeitsverhältnisses bei großen Stichproben zum Testen von zusammengesetzten Hypothesen ", Annals of Mathematical Statistics, 9: 60-62) leitete Samuel Wilks die asymptotische Verteilung des (log Likelihood Ratio) ab. für verschachtelte Hypothesen unter der Annahme, dass die größere Hypothese korrekt angegeben ist. …

2
Was ist die Verlustfunktion von Hard Margin SVM?
1max ( 0 , 1 - yich( w⊺xich+ b ) )max(0,1-yich(w⊺xich+b))\max(0,1-y_i(w^\intercal x_i+b))‖w‖2max(0,1-yi(w⊺xi+b))12∥ w ∥2+ C∑ichmax ( 0 , 1 - yich( w⊺xich+ b ) )12‖w‖2+C∑ichmax(0,1-yich(w⊺xich+b)) \frac{1}{2}\|w\|^2+C\sum_i\max(0,1-y_i(w^\intercal x_i+b)) ∥ w ∥2‖w‖2\|w\|^2max ( 0 , 1 - yich( w⊺xich+ b ) )max(0,1-yich(w⊺xich+b))\max(0,1-y_i(w^\intercal x_i+b)) Bei SVM mit festem Rand ist die gesamte Zielfunktion …

2
Definition der Autokorrelationszeit (für effektive Stichprobengröße)
Ich habe in der Literatur zwei Definitionen für die Autokorrelationszeit einer schwach stationären Zeitreihe gefunden: τa=1+2∑k=1∞ρkversusτb=1+2∑k=1∞|ρk|τa=1+2∑k=1∞ρkversusτb=1+2∑k=1∞|ρk| \tau_a = 1+2\sum_{k=1}^\infty \rho_k \quad \text{versus} \quad \tau_b = 1+2\sum_{k=1}^\infty \left|\rho_k\right| Dabei ist die Autokorrelation bei Verzögerung . kρk=Cov[Xt,Xt+h]Var[Xt]ρk=Cov[Xt,Xt+h]Var[Xt]\rho_k = \frac{\text{Cov}[X_t,X_{t+h}]}{\text{Var}[X_t]}kkk Eine Anwendung der Autokorrelationszeit besteht darin, die "effektive Stichprobengröße" zu ermitteln: Wenn Sie …


3
Statistische Interpretation der maximalen Entropieverteilung
Ich habe das Prinzip der maximalen Entropie verwendet, um die Verwendung mehrerer Verteilungen in verschiedenen Umgebungen zu rechtfertigen. Ich muss jedoch noch eine statistische, im Gegensatz zur informationstheoretischen Interpretation der maximalen Entropie formulieren können. Mit anderen Worten, was bedeutet die Maximierung der Entropie für die statistischen Eigenschaften der Verteilung? Hat …

6
Testgenauigkeit höher als beim Training. Wie zu interpretieren?
Ich habe einen Datensatz mit höchstens 150 Beispielen (aufgeteilt in Training und Test) mit vielen Funktionen (höher als 1000). Ich muss Klassifikatoren und Merkmalsauswahlmethoden vergleichen, die für Daten eine gute Leistung erbringen. Daher verwende ich drei Klassifizierungsmethoden (J48, NB, SVM) und zwei Feature-Auswahlmethoden (CFS, WrapperSubset) mit unterschiedlichen Suchmethoden (Greedy, BestFirst). …

1
Kolmogorov-Smirnov mit diskreten Daten: Was ist die richtige Verwendung von dgof :: ks.test in R?
Anfängerfragen: Ich möchte testen, ob zwei diskrete Datensätze von derselben Verteilung stammen. Ein Kolmogorov-Smirnov-Test wurde mir vorgeschlagen. Conover ( Praktische nichtparametrische Statistik , 3d) scheint zu sagen, dass der Kolmogorov-Smirnov-Test für diesen Zweck verwendet werden kann, aber sein Verhalten ist bei diskreten Verteilungen "konservativ", und ich bin nicht sicher, was …

4
Warum verwenden Forscher die 10-fache Kreuzvalidierung, anstatt einen Validierungssatz zu testen?
Ich habe viele Forschungsarbeiten über Stimmungsklassifikation und verwandte Themen gelesen. Die meisten von ihnen verwenden eine 10-fache Kreuzvalidierung, um Klassifikatoren zu trainieren und zu testen. Das bedeutet, dass keine separaten Tests / Validierungen durchgeführt werden. Warum das? Was sind die Vor- und Nachteile dieses Ansatzes, insbesondere für Forscher?

2
Zufällige Wälder für multivariate Regression
Ich habe ein Multi-Output-Regressionsproblem mit Eingabe-Features und Ausgaben. Die Ausgänge haben eine komplexe, nichtlineare Korrelationsstruktur.d ydxdxd_xdydyd_y Ich möchte zufällige Wälder verwenden, um die Regression durchzuführen. Zufällige Wälder für die Regression funktionieren, soweit ich das beurteilen kann, nur mit einer einzigen Ausgabe, daher müsste ich d_ydydyd_y zufällige Wälder trainieren - eine …

3
AIC & BIC Nummerninterpretation
Ich suche Beispiele für die Interpretation von AIC-Schätzungen (Akaike-Informationskriterium) und BIC-Schätzungen (Bayes-Informationskriterium). Kann ein negativer Unterschied zwischen BICs als hintere Gewinnchance eines Modells gegenüber dem anderen interpretiert werden? Wie kann ich das in Worte fassen? Zum Beispiel kann der BIC = -2 bedeuten, dass die Chancen des besseren Modells gegenüber …

4
Anrechnung fehlender Werte für PCA
Ich habe die prcomp()Funktion verwendet, um eine PCA (Principal Component Analysis) in R durchzuführen. Es gibt jedoch einen Fehler in dieser Funktion, sodass der na.actionParameter nicht funktioniert. Ich bat um Hilfe beim Stackoverflow . dort boten zwei benutzer zwei verschiedene möglichkeiten, mit NAwerten umzugehen . Das Problem bei beiden Lösungen …

1
Knoten setzen in natürlichen kubischen Splines in R
Ich habe Daten mit vielen korrelierten Features und möchte zunächst die Features mit einer reibungslosen Basisfunktion reduzieren, bevor ein LDA ausgeführt wird. Ich versuche, natürliche kubische Splines im splinesPaket mit der nsFunktion zu verwenden. Wie ordne ich die Knoten zu? Hier ist der grundlegende R-Code: library(splines) lda.pred <- lda(y ~ …
23 r  splines 

3
Warum den Nenner in Bayes 'Theorem auflösen?
(Ich bin ein Neuling in der Statistik. Ich bin Mathematiker und Programmierer und ich versuche, so etwas wie einen naiven Bayes-Spamfilter zu bauen.) Ich habe an vielen Stellen bemerkt, dass die Leute dazu neigen, den Nenner in der Gleichung aus dem Bayes'schen Theorem aufzulösen. Also stattdessen: P( A | B …
23 bayesian 


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.