Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


2
Kreuzvalidierung und Parameteroptimierung
Ich habe eine Frage zur Parameteroptimierung, wenn ich die 10-fache Kreuzvalidierung verwende. Ich möchte fragen, ob die Parameter während des Modelltrainings jeder Falte festgelegt werden sollen oder nicht, dh (1) einen Satz optimierter Parameter für die durchschnittliche Genauigkeit jeder Falte auswählen. oder (2) Ich sollte den optimierten Parameter für jede …


2
Omega vs. Alpha Zuverlässigkeit
Ich frage mich, ob jemand erklären kann, was der Hauptunterschied zwischen Omega und Alpha Zuverlässigkeit ist. Ich verstehe, dass eine Omega-Zuverlässigkeit auf einem hierarchischen Faktormodell basiert, wie im folgenden Bild gezeigt, und Alpha verwendet durchschnittliche Korrelationen zwischen Elementen. Was ich nicht verstehe ist, unter welchen Bedingungen wäre der Omega-Zuverlässigkeitskoeffizient höher …

1
Unterschiedliche Ergebnisse beim Zeichnen von 95% CI-Ellipsen mit ggplot oder dem Ellipsenpaket
Ich möchte die Ergebnisse eines Clusters (erstellt mit protoclust{protoclust}) visualisieren, indem ich Scater-Diagramme für jedes Variablenpaar erstelle, das zum Klassifizieren meiner Daten verwendet wird, nach Klassen färbt und die Ellipsen für das 95% -Konfidenzintervall für jede der Klassen überlappt (um zu überprüfen, welche elipses-Klassen überlappen sich unter jedem Variablenpaar. Ich …


2
Erstellen einer Zeitreihe, die mehrere Beobachtungen für jedes Datum enthält
Ich versuche, eine Zeitreihe auf vierteljährliche Stichprobendaten (tierische Biomasse) über einen Zeitraum von 10 Jahren mit 3 Wiederholungen pro Quartal anzuwenden. Also 40 Daten, aber insgesamt 120 Beobachtungen. Ich habe SARIMA'a in Shumway und Stoffers Zeitreihenanalyse und ihren Anwendungen gelesen und Woodward et al. Die angewandte Zeitreihenanalyse von al., und …
11 r  time-series 

2
Was ist der Vorteil der Reduzierung der Dimensionalität von Prädiktoren zum Zwecke der Regression?
Was sind die Anwendungen oder Vorteile der Dimensionsreduktion Regression (DRR) oder beaufsichtigten Dimensionsreduktion (SDR) Techniken gegenüber herkömmlichen Regressionstechniken (ohne Dimensionsreduktion)? Diese Klasse von Techniken findet eine niedrigdimensionale Darstellung des Merkmalssatzes für das Regressionsproblem. Beispiele für solche Techniken umfassen in Scheiben geschnittene inverse Regression, Haupt-Hessische Richtungen, Geschnittene durchschnittliche Varianzschätzung, Kernel-Schnitt-Inverse-Regression, Hauptkomponenten-Regression …



3
Wahrscheinlichkeit vs. bedingte Verteilung für die Bayes'sche Analyse
Wir können den Satz von Bayes als schreiben p(θ|x)=f(X|θ)p(θ)∫θf(X|θ)p(θ)dθp(θ|x)=f(X|θ)p(θ)∫θf(X|θ)p(θ)dθp(\theta|x) = \frac{f(X|\theta)p(\theta)}{\int_{\theta} f(X|\theta)p(\theta)d\theta} wobei p(θ|x)p(θ|x)p(\theta|x) der hintere ist, f(X|θ)f(X|θ)f(X|\theta) die bedingte Verteilung ist und p(θ)p(θ)p(\theta) der Prior ist. oder p(θ|x)=L(θ|x)p(θ)∫θL(θ|x)p(θ)dθp(θ|x)=L(θ|x)p(θ)∫θL(θ|x)p(θ)dθp(\theta|x) = \frac{L(\theta|x)p(\theta)}{\int_{\theta} L(\theta|x)p(\theta)d\theta} wobei p(θ|x)p(θ|x)p(\theta|x) der hintere ist, L(θ|x)L(θ|x)L(\theta|x) die Wahrscheinlichkeitsfunktion ist und p(θ)p(θ)p(\theta) der Prior ist. Meine Frage ist Warum …

5
Gute Bücher zum Thema Text Mining?
Hallo, ich wollte wissen, ob es einige gute Bücher zum Thema Text Mining und Klassifizierung mit einigen Fallstudien gibt. Wenn nicht, würden einige öffentlich zugängliche Papiere / Zeitschriften ausreichen. Wenn sie ihre Beispiele mit R noch besser veranschaulichen. Ich suche kein schrittweises Handbuch, sondern etwas, das die Vor- und Nachteile …

4
Versuchen Sie, den Gini-Index für die StackOverflow-Reputationsverteilung zu berechnen?
Ich versuche, den Gini-Index für die SO-Reputationsverteilung mit SO Data Explorer zu berechnen. Die Gleichung, die ich zu implementieren versuche, lautet: Wobei:n= Anzahl der Benutzer auf der Site; i= Benutzer-Seriennummer (1 - 1.225.000); yi= Ruf des Benutzersi.G(S)=1n−1(n+1−2(∑ni=1(n+1−i)yi∑ni=1yi))G(S)=1n−1(n+1−2(∑i=1n(n+1−i)yi∑i=1nyi)) G(S)=\frac{1}{n-1}\left(n+1-2\left(\frac{\sum^n_{i=1}(n+1-i)y_i}{\sum^n_{i=1}y_i}\right)\right) nnniiiyiyiy_iiii So habe ich es implementiert (von hier kopiert ): DECLARE @numUsers …
11 gini 

1
Kann ich für dieses Beispiel (log-) Normalität annehmen?
Hier ist ein QQ-Diagramm für meine Stichprobe (beachten Sie die logarithmische Y-Achse). :n = 1000n=1000n = 1000 Wie von whuber hervorgehoben, weist dies darauf hin, dass die zugrunde liegende Verteilung nach links geneigt ist (der rechte Schwanz ist kürzer). shapiro.testW.= 0,9718W.=0,9718W = 0.97185,172 ⋅ 10- 135.172⋅10- -135.172\cdot10^{-13}H.0: Die Probe ist …

1
Wie kann man einen Koeffizienten in einer ordinalen logistischen Regression ohne proportionale Quotenannahme in R festlegen?
Ich möchte eine ordinale logistische Regression in R ohne die Annahme der Proportionalitätswahrscheinlichkeit durchführen. Ich weiß, dass dies direkt mit der vglm()Funktion in Rdurch Einstellung erfolgen kann parallel=FALSE. Mein Problem ist jedoch, wie ein bestimmter Satz von Koeffizienten in diesem Regressionssetup festgelegt werden kann. Angenommen, die abhängige Variable ist diskret …
11 r  regression  logistic 

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.