Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Wie kann ich einige aller möglichen Kombinationen in R erhalten?
Manchmal möchte ich einen genauen Test durchführen, indem ich alle möglichen Kombinationen der Daten untersuche, um eine empirische Verteilung zu erstellen, anhand derer ich meine beobachteten Unterschiede zwischen den Mitteln testen kann. Um die möglichen Kombinationen zu finden, würde ich normalerweise die Combn-Funktion verwenden. Die Auswahlfunktion kann mir zeigen, wie …


2
Kreuzvalidierung in sehr hohen Dimensionen (um die Anzahl der verwendeten Variablen in sehr hohen Dimensionen auszuwählen)
Meine Frage betrifft die Kreuzvalidierung, wenn es viel mehr Variablen als Beobachtungen gibt. Um Ideen zu fixieren, schlage ich vor, mich auf den Klassifizierungsrahmen in sehr hohen Dimensionen zu beschränken (mehr Merkmale als Beobachtung). Problem: Angenommen, Sie haben für jede Variable ein Maß für die Wichtigkeit als das Interesse des …


2
Automatisierung der statistischen Korrelation zwischen „Texten“ und „Daten“
Ich sammle Textdaten zu Pressemitteilungen, Blog-Posts, Bewertungen usw. der Produkte und Leistungen bestimmter Unternehmen. Insbesondere möchte ich prüfen, ob es Korrelationen zwischen bestimmten Arten und / oder Quellen solcher "Textinhalte" mit den Marktbewertungen der Aktiensymbole der Unternehmen gibt. Solche offensichtlichen Korrelationen können vom menschlichen Verstand ziemlich schnell gefunden werden - …

9
Ressourcen zum Erlernen der statistischen Analyse von Finanzdaten
Mir ist klar, dass die statistische Analyse von Finanzdaten ein großes Thema ist, aber genau deshalb muss ich meine Frage stellen, wenn ich versuche, in die Welt der Finanzanalyse einzudringen. Da ich zu diesem Zeitpunkt so gut wie nichts über das Thema weiß, sind die Ergebnisse meiner Google-Suche überwältigend. Viele …

4
Warum unterscheidet sich der Durchschnitt des höchsten Werts aus 100 Zügen aus einer Normalverteilung vom 98. Perzentil der Normalverteilung?
Warum unterscheidet sich der Durchschnitt des höchsten Werts aus 100 Ziehungen aus einer Normalverteilung vom 98% -Perzentil der Normalverteilung? Es scheint, dass sie per Definition gleich sein sollten. Aber... Code in R: NSIM <- 10000 x <- rep(NA,NSIM) for (i in 1:NSIM) { x[i] <- max(rnorm(100)) } qnorm(.98) qnorm(.99) mean(x) …

2
Warum möchten viele Menschen verzerrte Daten in normalverteilte Daten für maschinelle Lernanwendungen umwandeln?
Bei Bild- und Tabellendaten wandeln viele Personen die verzerrten Daten während der Vorverarbeitung in normalverteilte Daten um. Was bedeutet die Normalverteilung beim maschinellen Lernen? Ist es eine wesentliche Annahme von Algorithmen für maschinelles Lernen? Sogar bei den Bilddaten habe ich eine Quantiltransformation gesehen, die die gesamten Pixel eines Bildes transformiert, …

4
Das Froschproblem (Puzzle im YouTube-Video)
Das YouTube-Video enthält ein interessantes Rätsel. Können Sie das Froschproblem lösen? . Ich werde versuchen, hier eine äquivalente Formulierung zu geben. Ein Frosch ist auf der einen Seite des Teiches und möchte auf die andere Seite. Es gibt Lilienblätter in einer Reihe, wobei der te Laub am anderen Ende des …

3
Zeichen der Kovarianz und von Spearmans Rho
Hat jemand einen Beweis dafür, dass die Kovarianz zwischen zwei Variablen immer das gleiche Vorzeichen wie Spearmans Rho hat, vorausgesetzt, dass beide nicht Null sind , oder eine Erklärung / ein Gegenbeispiel, um zu zeigen, warum dies nicht der Fall ist? Ich spreche von den "theoretischen" Größen der "Bevölkerung", nicht …

1
Warum verwenden Menschen PCA, wenn es so viele Probleme gibt?
(Dies ist eine weiche Frage.) Vor kurzem lerne ich die Hauptkomponentenanalyse und es scheint viele Probleme zu geben: Sie müssen die Daten auf ungefähr den gleichen Maßstab umwandeln, bevor Sie PCA anwenden. Die Art und Weise, wie die Feature-Skalierung durchgeführt werden soll, ist jedoch nicht festgelegt. Standardisierung? Skalierung auf Längeneinheit? …



1
Ist es möglich, dass AIC = BIC?
Zwei bekannte (und verwandte) Messgrößen für die Modellkomplexität aus der Statistik sind das Akaike Information Criterion (AIC) und das Bayesian Information Criterion (BIC). Wann könnte AIC = BIC sein?
8 aic  bic 

3
Was ist der
In der Bayes'schen Wahrscheinlichkeitstheorie ist Wahrscheinlichkeit unser Ausdruck von Wissen über eine bestimmte Sache, nicht eine Eigenschaft dieser Sache. Ich sehe jedoch immer Leute behandelnpppals ein Parameter, der geschätzt werden muss. Sie haben einen Prior für eingerichtetppp, normalerweise in Form einer Beta-Funktion, und aktualisieren Sie diese dann, wenn "Realisierungen" dieser …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.