Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Gibt es ein Ergebnis, das angibt, dass der Bootstrap nur dann gültig ist, wenn die Statistik glatt ist?
Wir gehen davon aus, dass unsere Statistik eine Funktion einiger Daten ist, die aus der Verteilungsfunktion . Die empirische Verteilungsfunktion unserer Stichprobe ist . So ist die Statistik als Zufallsvariable betrachtet und wird die Bootstrap - Version der Statistik. Wir verwenden als KS-AbstandX 1 , ... X n F F …



5
Algorithmen für maschinelles Lernen zur Behandlung fehlender Daten
Ich versuche, ein Vorhersagemodell mit hochdimensionalen klinischen Daten einschließlich Laborwerten zu entwickeln. Der Datenraum ist mit 5k Samples und 200 Variablen spärlich. Die Idee ist, die Variablen mithilfe einer Feature-Auswahlmethode (IG, RF usw.) zu klassifizieren und hochrangige Features für die Entwicklung eines Vorhersagemodells zu verwenden. Während die Featureauswahl mit einem …

4
Funktionen unabhängiger Zufallsvariablen
Ist die Behauptung, dass Funktionen unabhängiger Zufallsvariablen selbst unabhängig sind, wahr? Ich habe gesehen, dass dieses Ergebnis oft implizit in einigen Beweisen verwendet wird, zum Beispiel beim Nachweis der Unabhängigkeit zwischen dem Stichprobenmittelwert und der Stichprobenvarianz einer Normalverteilung, aber ich konnte keine Rechtfertigung dafür finden. Es scheint, dass einige Autoren …

2
Zeichnung aus Dirichlet-Verteilung
Nehmen wir an, wir haben eine Dirichlet-Verteilung mit dem dimensionalen . Wie kann ich aus dieser Verteilung eine Stichprobe (einen dimensionalen Vektor) ziehen? Ich brauche eine (möglicherweise) einfache Erklärung.KKKα⃗ = [ α1, α2, . . . , αK]α→=[α1,α2,...,αK]\vec\alpha = [\alpha_1, \alpha_2,...,\alpha_K]KKK

2
Intuition hinter der logistischen Regression
Vor kurzem habe ich angefangen, maschinelles Lernen zu studieren, aber ich habe die Intuition hinter der logistischen Regression nicht verstanden . Das Folgende sind die Fakten zur logistischen Regression, die ich verstehe. Als Grundlage für die Hypothese verwenden wir die Sigmoidfunktion . Ich verstehe, warum es eine richtige Wahl ist, …

5
Sollten Sie jemals binäre Variablen standardisieren?
Ich habe einen Datensatz mit einer Reihe von Funktionen. Einige von ihnen sind binär aktiv oder abgefeuert, 0 = inaktiv oder ruhend), und der Rest ist ein reeller Wert, z . B. 4564.342 .(1=(1=(1=0=0=0=4564.3424564.3424564.342 Ich möchte diese Daten einem maschinellen Lernalgorithmus zuführen , damit ich alle wirklich wertvollen Funktionen -bewerten …




2
Untersetzen von R Zeitreihenvektoren
Ich habe eine Zeitreihe und möchte sie unter Beibehaltung von Anfang, Ende und Häufigkeit als Zeitreihe unterteilen. Angenommen, ich habe eine Zeitreihe: > qs <- ts(101:110, start=c(2009, 2), frequency=4) > qs Qtr1 Qtr2 Qtr3 Qtr4 2009 101 102 103 2010 104 105 106 107 2011 108 109 110 Jetzt werde …
25 r  time-series 

1
Erklärung des endlichen Korrekturfaktors
Ich verstehe, dass bei Stichproben aus einer endlichen Grundgesamtheit und einer Stichprobengröße von mehr als 5% der Grundgesamtheit eine Korrektur des Mittelwerts und des Standardfehlers der Stichprobe nach folgender Formel erforderlich ist: FPC= N- nN- 1----√FPC=N−nN−1\hspace{10mm} FPC=\sqrt{\frac{N-n}{N-1}} Wobei die Populationsgröße und die Stichprobengröße ist.NNNnnn Ich habe 3 Fragen zu dieser …



Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.