Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

5
Glätten Sie eine kreisförmige / periodische Zeitreihe
Ich habe Daten für Kraftfahrzeugunfälle nach Tageszeit. Wie zu erwarten, sind sie mitten am Tag hoch und erreichen zur Hauptverkehrszeit ihren Höhepunkt. Die Standard-geom_density von ggplot2 glättet es gut Eine Teilmenge der Daten für Unfälle im Zusammenhang mit Alkohol am Steuer ist an beiden Enden des Tages (abends und am …


1
Verwirrt durch Ableitung der Regressionsfunktion
Ich habe gerade eine Kopie von The Elements of Statistical Learning von Hastie, Tibshirani und Friedman erhalten. In Kapitel 2 (Überblick über betreutes Lernen), Abschnitt 4 (Statistische Entscheidungstheorie) gibt er eine Ableitung der Regressionsfunktion. Lassen bezeichnet einen reellen Zufallseingangsvektor geschätzt und einer reellen Zufallsausgangsgröße bewertet, mit gemeinsamer Verteilung . Wir …






1
Vervollständigen Sie eine ausreichende Statistik
Ich habe vor kurzem angefangen, statistische Inferenz zu studieren. Ich habe verschiedene Probleme durchgearbeitet und dieses hat mich völlig verblüfft. Sei X1,…,XnX1,…,XnX_1,\dots,X_n eine Zufallsstichprobe aus einer diskreten Verteilung, die mit Wahrscheinlichkeit 1313\frac{1}{3} die Werteθ−1, θ, or θ+1θ−1, θ, or θ+1\theta-1,\space\theta,\space\text{or}\space\theta+1, wobeiθθ\theta; eine ganze Zahl ist. Zeigen Sie, dass es keine …



1
Was bedeutet hochgestellt in
Im Zusammenhang mit der wahrscheinlichkeitsbasierten Inferenz habe ich einige Notationen bezüglich der interessierenden Parameter gesehen, die ich etwas verwirrend fand. Zum Beispiel Notation wie pθ( x )pθ(x)p_{\theta}(x) und E.θ[ S.( θ ) ]Eθ[S(θ)]{\mathbb E}_{\theta}\left[S(\theta)\right] . Welche Bedeutung hat der Parameter ( θθ\theta ) in der obigen Indexnotation? Mit anderen Worten, …


1
Bedeutung der partiellen Korrelation
Aus Wikipedia Formal ist die partielle Korrelation zwischen und einer Gruppe von gegebenen Steuern Variablen , geschrieben ρ_ {XY · Z} , ist die Korrelation zwischen den Residuen RX und RY von dem resultierenden lineare Regression von X mit Z und Y mit Z bezeichnet.XXXYYYnnnZ={Z1,Z2,…,Zn}Z={Z1,Z2,…,Zn}Z = \{Z_1, Z_2, …, Z_n\}ρXY⋅ZρXY·Zρ_{XY·Z}RXRXRXRYRYRYXXXZZZYYYZZZ …

2
Simulieren Sie eine eingeschränkte Normalen an der unteren oder oberen Grenze in R.
Ich möchte zufällige Daten aus einer eingeschränkten Normalverteilung mit R generieren. Zum Beispiel möchte ich vielleicht eine Variable aus einer Normalverteilung mit simulieren mean=3, sd= 2und alle Werte größer als 5 werden aus derselben Normalverteilung neu abgetastet. Für die allgemeine Funktion könnte ich also Folgendes tun. rnorm(n=100, mean=3, sd=2) Ich …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.