Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Wie werden Vorhersagebänder für die nichtlineare Regression berechnet?
Die Hilfeseite für Prisma enthält die folgenden Erläuterungen zur Berechnung der Vorhersagebänder für die nichtlineare Regression. Bitte entschuldigen Sie das lange Zitat, aber ich nicht dem zweiten Absatz (der erklärt, wie G|xG|xG|x definiert und berechnet wird). Jede Hilfe wäre sehr dankbar.dY/dPdY./dPdY/dP Die Berechnung der Konfidenz- und Vorhersagebänder ist ziemlich normal. …


1
Wie zeichnet man eine Treppenstufenfunktion mit ggplot?
Verschlossen . Diese Frage und ihre Antworten sind gesperrt, da die Frage nicht zum Thema gehört, aber von historischer Bedeutung ist. Derzeit werden keine neuen Antworten oder Interaktionen akzeptiert. Ich habe die Grafik wie folgt: R-Code für die Generierung ist: DF <- data.frame(date = as.Date(runif(100, 0, 800),origin="2005-01-01"), outcome = rbinom(100, …

3
Wie kann ich die Wahrscheinlichkeit abschätzen, dass ein zufälliges Mitglied aus einer Population „besser“ ist als ein zufälliges Mitglied aus einer anderen Population?
Angenommen, ich habe Proben aus zwei verschiedenen Populationen. Wenn ich messe, wie lange jedes Mitglied für eine Aufgabe benötigt, kann ich den Mittelwert und die Varianz jeder Population leicht abschätzen. Wenn ich jetzt eine zufällige Paarung mit einem Individuum aus jeder Population annehme, kann ich dann die Wahrscheinlichkeit abschätzen, dass …

2
Was ist eine "Nachrichtenübermittlungsmethode"?
Ich habe eine vage Vorstellung davon, was eine Nachrichtenübermittlungsmethode ist: ein Algorithmus, der eine Annäherung an eine Verteilung durch iteratives Erstellen von Annäherungen jedes der Faktoren der Verteilung erstellt, die von allen Annäherungen aller anderen Faktoren abhängig sind. Ich glaube, dass beide Beispiele Variation Message Passing und Expectation Propagation sind …


1
Welche Vor- und Nachteile hat das Lernen einer Verteilung algorithmisch (Simulationen) gegenüber mathematisch?
Welche Vor- und Nachteile hat es, die Eigenschaften einer Verteilung algorithmisch (über Computersimulationen) im Vergleich zu mathematisch zu lernen? Es scheint, dass Computersimulationen eine alternative Lernmethode sein können, insbesondere für diejenigen neuen Schüler, die sich nicht stark in der Analysis fühlen. Es scheint auch, dass Codierungssimulationen ein früheres und intuitiveres …

1
Wie werden ANOVA-Kontraste mit dem Fahrzeugpaket in R eingerichtet und interpretiert?
Angenommen, ich habe ein einfaches Experiment mit 2 × 2 Faktoren, an dem ich eine ANOVA durchführen möchte. So zum Beispiel: d <- data.frame(a=factor(sample(c('a1','a2'), 100, rep=T)), b=factor(sample(c('b1','b2'), 100, rep=T))); d$y <- as.numeric(d$a)*rnorm(100, mean=.75, sd=1) + as.numeric(d$b)*rnorm(100, mean=1.2, sd=1) + as.numeric(d$a)*as.numeric(d$b)*rnorm(100, mean=.5, sd=1) + rnorm(100); In Ermangelung einer signifikanten Interaktion ist …
15 r  anova  contrasts 

1
Wie funktioniert die Quantilnormalisierung?
In Genexpressionsstudien mit Microarrays müssen Intensitätsdaten normalisiert werden, damit Intensitäten zwischen Individuen und Genen verglichen werden können. Konzeptionell und algorithmisch funktioniert die "Quantil-Normalisierung" und wie würden Sie dies einem Nicht-Statistiker erklären?

2
Fläche unter dem "pdf" in der Kerndichteschätzung in R
Ich versuche, die ' Dichte' -Funktion in R zu verwenden, um Kernel-Dichteschätzungen durchzuführen. Ich habe einige Schwierigkeiten, die Ergebnisse zu interpretieren und verschiedene Datensätze zu vergleichen, da die Fläche unter der Kurve nicht unbedingt 1 zu sein scheint. Für jede Wahrscheinlichkeitsdichtefunktion (pdf) müssen wir die Fläche . Ich gehe davon …

1
Implementiert GSVD alle linearen multivariaten Techniken?
Ich bin auf den Artikel von Hervé Abdi über generalisierte SVD gestoßen. Der Autor erwähnte: Die generalisierte SVD (GSVD) zerlegt eine rechteckige Matrix und berücksichtigt Einschränkungen, die den Zeilen und Spalten der Matrix auferlegt sind. Die GSVD liefert eine gewichtete verallgemeinerte Schätzung der kleinsten Quadrate einer gegebenen Matrix durch eine …


2
Kullback-Leibler-Divergenz zwischen zwei Gamma-Verteilungen
Auswahl der Parametrisierung der Gammaverteilung durch das PDF Die Kullback-Leibler-Divergenz zwischen und ist gegeben durch [1] alsΓ(b,c)Γ(b,c)\Gamma(b,c)g(x;b,c)=1Γ(c)xc−1bce−x/bg(x;b,c)=1Γ(c)xc−1bce−x/bg(x;b,c) = \frac{1}{\Gamma(c)}\frac{x^{c-1}}{b^c}e^{-x/b}Γ(bq,cq)Γ(bq,cq)\Gamma(b_q,c_q)Γ(bp,cp)Γ(bp,cp)\Gamma(b_p,c_p) KLGa(bq,cq;bp,cp)=(cq−1)Ψ(cq)−logbq−cq−logΓ(cq)+logΓ(cp)+cplogbp−(cp−1)(Ψ(cq)+logbq)+bqcqbpKLGa(bq,cq;bp,cp)=(cq−1)Ψ(cq)−log⁡bq−cq−log⁡Γ(cq)+log⁡Γ(cp)+cplog⁡bp−(cp−1)(Ψ(cq)+log⁡bq)+bqcqbp\begin{align} KL_{Ga}(b_q,c_q;b_p,c_p) &= (c_q-1)\Psi(c_q) - \log b_q - c_q - \log\Gamma(c_q) + \log\Gamma(c_p)\\ &\qquad+ c_p\log b_p - (c_p-1)(\Psi(c_q) + \log b_q) + \frac{b_qc_q}{b_p} \end{align} Ich vermute, dass Ψ(x):=Γ′(x)/Γ(x)Ψ(x):=Γ′(x)/Γ(x)\Psi(x):= \Gamma'(x)/\Gamma(x) die Digamma-Funktion …

4
Kostenloses öffentliches Datenhosting? [geschlossen]
Geschlossen. Diese Frage ist nicht zum Thema . Derzeit werden keine Antworten akzeptiert. Möchten Sie diese Frage verbessern? Aktualisieren Sie die Frage so, dass sie zum Thema passt für Kreuz Validated. Geschlossen vor 4 Jahren . Ich habe stündliche und tägliche Temperaturberichte für viele Stationen unter http://data.barrycarter.info/ Ich ermutige die …
15 dataset 


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.