Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Beeren-Inversion
Ich verfüge über umfangreiche Marktdaten zu Weinverkäufen in den USA und möchte die Nachfrage nach bestimmten Qualitätsweinen schätzen. Diese Marktanteile wurden grundsätzlich abgeleitet aus einem statistischen Gebrauchsmuster der Form , wo X umfasst beobachtet Produkteigenschaften, p bezeichnet Produktpreise,Uijt=X′jtβ−αpjt+ξjt+ϵijt≡δjt+ϵjtUijt=Xjt′β−αpjt+ξjt+ϵijt≡δjt+ϵjtU_{ijt} = X’_{jt}\beta - \alpha p_{jt} + \xi_{jt} + \epsilon_{ijt} \equiv \delta_{jt} + …

2
Pizzastatistik für die Massen
Ein kurzer Eintrag auf der NY Times-Website enthält die Fakten und Zahlen zum Pizzakonsum in den USA. Ich habe ein gelegentliches Interesse daran, wie Statistiken verwendet (oder missbraucht) werden, um Informationen für das allgemeine Publikum bereitzustellen, und es sind einige Fragen auf der Grundlage der vorgelegten Statistiken aufgetreten: Wenn einer …

1
Berechnen Sie die log-Wahrscheinlichkeit „von Hand“ für die verallgemeinerte nichtlineare Regression der kleinsten Quadrate (nlme)
Ich versuche, die log-Wahrscheinlichkeit für eine verallgemeinerte nichtlineare Regression der kleinsten Quadrate für die Funktion f ( x ) = β 1 zu berechnenoptimiert durch dieFunktion im R-Paketunter Verwendung der Varianz-Kovarianz-Matrix, die durch Abstände auf einem phylogenetischen Baum unter Annahme einer Brownschen Bewegung (aus demPaket) erzeugt wird. Der folgende reproduzierbare …

1
Schätzen der Korrelation zwischen einer kontinuierlichen Variablen und einer kategorialen Variablen mithilfe gegenseitiger Informationen
In Bezug auf den Titel besteht die Idee darin, die gegenseitige Information hier und nach MI zu verwenden, um die "Korrelation" (definiert als "wie viel ich über A weiß, wenn ich B weiß") zwischen einer kontinuierlichen Variablen und einer kategorialen Variablen zu schätzen. Ich werde Ihnen gleich meine Gedanken zu …

3
Wie verwandle ich die leptokurtische Verteilung in Normalität?
Angenommen, ich habe eine leptokurtische Variable, die ich in Normalität umwandeln möchte. Welche Transformationen können diese Aufgabe erfüllen? Mir ist durchaus bewusst, dass die Umwandlung von Daten nicht immer wünschenswert ist, aber als akademische Maßnahme möchte ich die Daten in die Normalität "hämmern". Wie Sie aus der Grafik ersehen können, …

1
Informationen aus der Hutmatrix für die logistische Regression
Mir ist klar und an mehreren Stellen gut erklärt, welche Informationen die Werte auf der Diagonale der Hutmatrix für die lineare Regression liefern. Die Hutmatrix eines logistischen Regressionsmodells ist mir weniger klar. Ist es identisch mit den Informationen, die Sie durch lineare Regression aus der Hutmatrix erhalten? Dies ist die …

4
Annahmen zur verbleibenden Regressionsverteilung
Warum ist es notwendig, die Verteilungsannahme auf die Fehler zu setzen, dh yi=Xβ+ϵiyi=Xβ+ϵiy_i = X\beta + \epsilon_{i} mitϵi∼N(0,σ2)ϵi∼N(0,σ2)\epsilon_{i} \sim \mathcal{N}(0,\sigma^{2}) . Warum nicht schreiben yi=Xβ+ϵiyi=Xβ+ϵiy_i = X\beta + \epsilon_{i} mityi∼N(Xβ^,σ2)yi∼N(Xβ^,σ2)y_i \sim \mathcal{N}(X\hat{\beta},\sigma^{2}) , wobei in jedem Fall ϵi=yi−y^ϵi=yi−y^\epsilon_i = y_i - \hat{y} . Ich habe gesehen, wie betont wurde, dass …



3
Bayesian vs MLE, Überanpassungsproblem
In Bishops PRML-Buch sagt er, dass Überanpassung ein Problem bei der Maximum Likelihood Estimation (MLE) ist und Bayesian dies vermeiden kann. Aber ich denke, Überanpassung ist eher ein Problem bei der Modellauswahl als bei der Methode zur Parameterschätzung. Angenommen, ich habe einen Datensatz , der über f ( x ) …

1
Warum ist der F-Test in linearen Gauß-Modellen am leistungsfähigsten?
Für ein lineares Gauß-Modell Y=μ+σGY=μ+σGY=\mu+\sigma G bei dem angenommen wird, dass μμ\mu in einem Vektorraum WWW und GGG die Standardnormalverteilung auf RnRn\mathbb{R}^n , ist die Statistik des FFF Tests für H0:{μ∈U}H0:{μ∈U}H_0\colon\{\mu \in U\} wobei U⊂WU⊂WU \subset W ist ein Vektorraum, eine zunehmende Eins-zu-Eins-Funktion der Abweichungsstatistik : Woher wissen wir, dass …

1
Erklären Sie die Schritte des LLE-Algorithmus (Local Linear Embedding).
Ich verstehe, dass das Grundprinzip des Algorithmus für LLE aus drei Schritten besteht. Ermitteln der Nachbarschaft jedes Datenpunkts anhand einer Metrik wie k-nn. Suchen Sie für jeden Nachbarn Gewichte, die die Auswirkung des Nachbarn auf den Datenpunkt angeben. Konstruieren Sie die niedrig dimensionale Einbettung der Daten basierend auf den berechneten …


2
Warum verwendet der Unabhängigkeitstest die Chi-Quadrat-Verteilung?
Der -Anpassungstest verwendet die folgende Statistik : Im Test wird dies gewährt Wenn die Bedingungen erfüllt sind, verwendet man die - -Verteilung , um den p-Wert zu berechnen, der bei der dass wahr ist, in einer repräsentativen Stichprobe der gleichen Größe beobachtet werden würde.χ2χ2\chi^2χ20=∑i=1n(Oi−Ei)2Eiχ02=∑i=1n(Oi−Ei)2Ei \chi_0^2=\sum_{i=1}^n\frac{(O_i-E_i)^2}{E_i} χ2χ2\chi^2H0H0H_0 Damit jedoch eine Statistik …

2
Der
Ich habe gerade in einem angesehenen (populären) Wissenschaftsmagazin (PM, 02/2013, S.36) über ein interessantes Experiment gelesen (leider ohne Quelle). Es erregte meine Aufmerksamkeit, weil ich intuitiv die Bedeutung des Ergebnisses bezweifelte, aber die bereitgestellten Informationen für die Reproduktion der statistischen Tests ausreichten. Die Forscher fragten sich, ob Erkältung bei kaltem …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.