Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

5
Bestimmen Sie den Stichprobenumfang vor Beginn eines Experiments oder führen Sie das Experiment auf unbestimmte Zeit durch?
Ich habe vor Jahren Statistik studiert und alles vergessen, so dass dies als allgemeine konzeptionelle Fragen erscheinen mag, aber hier ist mein Problem. Ich arbeite als UX Designer für eine E-Commerce-Website. Wir haben ein vor Jahren gebautes A / B-Test-Framework, an dem ich anfange zu zweifeln. Die Metrik, über die …

3
Warum setzen mehrere (wenn nicht alle) parametrische Hypothesentests eine Zufallsstichprobe voraus?
Tests wie Z, t und einige andere gehen davon aus, dass die Daten auf einer Zufallsstichprobe basieren. Warum? Angenommen, ich mache experimentelle Forschungen, bei denen mir die interne Gültigkeit viel mehr am Herzen liegt als die externe. Also, wenn meine Stichprobe ein bisschen voreingenommen sein könnte, okay, da ich zugestimmt …


1
Verschiedene Kovarianztypen für Gaußsche Mischungsmodelle
Während ich hier Gaußsche Mischungsmodelle ausprobierte , fand ich diese 4 Arten von Kovarianzen. 'full' (each component has its own general covariance matrix), 'tied' (all components share the same general covariance matrix), 'diag' (each component has its own diagonal covariance matrix), 'spherical' (each component has its own single variance). Ich …

2
Wie können die gewählten falsch-positiven / falsch-negativen Fehlerquoten und die zugrunde liegende Kostenquote konsequent gerechtfertigt werden?
Kontext Eine Gruppe von Sozialwissenschaftlern und Statistikern ( Benjamin et al., 2017 ) hat kürzlich vorgeschlagen, dass die typische falsch-positive Rate ( = 0,05), die als Schwelle für die Bestimmung der "statistischen Signifikanz" verwendet wird, an eine konservativere Schwelle angepasst werden muss ( = .005). Eine konkurrierende Gruppe von Sozialwissenschaftlern …

1
Matrixform der Rückausbreitung mit Chargennormalisierung
Der Batch-Normalisierung wurden erhebliche Leistungsverbesserungen in tiefen neuronalen Netzen zugeschrieben. Zahlreiches Material im Internet zeigt, wie es von Aktivierung zu Aktivierung umgesetzt werden kann. Ich habe Backprop bereits mithilfe der Matrixalgebra implementiert, und da ich in Hochsprachen arbeite (während ich mich auf Rcpp(und möglicherweise auch auf GPUs) für eine dichte …

5
wenn
XXX und sind unabhängig voneinander verteilte Zufallsvariablen, wobei und . Wie ist die Verteilung von ?YYYX∼χ2(n−1)X∼χ(n−1)2X\sim\chi^2_{(n-1)}Y∼Beta(n2−1,n2−1)Y∼Beta(n2−1,n2−1)Y\sim\text{Beta}\left(\frac{n}{2}-1,\frac{n}{2}-1\right)Z=(2Y−1)X−−√Z=(2Y−1)XZ=(2Y-1)\sqrt X Die Fugendichte von ist gegeben durch(X,Y)(X,Y)(X,Y) fX,Y(x,y)=fX(x)fY(y)=e−x2xn−12−12n−12Γ(n−12)⋅yn2−2(1−y)n2−2B(n2−1,n2−1)1{x&gt;0,0&lt;y&lt;1}fX,Y(x,y)=fX(x)fY(y)=e−x2xn−12−12n−12Γ(n−12)⋅yn2−2(1−y)n2−2B(n2−1,n2−1)1{x&gt;0,0&lt;y&lt;1}f_{X,Y}(x,y)=f_X(x)f_Y(y)=\frac{e^{-\frac{x}{2}}x^{\frac{n-1}{2}-1}}{2^{\frac{n-1}{2}}\Gamma\left(\frac{n-1}{2}\right)}\cdot\frac{y^{\frac{n}{2}-2}(1-y)^{\frac{n}{2}-2}}{B\left(\frac{n}{2}-1,\frac{n}{2}-1\right)}\mathbf1_{\{x>0\,,\,00\,,\,|z|<w\}} Das marginale pdf von ist dann , was mich nirgendwohin führt.ZZZfZ(z)=∫∞|z|fZ,W(z,w)dwfZ(z)=∫|z|∞fZ,W(z,w)dwf_Z(z)=\displaystyle\int_{|z|}^\infty f_{Z,W}(z,w)\,\mathrm{d}w Wiederum zeigt sich beim Auffinden der Verteilungsfunktion von eine unvollständige Beta / Gamma-Funktion:ZZZ FZ(z)=Pr(Z≤z)FZ(z)=Pr(Z≤z)F_Z(z)=\Pr(Z\le …

3
Wie programmiere ich eine Monte-Carlo-Simulation von Bertrands Box-Paradoxon?
Das folgende Problem wurde auf der Mensa International Facebook-Seite veröffentlicht: \quad\quad\quad\quad\quad\quad\quad\quad Der Post selbst hat über 1000 Kommentare erhalten, aber ich werde hier nicht näher auf die Debatte eingehen, da ich weiß, dass dies Bertrands Box-Paradoxon ist und die Antwort lautet . Mich interessiert hier, wie man dieses Problem mit …

1
Werden Root-Transformationen empfohlen?
Mein Kollege möchte einige Daten analysieren, nachdem er die Antwortvariable transformiert hat, indem er sie auf die Potenz von (d. ).1818\frac18y0.125y0.125y^{0.125} Das ist mir unangenehm, aber ich habe Mühe zu erklären, warum. Ich kann mir keine mechanistischen Gründe für diese Transformation vorstellen. Ich habe es noch nie zuvor gesehen, und …

3
Forscher 1 führt 1000 Regressionen aus, Forscher 2 führt nur 1 aus, beide führen zu denselben Ergebnissen - sollten sie unterschiedliche Schlussfolgerungen ziehen?
Stellen Sie sich vor, ein Forscher untersucht einen Datensatz und führt 1000 verschiedene Regressionen durch und findet eine interessante Beziehung zwischen ihnen. Stellen Sie sich nun vor, ein anderer Forscher mit denselben Daten führt nur eine Regression aus, und es stellt sich heraus, dass der andere Forscher 1000 Regressionen durchgeführt …

5
Warum ist der Gradientenabstieg bei großen Datenmengen ineffizient?
Nehmen wir an, unser Datensatz enthält 1 Million Beispiele, dh , und wir möchten den Gradientenabstieg verwenden, um eine logistische oder lineare Regression für diesen Datensatz durchzuführen.x1,…,x106x1,…,x106x_1, \ldots, x_{10^6} Was macht die Gradientenabstiegsmethode ineffizient? Es sei daran erinnert, dass der Gradientenabstiegsschritt zum Zeitpunkt gegeben ist durch:ttt wt+1=wt+ηt∇f(x)wt+1=wt+ηt∇f(x)w_{t+1} = w_{t} + …

1
Generalisierte additive Modelle (GAMs), Wechselwirkungen und Kovariaten
Ich habe eine Reihe von Prognosewerkzeugen untersucht und festgestellt, dass generalisierte additive Modelle (GAMs) für diesen Zweck das größte Potenzial haben. GAMs sind großartig! Sie ermöglichen es, komplexe Modelle sehr präzise zu spezifizieren. Diese Prägnanz führt jedoch zu einigen Verwirrungen, insbesondere in Bezug darauf, wie GAMs Interaktionsterme und Kovariaten auffassen. …
12 r  modeling  gam  mgcv 

5
Ist die lineare Regression überholt? [geschlossen]
Geschlossen . Diese Frage ist meinungsbasiert . Derzeit werden keine Antworten akzeptiert. Möchten Sie diese Frage verbessern? Aktualisieren Sie die Frage, damit sie mit Fakten und Zitaten beantwortet werden kann, indem Sie diesen Beitrag bearbeiten . Geschlossen vor 2 Jahren . Ich bin derzeit in einer linearen Regressionsklasse, kann aber …

1
Zusammenfassung einer GAM-Anpassung
Wenn wir ein GAM passen wie: gam.fit = gam::gam(Outstate ~ Private + s(Room.Board, df = 2) + s(PhD, df = 2) + s(perc.alumni, df = 2) + s(Expend, df = 5) + s(Grad.Rate, df = 2), data = College) Wo verwenden wir den Datensatz College, der im Paket zu finden …
12 anova  gam 

2
Konstruktionsbeispiel mit
Wie konstruiere ich ein Beispiel für eine Wahrscheinlichkeitsverteilung, für die E ( 1X )=1E ( X )E(1X)=1E(X)\mathbb{E}\left(\frac{1}{X}\right)=\frac{1}{\mathbb{E}(X)} gilt unter der Annahme, dassP(X≠0)=1P(X≠0)=1\mathbb{P}(X\ne0)=1? Die Ungleichung, die sich aus Jensens Ungleichung für ein positiv bewertetes Wohnmobil ergibt XXX ergibt, ist wie E ( 1X )≥1E ( X )E(1X)≥1E(X)\mathbb{E}\left(\frac{1}{X}\right)\ge\frac{1}{\mathbb{E}(X)} (die umgekehrte Ungleichung, wennX …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.