Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Cohens d für den abhängigen Stichproben-T-Test
Kurze Frage: Ich habe gesehen, dass Cohens d zwei verschiedene Methoden für einen T-Test für abhängige Proben berechnet hat (z. B. Design innerhalb der Proben, um die Wirksamkeit eines Medikaments mit Zeitpunkten vor / nach dem Test zu testen). Unter Verwendung der Standardabweichung der Änderungsbewertung im Nenner der Gleichung für …

3
Warum in CLT
Sei X1,...,XnX1,...,XnX_1,...,X_n unabhängige Beobachtungen von einer Verteilung, die den Mittelwert μμ\mu und die Varianz σ2&lt;∞σ2&lt;∞\sigma^2 < \infty , wenn n→∞n→∞n \rightarrow \infty , dann n−−√X¯n−μσ→N(0,1).nX¯n−μσ→N(0,1).\sqrt{n}\frac{\bar{X}_n-\mu}{\sigma} \rightarrow N(0,1). Warum bedeutet dies, dass X¯n∼N(μ,σ2n)?X¯n∼N(μ,σ2n)?\bar{X}_n \sim N\left(\mu, \frac{\sigma^2}{n}\right)?

3
Assoziationstest für einen normalverteilten DV durch richtungsunabhängige Variablen?
Gibt es einen Hypothesentest, ob eine normalverteilte abhängige Variable einer direktional verteilten Variablen zugeordnet ist? Wenn beispielsweise die Tageszeit die erklärende Variable ist (und Dinge wie Wochentag, Monat des Jahres usw. irrelevant sind), kann auf diese Weise die Tatsache berücksichtigt werden, dass 23 Uhr 22 Stunden vor 1 Uhr morgens …


1
Verhindern, dass Pareto Smoothed Important Sampling (PSIS-LOO) fehlschlägt
Ich habe vor kurzem damit begonnen, die pareto-geglättete Stichprobenauswahl (PSIS-LOO) zu verwenden, die in den folgenden Abhandlungen beschrieben wird: Vehtari, A. &amp; Gelman, A. (2015). Pareto glättete wichtige Stichproben. arXiv Preprint ( Link ). A. Vehtari, A. Gelman &amp; J. Gabry (2016). Praktische Bayes'sche Modellbewertung mit einmaliger Kreuzvalidierung und WAIC. …

2
Warum werden Fehler vom Typ II in der statistischen Literatur nicht so stark betont?
Ich habe viele Fälle gesehen, in denen Fehler vom Typ I in verschiedenen Forschungsartikeln berücksichtigt (durch einen Alpha-Wert gekennzeichnet) werden. Ich habe es selten gefunden, dass ein Forscher die Leistung oder den Typ-II-Fehler berücksichtigt. Typ-II-Fehler können eine große Sache sein, oder? Wir haben die alternative Hypothese versehentlich zurückgewiesen, als sie …

3
RBF SVM-Anwendungsfälle (vs. logistische Regression und zufällige Gesamtstruktur)
Support Vector Machines mit Radial-Base-Funktionskernel ist ein universell beaufsichtigter Klassifikator. Obwohl ich die theoretischen Grundlagen für diese SVMs und ihre Stärken kenne, sind mir keine Fälle bekannt, in denen sie die bevorzugte Methode sind. Gibt es also eine Klasse von Problemen, bei denen RBF-SVMs anderen ML-Techniken überlegen sind? (Entweder in …



1
Ist es jemals eine gute Idee, beim Training einer logistischen Regression „Teilkredit“ (kontinuierliches Ergebnis) zu geben?
Ich trainiere eine logistische Regression, um vorherzusagen, welche Läufer am ehesten ein anstrengendes Langstreckenrennen beenden werden. Sehr wenige Läufer absolvieren dieses Rennen, daher habe ich ein schweres Klassenungleichgewicht und eine kleine Auswahl an Erfolgen (vielleicht ein paar Dutzend). Ich habe das Gefühl, ich könnte ein gutes "Signal" von den Dutzenden …


3
Sollte die Dirac-Delta-Funktion als Unterklasse der Gaußschen Verteilung angesehen werden?
In Wikidata ist es möglich, Wahrscheinlichkeitsverteilungen (wie alles andere) in einer Ontologie zu verknüpfen, z. B. dass die t-Verteilung eine Unterklasse der nichtzentralen t-Verteilung ist, siehe z. https://angryloki.github.io/wikidata-graph-builder/?property=P279&amp;item=Q209675&amp;iterations=3&amp;limit=3 Es gibt verschiedene Grenzfälle, z. B. wenn die Freiheitsgrade in der t-Verteilung gegen unendlich gehen oder wenn die Varianz für die Normalverteilung …



3
Was sollte ein nicht informativer Prior für die Steigung sein, wenn eine lineare Regression durchgeführt wird?
Wenn man eine Bayes'sche lineare Regression durchführt, muss man der Steigung einen Prior zuweisen und abfangen . Da ein Standortparameter ist, ist es sinnvoll, einen einheitlichen Prior zuzuweisen. Es scheint mir jedoch, dass einem Skalenparameter ähnelt und es unnatürlich erscheint, vorher eine Uniform zuzuweisen.b b aaaabbbbbbaaa Andererseits scheint es nicht …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.