Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Die Kreuzvalidierungsstatistik (CV) und die generalisierte Kreuzvalidierungsstatistik (GCV)
Ich habe möglicherweise widersprüchliche Definitionen für die Kreuzvalidierungsstatistik (CV) und die generalisierte Kreuzvalidierungsstatistik (GCV) gefunden, die mit einem linearen Modell (mit einem normalen homoskedastischen Fehlervektor ).& egr;Y=Xβ+εY=Xβ+εY = X\boldsymbol\beta + \boldsymbol\varepsilonεε\boldsymbol\varepsilon Einerseits definieren Golub, Heath & Wahba die GCV-Schätzung als (S. 216).λ^λ^\hat{\lambda} der durch gegebene Minimierer von wobei A \ …


7
Was ist los mit Bonferroni Anpassungen?
Ich las das folgende Papier: Perneger (1998) Was ist mit Bonferroni Anpassungen falsch ist . Der Autor fasste zusammen, dass die Bonferroni-Anpassung allenfalls in der biomedizinischen Forschung nur in begrenztem Umfang Anwendung findet und nicht zur Bewertung von Belegen für bestimmte Hypothesen herangezogen werden sollte: Zusammenfassende Punkte: Das Anpassen der …

1
Ist eine Machtanalyse von vornherein im Wesentlichen nutzlos?
Ich nahm letzte Woche an einer Sitzung der Gesellschaft für Persönlichkeits- und Sozialpsychologie teil, bei der ich einen Vortrag von Uri Simonsohn mit der Prämisse sah, dass die Verwendung einer A-priori-Potenzanalyse zur Bestimmung der Stichprobengröße im Wesentlichen nutzlos war, da die Ergebnisse so anfällig für Annahmen sind. Natürlich widerspricht diese …


2
CHAID vs CRT (oder CART)
Ich führe mit SPSS eine Entscheidungsbaumklassifizierung für einen Datensatz mit etwa 20 Prädiktoren durch (kategorial mit wenigen Kategorien). CHAID (Chi-squared Automatic Interaction Detection) und CRT / CART (Classification And Regression Trees) geben mir verschiedene Bäume. Kann jemand die relativen Vorzüge von CHAID vs CRT erklären? Was bedeutet es, eine Methode …
23 spss  cart 


2
Themenstabilität in Themenmodellen
Ich arbeite an einem Projekt, in dem ich Informationen über den Inhalt einer Reihe von Aufsätzen mit offenem Ende extrahieren möchte. In diesem speziellen Projekt schrieben 148 Personen Aufsätze über eine hypothetische Studentenorganisation als Teil eines größeren Experiments. Obwohl in meinem Fachgebiet (Sozialpsychologie) die typische Methode zur Analyse dieser Daten …

3
Student t als Mischung aus Gauß
Unter Verwendung der studentischen t-Verteilung mit k>0k>0k > 0 Freiheitsgraden haben der Ortsparameter lll und der Skalenparameter sss eine Dichte Γ(k+12)Γ(k2kπs2−−−−√){1+k−1(x−ls)}−(k+1)/2,Γ(k+12)Γ(k2kπs2){1+k−1(x−ls)}−(k+1)/2,\frac{\Gamma \left(\frac{k+1}{2}\right)}{\Gamma\left(\frac{k}{2}\sqrt{k \pi s^2}\right)} \left\{ 1 + k^{-1}\left( \frac{x-l}{s}\right)\right\}^{-(k+1)/2}, wie man zeigt, dass die Student- Verteilung als eine Mischung von Gauß-Verteilungen geschrieben werden kann, indem man X ∼ N ( …


2
Wie gehe ich mit dem Unterschied zwischen der Verteilung des Testsatzes und des Trainingssatzes um?
Ich denke, eine Grundannahme des maschinellen Lernens oder der Parameterschätzung ist, dass die unsichtbaren Daten aus derselben Verteilung stammen wie der Trainingssatz. In einigen praktischen Fällen wird sich die Verteilung des Testsatzes jedoch fast von der des Trainingssatzes unterscheiden. Sagen wir für ein umfangreiches Multiklassifizierungsproblem, bei dem versucht wird, Produktbeschreibungen …

2
Bayesianischer Schlagdurchschnitt vor
Ich wollte eine Frage stellen, die von einer hervorragenden Antwort auf die Frage nach der Intuition für die Beta-Distribution inspiriert war . Ich wollte die Ableitung für die vorherige Verteilung für den Schlagdurchschnitt besser verstehen. Es sieht so aus, als würde David die Parameter aus dem Mittelwert und dem Bereich …
23 bayesian  prior 

4
Wie berechnet man die kumulative Verteilung in R?
Verschlossen . Diese Frage und ihre Antworten sind gesperrt, da die Frage nicht zum Thema gehört, aber von historischer Bedeutung ist. Derzeit werden keine neuen Antworten oder Interaktionen akzeptiert. Ich muss die kumulative Verteilungsfunktion einer Datenprobe berechnen. Gibt es in R etwas Ähnliches wie hist (), das die kumulative Dichtefunktion …
23 r  distributions  cdf 

2
Streudiagramm mit Kontur- / Wärmeüberlagerung
Verschlossen . Diese Frage und ihre Antworten sind gesperrt, da die Frage nicht zum Thema gehört, aber von historischer Bedeutung ist. Derzeit werden keine neuen Antworten oder Interaktionen akzeptiert. Ich habe dieses Diagramm in der Beilage eines kürzlich erschienenen Papiers gesehen und würde es gerne mit R reproduzieren. Es ist …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.