Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Warum ist die asymptotische relative Effizienz des Wilcoxon-Tests
Es ist bekannt, dass die asymptotische relative Effizienz (ARE) des Wilcoxon Signed Rank Test verglichen mit dem Student's t- Test, wenn die Daten aus einer normalverteilten Population stammen. Dies gilt sowohl für den einfachen Test mit einer Stichprobe als auch für die Variante für zwei unabhängige Stichproben (Wilcoxon-Mann-Whitney U). Es …


2
Mann-Whitney-U-Test: Konfidenzintervall für die Effektgröße
Nach Fritz, Morris und Richler (2011; siehe unten), unter Verwendung der Formel kann als eine Effektgröße für den Mann-Whitney - U-Tests berechnet werden Dies ist bequem, ich, wie ich auch bei anderen gelegenheiten berichte. Ich möchte das Konfidenzintervall für zusätzlich zum Effektgrößenmaß angeben.rrr rrr=zN−−√r=zN r = \frac{z}{\sqrt N} rrrrrr Hier …

5
Wie gehe ich bei der Benotung von studentischen Arbeiten am besten mit den Auswirkungen von unterschiedlich großzügigen Markern um?
Rund 600 Studierende haben eine Punktzahl für ein umfangreiches Assessment, bei dem von einer guten Zuverlässigkeit / Validität ausgegangen werden kann. Die Bewertung wird mit 100 Punkten bewertet, und es handelt sich um einen vom Computer bewerteten Multiple-Choice-Test. Diese 600 Schüler haben auch Punkte für eine zweite, kleinere Bewertung. In …

1
R: Testnormalität der Residuen des linearen Modells - welche Residuen verwendet werden sollen
Ich möchte einen Shapiro-Wilk-W-Test und einen Kolmogorov-Smirnov-Test mit den Residuen eines linearen Modells durchführen, um die Normalität zu überprüfen. Ich habe mich nur gefragt, welche Residuen dafür verwendet werden sollten - die rohen Residuen, die Pearson-Residuen, studentisierte Residuen oder standardisierte Residuen? Für einen Shapiro-Wilk-W-Test scheinen die Ergebnisse für die rohen …

5
Wie kann ich Zeitreihen auswerten?
Wie kann ich Zeitreihen auswerten? Ist es in Ordnung, nur den ersten Unterschied zu machen und einen Dickey-Fuller-Test durchzuführen, und wenn er stationär ist, sind wir gut? Ich habe auch online festgestellt, dass ich die Zeitreihen in Stata nachverfolgen kann: reg lncredit time predict u_lncredit, residuals twoway line u_lncredit time …

1
Ungültige Schlussfolgerung, wenn Beobachtungen nicht unabhängig sind
In der Elementarstatistik habe ich gelernt, dass mit einem allgemeinen linearen Modell Beobachtungen unabhängig sein müssen, damit Schlussfolgerungen gültig sind. Wenn Clustering auftritt, kann die Unabhängigkeit möglicherweise nicht länger aufrecht erhalten werden, was zu ungültigen Schlussfolgerungen führt, sofern dies nicht berücksichtigt wird. Eine Möglichkeit, eine solche Clusterbildung zu berücksichtigen, besteht …

2
Ist es mit dem Caret-Paket möglich, Verwechslungsmatrizen für bestimmte Schwellenwerte zu erhalten?
Ich habe ein logistisches Regressionsmodell (Via train) für eine binäre Antwort erhalten, und ich habe die logistische Verwirrungsmatrix über confusionMatrixin erhalten caret. Es gibt mir die logistische Modellverwirrungsmatrix, obwohl ich nicht sicher bin, welcher Schwellenwert verwendet wird, um es zu erhalten. Wie erhalte ich die Verwirrungsmatrix für bestimmte Schwellenwerte mit …

2
Beispiel eines inkonsistenten Maximum-Likelihood-Schätzers
Ich lese einen Kommentar zu einem Artikel und der Autor stellt fest, dass manchmal, auch wenn die Schätzer (ermittelt nach ML oder maximaler Quasilikelihood) nicht konsistent sind, die Potenz eines Likelihood-Ratio-Tests oder Quasi-Likelihood-Ratio-Tests immer noch konvergieren kann 1, da die Anzahl der beobachteten Daten gegen unendlich tendiert (Testkonsistenz). Wie und …

1
Warum nicht immer Ensemble-Lernen verwenden?
Es scheint mir, dass das Lernen von Ensembles immer eine bessere Prognoseleistung liefert als mit nur einer einzelnen Lernhypothese. Also, warum benutzen wir sie nicht die ganze Zeit? Meine Vermutung liegt vielleicht an Recheneinschränkungen? (Selbst dann verwenden wir schwache Prädiktoren, also weiß ich es nicht).



4
Inwiefern unterscheidet sich die Quervalidierung vom Daten-Snooping?
Ich habe gerade "Eine Einführung in das statistische Lernen" abgeschlossen . Ich habe mich gefragt, ob sich die Verwendung der Kreuzvalidierung zum Ermitteln der besten Optimierungsparameter für verschiedene Techniken des maschinellen Lernens von Datenschnüffeln unterscheidet. Wir überprüfen wiederholt, welcher Wert des Abstimmungsparameters zu einem besten Vorhersageergebnis im Testsatz führt. Was …



Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.