Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

5
Was ist eine gute Möglichkeit, eine sehr große Anzahl gepaarter Datenpunkte grafisch darzustellen?
In meinem Bereich besteht die übliche Methode zum Zeichnen gepaarter Daten aus einer Reihe von dünn abfallenden Liniensegmenten, die mit dem Median und dem CI des Medians für die beiden Gruppen überlagert werden: Diese Art von Plot wird jedoch viel schwieriger zu lesen, da die Anzahl der Datenpunkte sehr groß …

4
Ändert sich die Wahrscheinlichkeitsverteilung einer Urne, wenn Sie im Durchschnitt ersatzlos daraus ziehen?
Angenommen, ich habe eine Urne mit N verschiedenen Farben von Kugeln und jede andere Farbe kann unterschiedlich oft erscheinen (wenn 10 rote Kugeln vorhanden sind, müssen nicht auch 10 blaue Kugeln vorhanden sein). Wenn wir den genauen Inhalt der Urne vor dem Zeichnen kennen, können wir eine diskrete Wahrscheinlichkeitsverteilung bilden, …

1
Zähmung des Versatzes… Warum gibt es so viele Versatzfunktionen?
Ich hoffe, mehr Einblick in die vier Arten von Versatz aus dieser Community zu bekommen. Die Typen, auf die ich mich beziehe, werden auf der Hilfeseite http://www.inside-r.org/packages/cran/e1071/docs/skewness erwähnt . Die alte Methode wurde auf der Hilfeseite nicht erwähnt, aber ich füge sie trotzdem hinzu. require(moments) require(e1071) x=rnorm(100) n=length(x) hist(x) ###############type=1 …
9 skewness 




1
Kreuzvalidierende Lasso-Regression in R.
Die R-Funktion cv.glm (Bibliothek: Boot) berechnet den geschätzten K-fachen Kreuzvalidierungs-Vorhersagefehler für verallgemeinerte lineare Modelle und gibt Delta zurück. Ist es sinnvoll, diese Funktion für eine Lasso-Regression (Bibliothek: glmnet) zu verwenden, und wenn ja, wie kann sie ausgeführt werden? Die glmnet-Bibliothek verwendet eine Kreuzvalidierung, um den besten Drehparameter zu erhalten, aber …

7
Können wir nicht sagen, dass wir die Nullhypothese akzeptieren, wenn nicht alle 1000 Testpatienten durch das Medikament geheilt werden?
An vielen Stellen habe ich gelesen, dass wir niemals sagen können, dass wir die Nullhypothese "akzeptieren". Stattdessen müssen wir sagen, dass wir die Nullhypothese "nicht ablehnen". Aber ich sehe nicht, wie das mit diesem einfachen Beispiel übereinstimmt: Angenommen, wir testen ein Medikament, das Diabetes innerhalb von 24 Stunden vollständig heilen …




1
Warum sind die Bewertungen der Hauptkomponenten nicht korreliert?
Angenommen, ist eine Matrix von mittelzentrierten Daten. Die Matrix ist , hat verschiedene Eigenwerte und Eigenvektoren , ... , die orthogonal sind.AA\mathbf AS=cov(A)S=cov(A)\mathbf S=\text{cov}(\mathbf A)m×mm×mm\times mmmms1s1\mathbf s_1s2s2\mathbf s_2smsm\mathbf s_m Die te Hauptkomponente (manche Leute nennen sie "Scores") ist der Vektor . Mit anderen Worten, es ist eine lineare Kombination der …

2
Alternative Gewichtungsschemata für die Metaanalyse von Zufallseffekten: fehlende Standardabweichungen
Ich arbeite an einer Metaanalyse mit zufälligen Effekten, die eine Reihe von Studien abdeckt, in denen keine Standardabweichungen angegeben sind. Alle Studien geben die Stichprobengröße an. Ich glaube nicht, dass es möglich ist, die fehlenden SD-Daten zu approximieren oder zu unterstellen. Wie sollte eine Metaanalyse gewichtet werden, bei der rohe …

2
Warum muss ich bei der Verwendung von SVMs die Funktionen skalieren?
Gemäß der Dokumentation des StandardScaler- Objekts in scikit-learn: Beispielsweise gehen viele Elemente, die in der Zielfunktion eines Lernalgorithmus verwendet werden (wie der RBF-Kernel von Support Vector Machines oder die L1- und L2-Regularisierer linearer Modelle), davon aus, dass alle Merkmale um 0 zentriert sind und eine Varianz in derselben Reihenfolge aufweisen. …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.