Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren



3
Wie kann ich die Standardabweichung der Standardabweichung der Stichprobe von einer Normalverteilung ermitteln?
Vergib mir, wenn ich etwas ziemlich Offensichtliches verpasst habe. Ich bin Physiker mit einer (Histogramm-) Verteilung, die sich um einen Mittelwert dreht, der sich einer Normalverteilung annähert. Der für mich wichtige Wert ist die Standardabweichung dieser Gaußschen Zufallsvariablen. Wie würde ich versuchen, den Fehler in der Standardabweichung der Stichprobe zu …

2
Verwenden von Adaboost mit SVM zur Klassifizierung
Ich weiß, dass Adaboost versucht, einen starken Klassifikator unter Verwendung einer linearen Kombination einer Reihe schwacher Klassifikatoren zu erzeugen. Ich habe jedoch einige Artikel gelesen, in denen darauf hingewiesen wird, dass Adaboost und SVMs unter bestimmten Bedingungen und in bestimmten Fällen harmonisch funktionieren (obwohl SVM ein starker Klassifikator ist) . …


2
Gibt es so etwas wie einen fairen Würfel?
Gibt es so etwas wie einen fairen Würfel? Bei Würfeln, bei denen die Zahl durch einen herausgeschöpften Punkt dargestellt wird, macht das sicherlich einen Unterschied? Hat jemand recherchiert? Wenn man darüber nachdenkt, warum sollte ein Münzwurf fair sein? Die Physik auf jeder Seite ist völlig anders.
11 dice 


1
ABC-Modellauswahl
Es hat sich gezeigt, dass die Auswahl des ABC-Modells unter Verwendung von Bayes-Faktoren nicht zu empfehlen ist, da ein Fehler bei der Verwendung von Zusammenfassungsstatistiken vorliegt. Die Schlussfolgerung in diesem Artikel basiert auf der Untersuchung des Verhaltens einer beliebten Methode zur Approximation des Bayes-Faktors (Algorithmus 2). Es ist bekannt, dass …

2
Signifikante Prädiktoren werden bei der multiplen logistischen Regression nicht signifikant
Wenn ich meine Variablen in zwei separaten (univariaten) logistischen Regressionsmodellen analysiere, erhalte ich Folgendes: Predictor 1: B= 1.049, SE=.352, Exp(B)=2.85, 95% CI=(1.43, 5.69), p=.003 Constant: B=-0.434, SE=.217, Exp(B)=0.65, p=.046 Predictor 2: B= 1.379, SE=.386, Exp(B)=3.97, 95% CI=(1.86, 8.47), p<.001 Constant: B=-0.447, SE=.205, Exp(B)=0.64, p=.029 Wenn ich sie jedoch in ein …

3
Variablennamen in einem Dataset verbessern
Gute Variablennamen sind: a) kurz / leicht zu tippen, b) leicht zu merken, c) verständlich / kommunikativ. Vergesse ich etwas? Konsistenz ist etwas zu suchen. Ich würde sagen, dass konsistente Namenskonventionen zu den oben genannten Eigenschaften beitragen. Konsistenz trägt zu (b) leichtem Rückruf und (c) Verständlichkeit bei, obwohl andere Faktoren …

2
Vorhersage- und Toleranzintervalle
Ich habe ein paar Fragen zu Vorhersage- und Toleranzintervallen. Lassen Sie uns zunächst die Definition der Toleranzintervalle vereinbaren: Wir erhalten ein Konfidenzniveau von beispielsweise 90%, den Prozentsatz der zu erfassenden Bevölkerung von beispielsweise 99% und eine Stichprobengröße von beispielsweise 20. Die Wahrscheinlichkeitsverteilung ist bekannt, beispielsweise normal zur Bequemlichkeit. Angesichts der …





Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.