Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren





2
Verhältnisse von Wahrscheinlichkeiten zu Quoten
Angenommen, wir wissen, dass die Wahrscheinlichkeit, dass eine Frau in ein Programm und für Männer . Dann wissen wir:p=.7p=.7p=.7q=1−.7=.3q=1- -.7=.3q=1-.7=.3 odds(female)=.7/.3=2.33333Chancen(weiblich)=.7/..3=2.33333\mbox{odds}(\mbox{female}) = .7/.3 = 2.33333 odds(male)=.3/.7=.42857Chancen(männlich)=.3/..7=.42857\mbox{odds}(\mbox{male}) = .3/.7 = .42857 Wir könnten diese Informationen verwenden, um ein Quotenverhältnis zu berechnen: OR=2.3333/.42857=5.44OR=2.3333/.42857=5.44OR = 2.3333/.42857 = 5.44 Somit ist die Wahrscheinlichkeit, dass …

1
Fisher's Tee Verkostung, binomial exakter Test
Bitte sehen Sie hier das berühmte Fisher-Experiment über die Fähigkeit des Biologen B. Muriel Bristol-Roach , den Geschmack von rotem Tee zu erkennen (siehe Lady Tasting Tea ). In diesem Experiment gab Fisher Bristol-Roach 8 Tassen Tee, von denen 4 hergestellt werden, indem zuerst Tee in die Tasse gegeben wird, …





2
Chi-Quadrat, um zu testen, ob zwei Variablen die gleiche Häufigkeitsverteilung haben
Ich möchte testen, ob xund yhabe die gleichen Häufigkeitsverteilungen mit Chi-Quadrat. In meinem Code unten bin ich zu dem Schluss gekommen, dass ich, da der P-Wert des Chi-Quadrats> 0,05 ist, keine Beweise dafür gefunden habe xund yunterschiedliche Häufigkeitsverteilungen habe. Ist meine Schlussfolgerung richtig? set.seed(1) x <- rnorm(100, 3, 2) y …

2
K-bedeutet: Warum minimiert die Minimierung von WCSS die Entfernung zwischen Clustern?
Aus konzeptioneller und algorithmischer Sicht verstehe ich, wie K-means funktioniert. Aus mathematischer Sicht verstehe ich jedoch nicht, warum das Minimieren des WCSS (Quadratsummen innerhalb des Clusters) notwendigerweise den Abstand zwischen Clustern maximiert . Mit anderen Worten, kann jemand zeigen, wie diese Funktion der Maximierung des Abstands zwischen Clustern entspricht? Es …

1
Wie kann man den Unterschied in zwei Proportionen testen, wenn die Ergebnisse nicht binär sind?
Eine E-Commerce-Website testet zwei verschiedene Designs für eine Checkout-Seite. Kunden, die die Checkout-Seite besuchen, erhalten zufällig eines der beiden Designs. Die erste Metrik von Interesse, die Umsatzsteigerung, kann gemessen werden, indem der Anteil der Kunden, die den Verkauf abgeschlossen haben (ein binäres Ergebnis), für jedes der beiden Designs verglichen wird. …

1
Warum werfen diese Daten einen Fehler in R fitdistr?
Ich versuche, eine weibliche Verteilung darauf anzupassen, habe aber Probleme. Nicht sicher warum. Was verursacht die NaNs? temp <- dput(temp) c(477.25, 2615.56, 1279.98, 581.57, 13.55, 80.4, 6640.22, 759.46, 1142.33, 134, 1232.23, 389.81, 7811.65, 992.11, 1152.4, 3139.01, 2636.78, 3294.75, 2266.95, 32.12, 7356.84, 1448.54, 3606.82, 465.39, 950.5, 3721.49, 522.01, 1548.62, 2196.3, 256.8, …
7 r  fitting 

1
Unterschied zwischen "Computerstatistik" und "Statistisches Rechnen"?
Aus dem Handbuch der Computerstatistik von Gentle et al . Wir verwenden den Begriff "statistisches Rechnen" , um die Berechnungsmethoden zu bezeichnen, die statistische Methoden ermöglichen. Das statistische Rechnen umfasst numerische Analysen, Datenbankmethoden, Computergrafiken, Software-Engineering und die Schnittstelle zwischen Computer und Mensch. Wir verwenden den Begriff „Computerstatistik“ etwas weiter gefasst, …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.