Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

7
Ist der Median fairer als der Mittelwert?
Ich habe kürzlich den Rat gelesen, dass Sie im Allgemeinen den Median verwenden sollten, um Ausreißer zu eliminieren. Beispiel: Der folgende Artikel http://www.amazon.com/Forensic-Science-Introduction-Scientific-Investigative/product-reviews/1420064932/ hat im Moment 16 Bewertungen: review= c(5, 5, 5, 5, 5, 5, 5, 5, 5, 5, 4, 4, 3, 2, 1, 1) summary(review) ## "ordinary" summary Min. …
17 mean  median  average 

3
Logistische Regression und Datensatzstruktur
Ich hoffe, dass ich diese Frage richtig stellen kann. Ich habe Zugriff auf Play-by-Play-Daten, daher ist es eher ein Problem mit der besten Vorgehensweise und der korrekten Erstellung der Daten. Was ich tun möchte, ist zu berechnen, wie wahrscheinlich es ist, ein NHL-Spiel zu gewinnen, wenn das Ergebnis und die …

8
Qualitätsmaßstab für Clustering
Ich habe einen Clustering-Algorithmus (nicht k-means) mit dem Eingabeparameter (Anzahl der Cluster). Nach dem Clustering möchte ich ein quantitatives Qualitätsmaß für dieses Clustering erhalten. Der Clustering-Algorithmus hat eine wichtige Eigenschaft. Für erhalte ich, wenn ich Datenpunkte ohne signifikante Unterscheidung zwischen diesen in diesen Algorithmus einspeise, einen Cluster mit Datenpunkten und …
17 clustering 

2
Warum Platt's Skalierung verwenden?
Um ein Konfidenzniveau auf eine Wahrscheinlichkeit beim überwachten Lernen zu kalibrieren (z. B. um das Vertrauen aus einer SVM oder einem Entscheidungsbaum unter Verwendung von überabgetasteten Daten abzubilden), besteht eine Methode in der Verwendung der Plattschen Skalierung (z. B. Erhalten kalibrierter Wahrscheinlichkeiten aus dem Boosten) ). Grundsätzlich verwendet man die …

6
R: Korrelation nach Gruppe berechnen
Verschlossen . Diese Frage und ihre Antworten sind gesperrt, da die Frage nicht zum Thema gehört, aber von historischer Bedeutung ist. Derzeit werden keine neuen Antworten oder Interaktionen akzeptiert. In R habe ich einen Datenrahmen, der eine Klassenbezeichnung C (einen Faktor) und zwei Messungen M1 und M2 umfasst . Wie …
17 r  correlation 


3
Hauptkomponentenanalyse „rückwärts“: Wie viel Varianz der Daten erklärt sich durch eine gegebene Linearkombination der Variablen?
Ich habe eine Hauptkomponentenanalyse von sechs Variablen , , , , und . Wenn ich das richtig verstehe, sagt mir der nicht gedrehte PC1, welche lineare Kombination dieser Variablen die größte Abweichung in den Daten beschreibt / erklärt, und der PC2 sagt mir, welche lineare Kombination dieser Variablen die nächstgrößere …

1
Unsymmetrische ANOVA mit gemischten Effekten für wiederholte Messungen
Ich habe Daten von Patienten, die während der Operation mit 2 verschiedenen Arten von Behandlungen behandelt wurden. Ich muss die Auswirkung auf die Herzfrequenz analysieren. Die Herzfrequenzmessung erfolgt alle 15 Minuten. Da die Operationsdauer für jeden Patienten unterschiedlich sein kann, kann jeder Patient zwischen 7 und 10 Herzfrequenzmessungen durchführen. Daher …

2
Wenn variable Kernelbreiten oft gut für die Kernelregression sind, warum sind sie im Allgemeinen nicht gut für die Schätzung der Kerneldichte?
Diese Frage wird an anderer Stelle diskutiert . Variable Kernel werden häufig in der lokalen Regression verwendet. Zum Beispiel ist Löss weit verbreitet und eignet sich gut als Regressionsglätter. Es basiert auf einem Kernel mit variabler Breite, der sich an die Datensparsität anpasst. Andererseits wird angenommen, dass variable Kernel zu …


4
Kombination von zwei Konfidenzintervallen / Punktschätzungen
Angenommen, man hat zwei unabhängige Stichproben aus derselben Population, und für die beiden Stichproben wurden unterschiedliche Methoden verwendet, um die Punktschätzung und die Konfidenzintervalle abzuleiten. In trivialen Fällen bündelte eine vernünftige Person nur die beiden Proben und verwendete eine Methode, um die Analyse durchzuführen. Nehmen wir jedoch vorerst an, dass …

9
Was ist der Unterschied zwischen Statistik und Biostatistik?
Mir ist aufgefallen, dass ich im Laufe der Jahre einige Ideen zu den Unterschieden zwischen Statistik und Biostatistik zusammengetragen habe, aber nie eine formelle Erklärung gehört habe. Was ist der Unterschied zwischen diesen beiden Disziplinen (derzeit)? Und warum begann diese Unterscheidung überhaupt? EDIT: Ich war in meiner ursprünglichen Frage nicht …


3
Faktoranalyse von Fragebögen aus Likert-Items
Ich habe Gegenstände aus psychometrischer Sicht analysiert. Aber jetzt versuche ich, andere Arten von Fragen zu Motivation und anderen Themen zu analysieren. Diese Fragen beziehen sich alle auf Likert-Skalen. Mein erster Gedanke war, die Faktorenanalyse zu verwenden, da angenommen wird, dass die Fragen einige zugrunde liegende Dimensionen widerspiegeln. Aber ist …

4
Robuster T-Test für den Mittelwert
Ich versuche, die Null gegen die lokale Alternative E [ X ] > 0 für eine Zufallsvariable X zu testen, die einem leichten bis mittleren Versatz und einer Kurtosis der Zufallsvariablen unterliegt. Gemäß den Vorschlägen von Wilcox in "Einführung in die robuste Schätzung und das Testen von Hypothesen" habe ich …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.