Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Was bedeutet es, wenn die Spearman-Korrelation um einen bestimmten Betrag unter Pearson liegt?
Ich habe eine Reihe verwandter Datensätze. Die Pearson-Korrelationen zwischen Paaren von ihnen sind typischerweise definitiv größer als die Spearman-Korrelationen. Das deutet darauf hin, dass jede Korrelation linear ist, aber man könnte erwarten, dass selbst wenn Pearson und Spearman gleich wären. Was bedeutet es, wenn zwischen der Pearson- und der Spearman-Korrelation …

4
Bootstrap, Monte Carlo
Im Rahmen der Hausaufgaben wurde mir folgende Frage gestellt: Entwerfen und implementieren Sie eine Simulationsstudie, um die Leistung des Bootstraps zu untersuchen und 95% -Konfidenzintervalle für den Mittelwert einer univariaten Datenstichprobe zu erhalten. Ihre Implementierung kann in R oder SAS erfolgen. Aspekte der Leistung, die Sie möglicherweise betrachten möchten, sind …



2
Zeigen zufällige Wälder eine Vorhersageverzerrung?
Ich denke, dies ist eine einfache Frage, obwohl die Gründe dafür, warum oder warum nicht, möglicherweise nicht zutreffen. Der Grund, den ich frage, ist, dass ich kürzlich meine eigene Implementierung eines RF geschrieben habe und obwohl es gut funktioniert, funktioniert es nicht ganz so gut, wie ich es erwartet hatte …


5
Welche Programmiersprache empfehlen Sie, um ein Problem des maschinellen Lernens zu prototypisieren?
Arbeitet derzeit in Octave, ist aber aufgrund der schlechten Dokumentation nur sehr langsam vorangekommen. Welche Sprache ist leicht zu lernen und zu verwenden und gut dokumentiert, um Probleme des maschinellen Lernens zu lösen? Ich möchte einen Prototyp für einen kleinen Datensatz (Tausende von Beispielen) erstellen, daher ist Geschwindigkeit nicht wichtig. …

1
Was ist ein guter Index für den Grad der Verletzung der Normalität und welche beschreibenden Bezeichnungen könnten diesem Index zugeordnet werden?
Kontext: In einer früheren Frage fragte @Robbie in einer Studie mit etwa 600 Fällen, warum Normalitätstests auf eine signifikante Nichtnormalität hinwiesen, die Diagramme jedoch auf Normalverteilungen hinwiesen . Mehrere Personen wiesen darauf hin, dass Signifikanztests der Normalität nicht sehr nützlich sind. Bei kleinen Stichproben haben solche Tests nicht viel Leistung, …

5
Warum sollten alle Normalitätstests die Nullhypothese ablehnen?
Der Kolgomorov-Smirnov-Test, der Shapiro-Test usw. lehnen alle die Hypothese ab, dass eine Verteilung normal ist. Wenn ich jedoch die normalen Quantile und das Histogramm zeichne, sind die Daten eindeutig normal. Vielleicht, weil die Leistung der Tests hoch ist? Die Stichprobengröße liegt bei 650. Sollte also nicht mindestens einer dieser Tests …


1
Kann ich einen gepaarten T-Test verwenden, wenn die Proben normal verteilt sind, der Unterschied jedoch nicht?
Ich habe Daten aus einem Experiment, bei dem ich zwei verschiedene Behandlungen unter identischen Anfangsbedingungen angewendet habe und als Ergebnis eine ganze Zahl zwischen 0 und 500 erzeugt habe. Ich möchte einen gepaarten T-Test verwenden, um festzustellen, ob die durch die beiden Behandlungen hervorgerufenen Wirkungen signifikant unterschiedlich sind. Die Ergebnisse …


1
Robuste Cluster-Methode für gemischte Daten in R.
Ich möchte einen kleinen Datensatz gruppieren (64 Beobachtungen von 4 Intervallvariablen und einer einzelnen kategorialen Drei-Faktor-Variablen). Jetzt bin ich ziemlich neu in der Clusteranalyse, aber ich bin mir bewusst, dass seit den Tagen, als hierarchisches Clustering oder k-means die einzigen verfügbaren Optionen waren, erhebliche Fortschritte erzielt wurden. Insbesondere scheinen neue …

3
Schätzen von Parametern für einen räumlichen Prozess
Ich habe ein n×nn×nn\times n Raster mit positiven ganzzahligen Werten erhalten. Diese Zahlen stellen eine Intensität dar, die der Glaubensstärke einer Person entsprechen sollte, die diesen Gitterplatz einnimmt (ein höherer Wert zeigt einen höheren Glauben an). Eine Person hat im Allgemeinen Einfluss auf mehrere Gitterzellen. Ich glaube, dass das Intensitätsmuster …

5
Wie erstelle ich eine gute Farbintensitätsskala?
Ich bin in der Statistik keineswegs gut, aber ich glaube, ich bin an der richtigen Stelle. Meine Frage ist einfach: Mein Problem besteht darin, die Bevölkerung mehrerer Staaten in einem kleinen Land zu vergleichen, aber einige Staaten haben eine Bevölkerung von 3000.000 und einige eine Bevölkerung von 2.000. Ich male …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.