Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


3
Können unabhängige Variablen mit geringer Korrelation mit abhängigen Variablen signifikante Prädiktoren sein?
Ich habe acht unabhängige Variablen und eine abhängige. Ich habe eine Korrelationsmatrix erstellt, und 5 von ihnen haben eine geringe Korrelation mit dem DV. Ich habe dann eine schrittweise multiple Regression durchgeführt, um zu sehen, ob eine / alle IVs den DV vorhersagen können. Die Regression zeigte, dass nur zwei …

2
Multiple Regression mit kategorialen und numerischen Prädiktoren
Ich bin relativ neu in R und versuche, ein Modell an Daten anzupassen, die aus einer kategorialen Spalte und einer numerischen (ganzzahligen) Spalte bestehen. Die abhängige Variable ist eine fortlaufende Zahl. Die Daten haben das folgende Format: predCateg, predIntNum, ResponseVar Die Daten sehen ungefähr so ​​aus: ranking, age_in_years, wealth_indicator category_A, …

3
Stationarität in multivariaten Zeitreihen
Ich arbeite mit einer multivariaten Zeitreihe und verwende das VAR-Modell (Vector Autoregression) für die Vorhersage. Meine Frage ist, was Stationarität in einem multivariaten Rahmen eigentlich bedeutet. 1) Ich weiß, dass, wenn im VAR-Setup die Determinante der Inversen der | IA | -Matrix Eigenwerte im Modul kleiner als 1 hat, das …

2
Gute PCA-Beispiele für den Unterricht
Ich unterrichte eine Klasse von Ingenieuren, Sozialwissenschaftlern und Computerprogrammierern in linearer Algebra. Wir haben gerade eine Singularwertzerlegung durchgeführt, und wir haben einen zusätzlichen Tag, daher dachte ich, ich würde über die Beziehung zwischen Singularwertzerlegung und Hauptkomponentenanalyse sprechen. Ich habe den theoretischen Teil der Vorlesung gut geschrieben, aber es fällt mir …
10 pca  dataset  teaching 



1
Vergleich negatives Binomialmodell und Quasi-Poisson
Ich habe negative Binomial- und Quasi-Poisson-Modelle ausgeführt, die auf einem Ansatz zum Testen von Hypothesen basieren. Meine endgültigen Modelle, die beide Methoden verwenden, haben unterschiedliche Kovariaten und Wechselwirkungen. Es scheint, dass es in beiden Fällen keine Muster gibt, wenn ich meine Residuen zeichne. Daher habe ich mich gefragt, mit welchem …

2
Grenzwert in einer ROC-Kurve. Gibt es eine einfache Funktion?
Ich möchte den Grenzwert für das Geschlecht anhand einer anthropologischen Messung ermitteln. Ich kann die Kurven zeichnen und weiß, dass für den Fall, dass sowohl Sensitivität als auch Spezifität ähnlich wichtig sind, der Punkt bestimmt werden sollte, der der oberen linken Ecke des Rahmens am nächsten liegt (oder wenn die …
10 roc 

2
Vektorrechnung in der Statistik
In diesem Semester unterrichte ich eine Klasse zur Integration von Funktionen mehrerer Variablen und zur Vektorrechnung. Die Klasse besteht aus den meisten Wirtschafts- und Ingenieur-Majors, mit ein paar Mathematik- und Physik-Leuten. Ich habe diese Klasse letztes Semester unterrichtet und festgestellt, dass sich viele der Wirtschaftswissenschaftler in der zweiten Hälfte ziemlich …

1
einfache Stichprobenmethode für einen Kernel Density Estimator
Ich habe einen einfachen Kernel Density Estimator in Java entwickelt, der auf ein paar Dutzend Punkten (vielleicht bis zu einhundert oder so) und einer Gaußschen Kernelfunktion basiert. Die Implementierung gibt mir zu jedem Zeitpunkt das PDF und CDF meiner Wahrscheinlichkeitsverteilung. Ich möchte jetzt eine einfache Stichprobenmethode für diese KDE implementieren …
10 sampling  pdf  kde 



4
Welches Ergebnis ist zu wählen, wenn Kruskal-Wallis und Mann-Whitney widersprüchliche Ergebnisse zu liefern scheinen?
Ich habe diese Gruppen, in denen die Werte Antworten auf ein 10-Punkte-Likert-Element sind: g1 <- c(10,9,10,9,10,8,9) g2 <- c(4,9,4,9,8,8,8) g3 <- c(9,7,9,4,8,9,10) Daher habe ich Kruskal-Wallis verwendet, um Unterschiede zwischen den Antworten in den Gruppen festzustellen. Das Ergebnis war: Kruskal-Wallis chi-squared = 5.9554, df = 2, p-value = 0.05091 Wenn …

2
Vorteil der Kernel-Dichteschätzung gegenüber der parametrischen Schätzung
Gibt es einen bestimmten Grund, warum Sie die Kernel-Dichteschätzung der parametrischen Schätzung vorziehen? Ich habe gelernt, die Verteilung an meine Daten anzupassen. Diese Frage kam zu mir. Meine Datengröße ist mit 7500 Datenpunkten relativ groß. Auto Ansprüche. Mein Ziel ist es, es an eine Verteilung anzupassen (nichtparametrisch oder parametrisch). Verwenden …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.