Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Wie gehe ich mit hoher Korrelation zwischen Prädiktoren bei multipler Regression um?
Ich habe einen Verweis in einem Artikel gefunden, der wie folgt lautet: Nach Tabachnick & Fidell (1996) sollten die unabhängigen Variablen mit einer bivariaten Korrelation von mehr als 0,70 nicht in die multiple Regressionsanalyse einbezogen werden. Problem: Ich habe in einem Design mit mehreren Regressionen 3 Variablen verwendet, die> .80 …

3
Zeiträume der Statistikgeschichte
Die Geschichte vieler Wissenschaftsbereiche kann in eine kleine Anzahl von Zeitintervallen unterteilt werden, die oft mit einer wichtigen Entdeckung beginnen. Aber ich habe noch nie etwas Ähnliches in der Statistik gesehen. Offensichtlich gibt es einige wichtige Daten, die als Ausgangspunkt einer neuen Periode angesehen werden können (Pascal + Fermat, Bayes, …
18 history 



1
Sind abgeschnittene Zahlen aus einem Zufallsgenerator immer noch zufällig?
Hier bedeutet "Abschneiden" , die Genauigkeit der Zufallszahlen zu verringern und die Folge von Zufallszahlen nicht abzuschneiden. Wenn ich zum Beispiel echte Zufallszahlen (aus einer beliebigen Verteilung, z. B. normal, einheitlich usw.) mit willkürlicher Genauigkeit habe und alle Zahlen so abschneide, dass ich schließlich eine Menge von Zahlen erhalte, von …

1
, Simulation über Prognosezeitraum
Ich habe Zeitreihendaten und ich habe ein als Modell verwendet, um die Daten . Das ist eine Indikator-Zufallsvariable, die entweder 0 (wenn ich kein seltenes Ereignis sehe) oder 1 (wenn ich das seltene Ereignis sehe) ist. Basierend auf früheren Beobachtungen, die ich für , kann ich ein Modell für Verwendung …

6
Out-of-Core-Datenanalyseoptionen
Ich benutze SAS seit fast 5 Jahren professionell. Ich habe es auf meinem Laptop installiert und muss häufig Datensätze mit 1.000 bis 2.000 Variablen und Hunderttausenden von Beobachtungen analysieren. Ich habe nach Alternativen zu SAS gesucht, mit denen ich Analysen mit ähnlich großen Datensätzen durchführen kann. Ich bin neugierig, was …
18 r  sas  large-data 

2
Was ist der "
Was ist der Wert, der in der Zusammenfassung eines Coxph-Modells in R angegeben ist? Beispielsweise,R2R2R^2 Rsquare= 0.186 (max possible= 0.991 ) Ich habe dummerweise ein Manuskript als Wert hinzugefügt, und der Prüfer hat darauf hingewiesen, dass ihm kein Analogon der Statistik aus der für das Cox-Modell entwickelten klassischen linearen Regression …

5
Welche zusammenfassenden Statistiken sind für kategoriale oder qualitative Variablen zu verwenden?
Um dies zu verdeutlichen, beziehe ich mich auf die Bereiche Mittelwert, Medianquartil, Varianz und Standardabweichung. Ist es bei der Zusammenfassung einer kategorialen oder qualitativen Univariate unter Berücksichtigung von Nominal- und Ordinalfällen sinnvoll, den Mittelwert, den Median, die Quartilbereiche, die Varianz und die Standardabweichung zu ermitteln? Wenn ja, ist es anders, …

3
Welche Rolle spielt MDS in der modernen Statistik?
Ich bin kürzlich auf mehrdimensionale Skalierung gestoßen. Ich versuche, dieses Tool und seine Rolle in der modernen Statistik besser zu verstehen. Hier sind ein paar Leitfragen: Welche Fragen beantwortet es? Welche Forscher sind oft daran interessiert, es zu nutzen? Gibt es andere statistische Techniken, die ähnliche Funktionen ausführen? Welche Theorie …


1
Post-hoc-Tests nach Kruskal-Wallis: Dunn-Test oder Bonferroni-korrigierte Mann-Whitney-Tests?
Ich habe eine nicht-Gaußsche verteilte Variable und muss prüfen, ob es signifikante Unterschiede zwischen den Werten dieser Variablen in 5 verschiedenen Gruppen gibt. Ich habe eine einseitige Kruskal-Wallis-Varianzanalyse durchgeführt (die sich als signifikant erwies) und danach musste ich prüfen, welche Gruppen signifikant unterschiedlich waren. Da die Gruppen irgendwie sortiert sind …

1
Stichprobenmodell für Crowdsourcing-Daten?
Ich arbeite an einem offenen Antrag für eine Gesundheitsumfrage, der in Entwicklungsländern verwendet werden soll. Die Grundidee ist, dass Umfrageinterviews vom Crowdsourcing-Team durchgeführt werden - sie werden von nicht organisierten Freiwilligen durchgeführt, die Formulardaten der Interviews übermitteln, die sie mit ihren Mobilgeräten durchgeführt haben, und jede Umfrage wird von den …
18 sampling 

4
Warum haben Autos Anzeigen, wenn die Diagramme schlecht sind?
Datenvisualisierungsexperten lehnen Messdiagramme im Allgemeinen ab (siehe hier: Wie nennt man ein Diagramm, das wie ein halbes Kreisdiagramm mit einer Nadel aussieht, die einen Prozentsatz angibt? ). Der Hauptgrund ist, dass ein Messdiagramm ein niedriges Daten-zu-Tinte-Verhältnis aufweist. Seit ich mit diesen Konzepten (ein paar Tufte-Büchern) in Berührung gekommen bin, stimmte …

2
Warum fällt die Verarbeitung natürlicher Sprachen nicht in den Bereich des maschinellen Lernens? [geschlossen]
Aus heutiger Sicht passt diese Frage nicht zu unserem Q & A-Format. Wir erwarten, dass die Antworten durch Fakten, Referenzen oder Fachwissen gestützt werden, aber diese Frage wird wahrscheinlich Debatten, Argumente, Abstimmungen oder erweiterte Diskussionen hervorrufen. Wenn Sie der Meinung sind, dass diese Frage verbessert und möglicherweise erneut geöffnet werden …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.