Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

4
Normalisierung vor der Kreuzvalidierung
Hat das Normalisieren von Daten (um einen Mittelwert von Null und eine Standardabweichung von Eins zu haben) vor dem Durchführen einer wiederholten Kreuzvalidierung eine negative Konsequenz, wie beispielsweise eine Überanpassung? Hinweis: Dies gilt für eine Situation, in der #cases> total #features ist Ich transformiere einige meiner Daten mithilfe einer Protokolltransformation …

2
Test auf IID-Probenahme
Wie würden Sie testen oder überprüfen, ob die Probenahme IID (Independent and Identically Distributed) ist? Beachten Sie, dass ich nicht Gaußsch und identisch verteilt meine, sondern nur IID. Und mir fällt die Idee ein, die Stichprobe wiederholt in zwei gleich große Teilstichproben aufzuteilen, den Kolmogorov-Smirnov-Test durchzuführen und zu überprüfen, ob …

3
Wie würden Sie verallgemeinerten linearen Modellen Menschen ohne statistischen Hintergrund erklären?
Es fällt mir immer schwer, dem Publikum statistische Techniken ohne statistischen Hintergrund zu erklären. Wenn ich erklären wollte, was GLM für ein solches Publikum ist (ohne statistische Fachsprache auszusprechen), welcher Weg wäre der beste oder effektivste? Ich erkläre GLM normalerweise mit drei Teilen - (1) der Zufallskomponente, die eine Antwortvariable …


2
Poisson oder Quasi-Poisson in einer Regression mit Zähldaten und Überdispersion?
Ich habe Zähldaten (Nachfrage- / Angebotsanalyse mit Zählung der Anzahl der Kunden, abhängig von - möglicherweise - vielen Faktoren). Ich habe eine lineare Regression mit normalen Fehlern versucht, aber mein QQ-Plot ist nicht wirklich gut. Ich habe versucht, die Antwort logarithmisch umzuwandeln: wieder ein schlechtes QQ-Diagramm. Jetzt versuche ich eine …


5
Wie finde ich lokale Gipfel / Täler in einer Reihe von Daten?
Hier ist mein Experiment: Ich benutze die findPeaksFunktion im quantmod- Paket: Ich möchte "lokale" Peaks innerhalb einer Toleranz 5 erkennen, dh die ersten Stellen nach der Zeitreihe fallen um 5 von den lokalen Peaks ab: aa=100:1 bb=sin(aa/3) cc=aa*bb plot(cc, type="l") p=findPeaks(cc, 5) points(p, cc[p]) p Die Ausgabe ist [1] 3 …
16 r  time-series 


6
Rechengeschwindigkeit in R?
Ich wurde beauftragt, eines unserer aktuellen großen stochastischen Modelle aus SAS in eine neue Sprache zu überführen. Persönlich bevorzuge ich eine traditionell kompilierte Sprache, aber der PI möchte, dass ich R auschecke, das ich nie benutzt habe. Unsere Motivation, das Modell aus SAS herauszuholen, ist, dass (1) viele Menschen keinen …
16 r  computing 


4
Interpretation von exp (B) in der multinomialen logistischen Regression
Dies ist eine Anfängerfrage, aber wie interpretiert man ein exp (B) -Ergebnis von 6.012 in einem multinomialen logistischen Regressionsmodell? 1) Ist das Risiko um 6.012-1.0 = 5.012 = 5012% gestiegen? oder 2) 6,012 / (1 + 6,012) = 0,857 = 85,7% Risikoerhöhung? Falls beide Alternativen falsch sind, kann jemand bitte …




3
Robuste Ausreißererkennung in finanziellen Zeitreihen
Ich suche nach robusten Techniken, um Ausreißer und Fehler (aus welchen Gründen auch immer) aus finanziellen Zeitreihendaten (z. B. Tickdata) zu entfernen. Tick-by-Tick-Finanzzeitreihendaten sind sehr unübersichtlich. Es enthält große (Zeit-) Lücken, wenn die Börse geschlossen wird, und macht große Sprünge, wenn die Börse wieder geöffnet wird. Wenn die Börse geöffnet …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.