Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Wie gehe ich mit einem Fehler wie „Koeffizienten: 14 wegen Singularitäten nicht definiert“ in R um?
Wie kann man diesem Fehler entgegenwirken, wenn Sie bei einem GLM den Fehler "Wegen Singularitäten nicht definiert" in der anova-Ausgabe erhalten? Einige haben vermutet, dass es an der Kollinearität zwischen den Kovariaten liegt oder dass eine der Ebenen im Datensatz nicht vorhanden ist (siehe: Interpretation "wegen Singularitäten nicht definiert" in …

2
Normalisierungskonstante im Bayes-Theorem
Pr(data)Pr(data)\Pr(\textrm{data}) Pr(parameters∣data)=Pr(data∣parameters)Pr(parameters)Pr(data)Pr(parameters∣data)=Pr(data∣parameters)Pr(parameters)Pr(data)\Pr(\text{parameters} \mid \text{data}) = \frac{\Pr(\textrm{data} \mid \textrm{parameters}) \Pr(\text{parameters})}{\Pr(\text{data})} wird als Normalisierungskonstante bezeichnet . Was genau ist das Was ist seine Aufgabe? Warum sieht es aus wie ? Warum hängt es nicht von den Parametern ab?Pr(data)Pr(data)\Pr(data)

4
Angabe der Nullhypothese beim Testen von Hypothesen
Was ist eine gute Faustregel für die Auswahl der Frage für die Nullhypothese? Wenn ich zum Beispiel überprüfen möchte, ob die Hypothese B wahr ist, sollte ich B als Null, B als Alternativhypothese oder NOT B als Null verwenden? Ich hoffe die Frage ist klar. Ich weiß, dass es etwas …

4
Effizientes Aktualisieren der linearen Regression beim Hinzufügen von Beobachtungen und / oder Prädiktoren in R
Ich würde gerne Wege in R finden, um ein lineares Modell effizient zu aktualisieren, wenn eine Beobachtung oder ein Prädiktor hinzugefügt wird. biglm kann beim Hinzufügen von Beobachtungen aktualisiert werden, aber meine Daten sind klein genug, um sich im Speicher zu befinden (obwohl ich eine große Anzahl von zu aktualisierenden …

5
Gibt es mehr als Bayesianismus?
Als Student der Physik habe ich die Vorlesung "Warum ich ein Bayesianer bin" vielleicht ein halbes Dutzend Mal erlebt. Es ist immer dasselbe - der Moderator erklärt selbstgefällig, dass die Bayes'sche Interpretation der von den Massen angeblich verwendeten frequentistischen Interpretation überlegen ist. Sie erwähnen Bayes-Herrschaft, Marginalisierung, Priors und Posteriors. Was …

4
Optimale Elfmeterauswahl für Lasso
Gibt es analytische Ergebnisse oder experimentelle Arbeiten zur optimalen Wahl des Koeffizienten für den Strafzeitpunkt ? ℓ1ℓ1\ell_1Mit optimal meine ich einen Parameter, der die Wahrscheinlichkeit der Auswahl des besten Modells maximiert oder den erwarteten Verlust minimiert. Ich frage, weil es oft unpraktisch ist, den Parameter durch Kreuzvalidierung oder Bootstrap zu …

2
Logistische Regression mit niedriger Ereignisrate anwenden
Ich habe einen Datensatz, in dem die Ereignisrate sehr niedrig ist (40.000 von 12⋅10512⋅10512\cdot10^5 ). Ich wende hier eine logistische Regression an. Ich hatte eine Diskussion mit jemandem, bei der sich herausstellte, dass eine logistische Regression keine gute Verwirrungsmatrix für solche Daten mit niedriger Ereignisrate ergibt. Aufgrund des Geschäftsproblems und …
15 logistic 

2
So berechnen Sie die Varianz einer Variablenpartition
Ich führe ein Experiment durch, bei dem ich (unabhängige) Samples parallel sammle, ich berechne die Varianz jeder Gruppe von Samples und jetzt möchte ich dann alle kombinieren, um die Gesamtvarianz aller Samples zu finden. Es fällt mir schwer, eine Ableitung dafür zu finden, da ich mir der Terminologie nicht sicher …
15 variance 

3
Wie zeichnet man die Datenausgabe des Clusters?
Ich habe versucht, eine Reihe von Daten (eine Reihe von Markierungen) zu gruppieren und habe 2 Cluster erhalten. Ich möchte es grafisch darstellen. Etwas verwirrt über die Darstellung, da ich die (x, y) Koordinaten nicht habe. Suchen Sie auch nach der MATLAB / Python-Funktion, um dies zu tun. BEARBEITEN Ich …


2
Verständnis des k-Lag im erweiterten Dickey-Fuller-Test von R.
Ich habe mit einigen Unit-Root-Tests in R herumgespielt und bin mir nicht ganz sicher, was ich mit dem Parameter k lag anfangen soll. Ich habe den erweiterten Dickey-Fuller-Test und den Philipps-Perron-Test aus dem tseries- Paket verwendet. Offensichtlich hängt der voreingestellte Parameter (für ) nur von der Länge der Reihe ab. …
15 r  time-series  trend 

2
Was sind einige Techniken zum Abtasten von zwei korrelierten Zufallsvariablen?
Was sind einige Techniken zum Abtasten von zwei korrelierten Zufallsvariablen: wenn ihre Wahrscheinlichkeitsverteilungen parametrisiert sind (zB log-normal) wenn sie nicht parametrische Verteilungen haben. Die Daten sind zwei Zeitreihen, für die wir Korrelationskoeffizienten ungleich Null berechnen können. Wir möchten diese Daten in Zukunft simulieren, vorausgesetzt, die historische Korrelation und die Zeitreihen-CDF …


1
Was ist die genaue Definition eines „Heywood-Falls“?
Ich habe den Begriff "Heywood-Fall" informell verwendet, um Situationen zu bezeichnen, in denen eine online durchgeführte, "endliche Antwort" iterativ aktualisierte Schätzung der Varianz aufgrund von numerischen Genauigkeitsproblemen negativ wurde. (Ich verwende eine Variante der Welford-Methode, um Daten hinzuzufügen und ältere Daten zu entfernen.) Ich hatte den Eindruck, dass sie auf …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.