Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Bayesianische Analyse von Kontingenztabellen: Beschreibung der Effektgröße
Ich arbeite die Beispiele in Kruschkes Doing Bayesian Data Analysis durch , insbesondere die exponentielle Poisson-ANOVA in Kap. 22, die er als Alternative zu häufig auftretenden Chi-Quadrat-Unabhängigkeitstests für Kontingenztabellen vorstellt. Ich kann sehen, wie wir Informationen über Interaktionen erhalten, die mehr oder weniger häufig auftreten als erwartet, wenn die Variablen …



1
Beispiel für CLT, wenn keine Momente vorhanden sind
Betrachten Sie Xn=⎧⎩⎨1−12kw.p. (1−2−n)/2w.p. (1−2−n)/2w.p. 2−k for k>nXn={1w.p. (1−2−n)/2−1w.p. (1−2−n)/22kw.p. 2−k for k>nX_n = \begin{cases} 1 & \text{w.p. } (1 - 2^{-n})/2\\ -1 & \text{w.p. } (1 - 2^{-n})/2\\ 2^k & \text{w.p. } 2^{-k} \text{ for } k > n\\ \end{cases} Ich muss zeigen, dass, obwohl dies unendlich viele Momente …

1
Cooks Distanzgrenzwert
Ich habe die Entfernung des Kochs gelesen, um Ausreißer zu identifizieren, die einen großen Einfluss auf meine Regression haben. In Cooks ursprünglicher Studie sagt er, dass eine Cut-off-Rate von 1 vergleichbar sein sollte, um Influencer zu identifizieren. In verschiedenen anderen Studien wird jedoch oder als Grenzwert verwendet.4n4n\frac{4}{n}4n - k - …

2
Optimism Bias - Schätzungen des Vorhersagefehlers
Das Buch Elemente des statistischen Lernens (online als PDF verfügbar) behandelt die optimistische Tendenz (7.21, Seite 229). Es heißt, dass der Optimismus-Bias die Differenz zwischen dem Trainingsfehler und dem In-Sample-Fehler ist (Fehler, der beobachtet wird, wenn an jedem der ursprünglichen Trainingspunkte neue Ergebniswerte abgetastet werden) (siehe unten). Als nächstes heißt …


2
R erkennt einen zunehmenden / abnehmenden Trend von Zeitreihen
Ich habe viele Zeitreihen mit Zeiträumen: Tag, Woche oder Monat. Mit stl()Funktion oder mit loess(x ~ y)kann ich sehen, wie Trends bestimmter Zeitreihen aussehen. Ich muss feststellen, ob der Trend der Zeitreihen zunimmt oder abnimmt. Wie kann ich das schaffen? Ich habe versucht, lineare Regressionskoeffizienten lm(x ~ y)mit dem Steigungskoeffizienten …
9 r  time-series  trend 

3
Intuition über eine gemeinsame Entropie
Ich habe Probleme, eine Intuition über die gemeinsame Entropie aufzubauen. = Unsicherheit in der gemeinsamen Verteilung ; = Unsicherheit in ; = Unsicherheit in .H(X,Y)H(X,Y)H(X,Y)p(x,y)p(x,y)p(x,y)H(X)H(X)H(X)px(x)px(x)p_x(x)H(Y)H(Y)H(Y)py(y)py(y)p_y(y) Wenn H (X) hoch ist, ist die Verteilung unsicherer und wenn Sie das Ergebnis einer solchen Verteilung kennen, haben Sie mehr Informationen! H (X) quantifiziert …

1
Anpassen eines zeitvariablen Koeffizienten DLM
Ich möchte ein DLM mit zeitlich variierenden Koeffizienten anpassen, dh eine Erweiterung der üblichen linearen Regression. yt= θ1+ θ2x2yt=θ1+θ2x2y_t = \theta_1 + \theta_2x_2 . Ich habe einen Prädiktor ( ) und eine Antwortvariable ( ), Meeres- und Binnenfischfang von 1950 bis 2011. Ich möchte, dass das DLM-Regressionsmodell folgt:y tx2x2x_2ytyty_t yt= …

1
Sollte ich glaubwürdige Intervalle anstelle von Konfidenzintervallen melden?
Nachdem ich in einem Statistiklehrbuch über das Konzept gestolpert war, versuchte ich, meinen Kopf darüber zu wickeln, und kam schließlich zu einem Schluss, der allen Erklärungen zu entsprechen scheint, die ich bisher gesehen habe: Ein glaubwürdiges Intervall ist das, was Nicht-Statistiker für Vertrauen halten Intervall ist. Exkurs für diejenigen wie …

1
Wie hat die Maximum-Likelihood-Schätzung eine ungefähre Normalverteilung?
Ich habe über MLE als Methode zur Erzeugung einer angepassten Verteilung gelesen. Ich bin auf eine Aussage gestoßen, die besagt, dass Schätzungen der maximalen Wahrscheinlichkeit "ungefähre Normalverteilungen haben". Bedeutet dies, dass die Modelle, die ich erhalte, normal verteilt werden, wenn ich MLE wiederholt auf meine Daten und die Verteilungsfamilie anwende, …

2
Einbeziehung detaillierterer erklärender Variablen im Laufe der Zeit
Ich versuche zu verstehen, wie ich eine Variable am besten modellieren kann, wenn ich im Laufe der Zeit immer detailliertere Prädiktoren erhalten habe. Betrachten Sie beispielsweise die Modellierung der Wiederherstellungsraten für ausgefallene Kredite. Angenommen, wir haben einen Datensatz mit Daten aus 20 Jahren, und in den ersten 15 dieser Jahre …

2
Warum werden 0,05 <p <0,95 Ergebnisse als falsch positiv bezeichnet?
Bearbeiten: Die Grundlage meiner Frage ist fehlerhaft, und ich muss einige Zeit damit verbringen, herauszufinden, ob es überhaupt sinnvoll sein kann. Edit 2: Klarstellung, dass ich erkenne, dass ein p-Wert kein direktes Maß für die Wahrscheinlichkeit einer Nullhypothese ist, sondern dass ich davon ausgehe, dass eine Hypothese umso wahrscheinlicher ist, …

3
Ist die Berechnung der „tatsächlichen Deckungswahrscheinlichkeit“ dasselbe wie die Berechnung eines „glaubwürdigen Intervalls“?
Ich habe ein Lehrbuch für Einsteigerstatistiken gelesen. Im Kapitel über die Maximum-Likelihood-Schätzung des Erfolgsanteils in Daten mit Binomialverteilung wurde eine Formel zur Berechnung eines Konfidenzintervalls angegeben und anschließend nonchalant erwähnt Betrachten Sie die tatsächliche Abdeckungswahrscheinlichkeit, dh die Wahrscheinlichkeit, dass die Methode ein Intervall erzeugt, das den wahren Parameterwert erfasst. Dies …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.