Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
In welchen Einstellungen würden sich die Konfidenzintervalle mit zunehmender Stichprobengröße nicht verbessern?
In einem Blog-Beitrag habe ich die Behauptung gefunden, dass "Ich glaube, WG Cochrane weist zum ersten Mal (ungefähr in den 1970er Jahren) darauf hin, dass kleine Konfidenzgrößen bei Konfidenzintervallen in einer Beobachtungsumgebung zu einer besseren Abdeckung führen, wobei ausreichend große Stichproben eine Abdeckung nahe Null bieten!" Jetzt gehe ich davon …

2
Zeitreihenklassifikation - sehr schlechte Ergebnisse
Ich arbeite an einem Zeitreihenklassifizierungsproblem, bei dem die Eingabe Zeitreihen-Sprachnutzungsdaten (in Sekunden) für die ersten 21 Tage eines Mobiltelefonkontos sind. Die entsprechende Zielvariable ist, ob dieses Konto im Bereich von 35 bis 45 Tagen gekündigt wurde oder nicht. Es handelt sich also um ein binäres Klassifizierungsproblem. Ich erhalte sehr schlechte …

1
Beispiel für eine maximale a posteriori-Schätzung
Ich habe über Maximum-Likelihood-Schätzung und Maximum-A-Posteriori-Schätzung gelesen und bisher nur konkrete Beispiele mit Maximum-Likelihood-Schätzung getroffen. Ich habe einige abstrakte Beispiele für eine maximale a posteriori-Schätzung gefunden, aber noch nichts Konkretes mit Zahlen darauf: S. Es kann sehr überwältigend sein, nur mit abstrakten Variablen und Funktionen zu arbeiten, und um nicht …

1
R neuralnet - compute gibt eine konstante Antwort
Ich versuche, das neuralnetPaket von R (Dokumentation hier ) zur Vorhersage zu verwenden. Hier, was ich versuche zu tun: library(neuralnet) x <- cbind(runif(50, min=1, max=500), runif(50, min=1, max=500)) y <- x[, 1] * x[, 2] train <- data.frame(x, y) n <- names(train) f <- as.formula(paste('y ~', paste(n[!n %in% 'y'], collapse …

1
Wie interpretiere ich einen negativen linearen Regressionskoeffizienten für eine protokollierte Ergebnisvariable?
Ich habe ein lineares Regressionsmodell, bei dem die abhängige Variable protokolliert wird und eine unabhängige Variable linear ist. Der Steigungskoeffizient für eine wichtige unabhängige Variable ist negativ: . Ich bin mir nicht sicher, wie ich interpretieren soll.−.0564−.0564-.0564 Benutze ich den absoluten Wert und wandle ihn dann wie folgt in ein …

1
Erwartete Häufigkeit, mit der der empirische Mittelwert einen Wert überschreitet
Bei einer gegebenen Folge von iid-Zufallsvariablen sagen wir Xi∈[0,1]Xi∈[0,1]X_i \in [0,1] für i=1,2,...,ni=1,2,...,ni = 1,2,...,n , ich versuche die erwartete Anzahloft die empirischen Mittelwert gebunden1n∑ni=1Xi1n∑i=1nXi\frac{1}{n}\sum_{i=1}^n X_iüberschreitet einen Wert,c≥0c≥0c \geq 0, wenn wir weiterhin Proben zeichnen, dh: T=def∑j=1nP({1j∑i=1jXi≥c})T=def∑j=1nP({1j∑i=1jXi≥c}) \mathcal{T} \overset{def}{=} \sum_{j=1}^n \mathbb{P} \left(\left\{ \frac{1}{j}\sum_{i=1}^j X_i \geq c\right\}\right) Wenn wir annehmen, dass …




1
Berechnung von Polynomkontrastvariablen
Bitte geben Sie mir eine Idee, wie eine kategoriale Variable (Faktor) effizient in die Menge der orthogonalen Polynomkontrastvariablen umcodiert werden kann. Für viele Arten von Kontrastvariablen (z. B. Abweichung, einfach, Helmert usw.) lautet der Durchgang: Stellen Sie die Kontrastkoeffizientenmatrix zusammen, die dem Typ entspricht. Invers oder generalize-invers, um die Codematrix …

2
Metriken für Kovarianzmatrizen: Nachteile und Stärken
Was sind die "besten" Metriken für Kovarianzmatrizen und warum? Mir ist klar, dass Frobenius & c nicht geeignet sind und Winkelparametrisierungen auch ihre Probleme haben. Intuitiv möchte man vielleicht einen Kompromiss zwischen diesen beiden, aber ich würde auch gerne wissen, ob es andere Aspekte zu beachten gibt und vielleicht gut …

1
Mehrarmiger Bandit zur allgemeinen Belohnungsverteilung
Ich arbeite an einem mehrarmigen Banditenproblem, bei dem wir keine Informationen über die Belohnungsverteilung haben. Ich habe viele Artikel gefunden, die bedauernde Grenzen für eine Verteilung mit bekannter Bindung und für allgemeine Verteilungen mit Unterstützung in [0,1] garantieren. Ich möchte herausfinden, ob es eine Möglichkeit gibt, in einer Umgebung, in …

2
Schwanzgrenzen der euklidischen Norm für eine gleichmäßige Verteilung auf
Was sind bekannte Obergrenzen dafür, wie oft die euklidische Norm eines einheitlich gewählten Elements von wird größer als ein gegebener Schwellenwert sein?{−n, −(n−1), ..., n−1, n}d{−n, −(n−1), ..., n−1, n}d\:\{-n,~-(n-1),~...,~n-1,~n\}^d\: Ich interessiere mich hauptsächlich für Grenzen, die exponentiell gegen Null konvergieren, wenn viel kleiner als .nnnddd

1
Tests vs
Ich versuche genau herauszufinden, was der Unterschied zwischen Tests und z- Tests ist.tttzzz Soweit ich das beurteilen kann, verwendet man für beide Testklassen dieselbe Teststatistik, etwas in der Form b^−Cseˆ(b^)b^−Cse^(b^)\frac{\hat{b} - C}{\widehat{\operatorname{se}}(\hat{b})} wo b einige Proben Statistik ist, C ist einige Referenz (Ort) konstant (die auf den Angaben des Tests …

2
Was sind die Abstände zwischen Variablen, die eine Kovarianzmatrix bilden?
Ich habe eine Kovarianzmatrix und möchte Variablen mithilfe hierarchischer Cluster in k Cluster aufteilen (zum Beispiel um eine Kovarianzmatrix zu sortieren).n×nn×nn \times nkkk Gibt es eine typische Abstandsfunktion zwischen Variablen (dh zwischen Spalten / Zeilen der quadratischen Kovarianzmatrix)? Oder wenn es mehr gibt, gibt es eine gute Referenz zu diesem …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.