Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren



1
Wie teste ich die statistische Signifikanz für kategoriale Variablen in der linearen Regression?
Wenn ich in einer linearen Regression eine kategoriale Variable habe ... woher weiß ich, welche statistische Bedeutung die kategoriale Variable hat? Nehmen wir an, der Faktor hat 10 Stufen ... es gibt 10 verschiedene resultierende t-Werte unter dem Dach einer Faktorvariablen ...X 1X1X1X_1X1X1X_1 Es scheint mir, dass die statistische Signifikanz …

3
Ist das Erstellen eines Klassifikators für mehrere Klassen besser als das Erstellen mehrerer binärer Klassifikatoren?
Ich muss URLs in Kategorien einteilen. Angenommen, ich habe 15 Kategorien, für die ich vorhabe, jede URL auf null zu setzen. Ist ein 15-Wege-Klassifikator besser? Wobei ich 15 Labels habe und Features für jeden Datenpunkt generiere. Oder bauen Sie 15 binäre Klassifizierer auf, sagen Sie: Film oder Nicht-Film, und verwenden …


1
Multivariate normale posterior
Dies ist eine sehr einfache Frage, aber ich kann die Ableitung nirgendwo im Internet oder in einem Buch finden. Ich würde gerne sehen, wie ein Bayesianer eine multivariate Normalverteilung aktualisiert. Zum Beispiel: Stellen Sie sich das vor P(x|μ,Σ)P(μ)==N(μ,Σ)N(μ0,Σ0).P(x|μ,Σ)=N(μ,Σ)P(μ)=N(μ0,Σ0). \begin{array}{rcl} \mathbb{P}({\bf x}|{\bf μ},{\bf Σ}) & = & N({\bf \mu}, {\bf \Sigma}) …

1
MLE gegen kleinste Quadrate in passenden Wahrscheinlichkeitsverteilungen
Der Eindruck, den ich aufgrund mehrerer Veröffentlichungen, Bücher und Artikel gewonnen habe, ist, dass die empfohlene Methode zum Anpassen einer Wahrscheinlichkeitsverteilung an einen Datensatz die Verwendung der Maximum Likelihood Estimation (MLE) ist. Als Physiker ist es jedoch intuitiver, das PDF des Modells mit Hilfe der kleinsten Quadrate an das empirische …



1
So funktioniert der Pearson's Chi Squared Test
Nach einer kürzlichen Abstimmung habe ich versucht, mein Verständnis des Pearson Chi Squared-Tests zu überprüfen. Normalerweise verwende ich die Chi-Quadrat-Statistik (oder die reduzierte Chi-Quadrat-Statistik) zum Anpassen oder Überprüfen der resultierenden Passform. In diesem Fall entspricht die Varianz normalerweise nicht der erwarteten Anzahl von Zählungen in einer Tabelle oder einem Histogramm, …


2
Zufälliges Gehen mit Schwung
Betrachten Sie einen ganzzahligen Zufallsrundgang ab 0 unter den folgenden Bedingungen: Der erste Schritt ist plus oder minus 1 mit gleicher Wahrscheinlichkeit. Jeder zukünftige Schritt ist: 60% wahrscheinlich in die gleiche Richtung wie der vorherige Schritt, 40% wahrscheinlich in die entgegengesetzte Richtung Welche Verteilung bringt das? Ich weiß, dass ein …

2
Was ist der richtige Weg, um auf signifikante Unterschiede zwischen Koeffizienten zu testen?
Ich hoffe, jemand kann mir dabei helfen, einen Punkt der Verwirrung auszuräumen. Angenommen, ich möchte testen, ob sich zwei Regressionskoeffizientensätze signifikant voneinander unterscheiden, und zwar mit folgendem Aufbau: mit 5 unabhängigen Variablen.yich= α +βxich+ ϵichyich=α+βxich+ϵichy_i = \alpha + \beta x_i + \epsilon_i 2 Gruppen mit ungefähr gleichen Größen (obwohl dies …

2
Warum wird beim Chi-Quadrat-Test die erwartete Anzahl als Varianz verwendet?
Auf welcher Grundlage wird bei χ2χ2\chi^2 Tests die Quadratwurzel der erwarteten Zählungen als Standardabweichung (dh die erwarteten Zählungen als Varianzen) für jede der Normalverteilungen verwendet? Das einzige, was ich darüber diskutieren konnte, ist http://www.physics.csbsju.edu/stats/chi-square.html , und es werden nur Poisson-Distributionen erwähnt. Als einfaches Beispiel für meine Verwirrung, was wäre, wenn …

2
Verteilung, die den Unterschied zwischen negativen binomialverteilten Variablen beschreibt?
Eine Skellam-Verteilung beschreibt den Unterschied zwischen zwei Variablen mit Poisson-Verteilungen. Gibt es eine ähnliche Verteilung, die den Unterschied zwischen Variablen beschreibt, die auf negative Binomialverteilungen folgen? Meine Daten werden nach einem Poisson-Verfahren erstellt, enthalten jedoch einiges an Rauschen, was zu einer Überdispersion in der Verteilung führt. Daher funktioniert die Modellierung …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.