Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


1
Sollten wir den Intercept-Term bei der Kernelisierung von Algorithmen berücksichtigen?
Wenn ein Lernalgorithmus (z. B. Klassifizierung, Regression, Clustering oder Dimensionsreduktion) nur das Punktprodukt zwischen Datenpunkten verwendet xxT.xxT.\mathbf {x x^T} Wir können implizit eine höherdimensionale Abbildung verwenden ϕ ( x )ϕ(x)\phi(\mathbf x) Durch den Kernel-Trick wird jede Instanz ausgetauscht, in der das Punktprodukt vom Kernel auftritt K =ϕ( x )ϕ( x)T.K.=ϕ(x)ϕ(x)T.\mathbf …

1
Normalisierungsfaktor im multivariaten Gaußschen
(Dies ist möglicherweise eine dumme Frage, aber ich bin neugierig.) Das multivariate Gaußsche PDF wird normalerweise so geschrieben 1(2π)d|Σ|−−−−−−−√exp(−12(x−μ)TΣ−1(x−μ))1(2π)d|Σ|exp⁡(−12(x−μ)TΣ−1(x−μ)) \frac{1}{\sqrt{(2\pi)^{d}\lvert \boldsymbol\Sigma\rvert}} \exp\left(-\frac{1}{2}({\mathbf x}-{\boldsymbol\mu})^\mathrm{T}{\boldsymbol\Sigma}^{-1}({\mathbf x}-{\boldsymbol\mu}) \right) Dabei ist ddd die Dimension von xx\mathbf x (z. B. wurde das Obige aus Wikipedia übernommen ). Es scheint mir jedoch, dass der Normalisierungsfaktor äquivalent …


1
Was ist ein Beispiel für die Verwendung der automatischen Differenzierung, wie sie in Tensorflow implementiert ist, und warum ist sie wichtig?
Ich habe ein gutes Verständnis für neuronale Netze, Rückausbreitung und Kettenregeln, aber ich habe Schwierigkeiten, die automatische Differenzierung zu verstehen. Das Folgende bezieht sich auf die automatische Differenzierung außerhalb des Kontextes der Rückausbreitung: Wie berechnet die automatische Differenzierung den Gradienten aus einer Matrix? Was sind die Voraussetzungen, um einen Gradienten …

1
Logistische Regression mit R.
Ich führe eine logistische Regression durch. Ich habe die folgenden Testdaten erstellt (die beiden Prädiktoren und das Kriterium sind binäre Variablen): UV1 UV2 AV 1 1 1 1 2 1 1 1 3 1 1 1 4 1 1 1 5 1 1 1 6 1 1 1 7 1 …

1
Reinforcement Learning von Sutton, Tic Tac Toe Self Play
Ich habe gerade mit Sutton und Bartos Buch Reinforcement Learning: An Introduction begonnen und bin gespannt, wie ich über die Antwort auf Übung 1.1: Selbstspiel nachdenken soll . Angenommen, anstatt gegen einen zufälligen Gegner zu spielen, spielt der oben beschriebene Verstärkungslernalgorithmus gegen sich selbst. Was denkst du würde in diesem …

1
Wie implementiere ich eine verallgemeinerte hypergeometrische Funktion zur Verwendung in Beta-Binomial-PDF, SF, PFF?
Ich schreibe eine Unterklasse scipy.stats._distn_infrastructure.rv_discretefür die Beta-Binomialverteilung, deren PMF ist P(X=k∣N,α,β)(Nk)B(k+α,N−k+β)B(α,β),P(X=k∣N,α,β)(Nk)B(k+α,N−k+β)B(α,β),P(X=k \mid N, \alpha, \beta){N \choose k} \frac{\mathrm{B}(k+\alpha,N-k+\beta)}{\mathrm{B}(\alpha,\beta)}, Dabei ist BB\mathrm{B} die Beta-Funktion. Meine derzeitige Implementierung von CDF und SF (Überlebensfunktion, entspricht 1 - CDF) ist ungenau; Die Strategie, die ich angewendet habe, berechnet den erwarteten Wert des Binomial-PDF in …




1
Vergleich von Ansätzen von MLE-Schätzungen einer Weibull-Verteilung
Ich muss eine Weibull-Verteilung auf einige Daten parametrisieren. Daher verwende ich die Maximum-Likelihood-Estimation (MLE) aus dem fitdistrplus-Paket in R. Ich wollte jedoch verstehen, was im Paket getan wird, und habe daher neben der Verwendung des Pakets zwei manuelle Lösungen ausprobiert, um die von angegebenen MLE-Schätzungen zu überprüfen Fitdist. Zusammenfassend sind …

1
Der beste Weg, um einen durchschnittlichen F-Score mit unausgeglichenen Klassen zu erzielen
Ich habe einen Datensatz mit unausgeglichenen Klassen. Drei Klassen machen etwa 60% der Daten aus. Außerdem habe ich verschiedene Testaufteilungen, die ein Ungleichgewicht verursachen. Zum Beispiel: Zugset: label_1 ... label_n Testsatz: label_1, label_3, label_9 Dies bedeutet, dass obwohl ich nur 3 Etiketten in meinem Testsatz habe, diese möglicherweise als 1 …



Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.