Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Reproduzieren Sie das Projektionsdiagramm der linearen Diskriminanzanalyse
Ich habe Probleme mit Projektionspunkten in der linearen Diskriminanzanalyse (LDA). Viele Bücher über multivariate statistische Methoden veranschaulichen die Idee der LDA anhand der folgenden Abbildung. Die Problembeschreibung lautet wie folgt. Zuerst müssen wir die Entscheidungsgrenze zeichnen, eine senkrechte Linie hinzufügen und dann Projektionen von Datenpunkten darauf zeichnen. Ich frage mich, …

1
Quantifizierung, wie viel "mehr Korrelation" eine Korrelationsmatrix A im Vergleich zu einer Korrelationsmatrix B enthält
Ich habe 2 Korrelationsmatrizen und (unter Verwendung des linearen Korrelationskoeffizienten nach Pearson durch Matlab's corrcoef () ). Ich möchte quantifizieren, wie viel "mehr Korrelation" Vergleich zu enthält . Gibt es dafür eine Standardmetrik oder einen Standardtest?B.EINEINAB.B.BB.EINEINAB.B.B ZB die Korrelationsmatrix enthält "mehr Korrelation" als Mir ist der M-Test der Box bekannt …

2
Kann ich eine T-Test-Leistungsanalyse für ungleiche Größengruppen durchführen, die 2 verschiedene minimale n erzeugt?
Es ist normalerweise unkompliziert, eine Power Analysiszu berechnen minimum sample size, insbesondere in R , meiner bevorzugten statistischen Computerumgebung. Ich werde jedoch gebeten, eine Leistungsanalyse durchzuführen, die sich ein wenig von allem unterscheidet, was ich getan habe oder auf die ich online verweisen kann. Ich frage mich, ob das, wonach …

1
Extremwerttheorie: Lognormale GEV-Parameter
Die logarithmische Normalverteilung gehört zum maximalen Anziehungsbereich von Gumbel , wobei: FlogN(x;μ,σ)=Φ(lnx−μσ)FlogN(x;μ,σ)=Φ(ln⁡x−μσ)F^{logN}(x; \mu,\sigma)=\Phi\left(\frac{\ln x - \mu}{\sigma}\right), FGum(x;μ,β)=e−exp(−x−μβ)FGum(x;μ,β)=e−exp⁡(−x−μβ)F^{Gum}(x;\mu,\beta) = e^{-\exp\left({-\frac{x-\mu}{\beta}}\right)} Meine Frage : Haben wir und ?σ = βμ=μμ=μ\mu=\muσ=βσ=β\sigma=\beta Die verallgemeinerte Extremwertverteilung verwendet auch die Notation (Gumbel ist der Grenzfall ), und ein Vergleich der CDFs für Standard-Lognormal und Standard-Gumbel würde …

2
Wie bereite ich Interaktionen von kategorialen Variablen in Scikit-Learn vor?
Was ist der beste Weg, um Interaktionen mit kategorialen Merkmalen vorzubereiten, bevor Sie mit scikit-learn arbeiten? Mit statsmodelskönnte ich bequem im R-Stil sagen smf.ols(formula = 'depvar ~ C(var1)*C(var2)', data=df).fit()(gleich in Stata mit regress depvar i.var1##i.var2). Kann sklearn.preprocessing.PolynomialFeatures(in v0.15, derzeit dev) mit kategorialen Variablen verwendet werden?


1
Reste in Poisson-Regression
Zuur 2013 Anfängerleitfaden zu GLM & GLMM schlägt vor, eine Poisson-Regression zu validieren, indem Pearsons-Residuen gegen angepasste Werte aufgetragen werden. Zuur sagt, wir sollten nicht sehen, wie sich die Residuen mit zunehmenden angepassten Werten ausbreiten, wie bei einem beigefügten (handgezeichneten) Diagramm. Aber ich dachte, ein Schlüsselmerkmal der Poisson-Verteilung ist, dass …

1
Effiziente Auswertung der mehrdimensionalen Kernel-Dichteschätzung
Ich habe eine angemessene Menge an Literatur über die Auswahl von Kerneln und Bandbreiten bei der Berechnung einer Kerneldichteschätzung gesehen, bin aber derzeit daran interessiert, wie die Zeit verbessert werden kann, die zur Bewertung des resultierenden KDE an einer beliebigen Anzahl von Punkten erforderlich ist. In meinem Fall verwende ich …

2
Multiple Regression in der Richtungs- / Zirkularstatistik?
Ich versuche, ein Vorhersagemodell für eine winkelabhängige Variable (auf zu entwickeln, indem ich mehrere unabhängige Messungen - auch Winkelvariablen auf - als Prädiktoren verwende. Jeder Prädiktor ist signifikant, aber nicht extrem stark mit der abhängigen Variablen korreliert. Wie kann ich die Prädiktoren kombinieren, um ein Vorhersagemodell für die abhängige Variable …


2
Anhaltende kontrastive Divergenz für RBMs
Wenn wir den persistenten CD-Lernalgorithmus für eingeschränkte Bolzmann-Maschinen verwenden, starten wir unsere Gibbs-Abtastkette in der ersten Iteration an einem Datenpunkt, aber im Gegensatz zur normalen CD beginnen wir in den folgenden Iterationen nicht über unserer Kette. Stattdessen beginnen wir dort, wo die Gibbs-Abtastkette in der vorherigen Iteration endete. Beim normalen …

2
Wie sollte man in einer Metaanalyse mit nicht signifikanten Studien umgehen, die keine Rohdaten enthalten?
Angenommen, ich führe eine Metaanalyse durch und untersuche die Leistung von Gruppe A und Gruppe B in Bezug auf ein bestimmtes Konstrukt. Einige der Studien, auf die ich stoßen werde, werden nun berichten, dass keine statistischen Unterschiede zwischen den beiden Gruppen gefunden werden konnten, aber keine genauen Teststatistiken und / …

4
Bewertung eines Regressionsmodells
Für Klassifizierungsprobleme habe ich neuronale Netze verwendet und Fehler vom Typ I und II unter Verwendung der Verwirrungsmatrix und ihrer Maße gemäß dieser Ressource ( Spiegel ) gemessen , was ziemlich einfach ist. Wie würde man bei einem Schätzungsproblem die Modellleistung bewerten? Angenommen, es gibt keine Klassen und die Ausgabe …

2
Wie macht der Nachweis der Ablehnungsstichprobe Sinn?
Ich nehme an einem Kurs über Monte-Carlo-Methoden teil und wir haben in der letzten Vorlesung die Rejection Sampling-Methode (oder Accept-Reject Sampling-Methode) gelernt. Es gibt viele Ressourcen im Web, die den Beweis dieser Methode zeigen, aber irgendwie bin ich nicht davon überzeugt. In der Ablehnungsabtastung haben wir also eine Verteilung der …

2
Skalieren der Rückwärtsvariablen in HMM Baum-Welch
Ich versuche nur, den skalierten Baum-Welch-Algorithmus zu implementieren, und bin auf ein Problem gestoßen, bei dem meine Rückwärtsvariablen nach der Skalierung über dem Wert 1 liegen. Ist das normal? Schließlich sollten die Wahrscheinlichkeiten nicht über 1 liegen. Ich verwende den Skalierungsfaktor, den ich aus den Vorwärtsvariablen erhalten habe: ct=1/∑s∈Sαt(s)ct=1/∑s∈Sαt(s) c_t …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.