Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Statistiken für maschinelles Lernen, Papiere zum Starten?
Ich habe einen Hintergrund in Computerprogrammierung und elementarer Zahlentheorie, aber kein wirkliches Statistik-Training und habe kürzlich "entdeckt", dass die erstaunliche Welt einer ganzen Reihe von Techniken tatsächlich eine statistische Welt ist. Es scheint, dass Matrixfaktorisierungen, Matrixvervollständigung, hochdimensionale Tensoren, Einbettungen, Dichteschätzung, Bayes'sche Inferenz, Markov-Partitionen, Eigenvektorberechnung und PageRank hochgradig statistische Techniken sind …

3
Was ist der Vorteil der Imputation gegenüber der Erstellung mehrerer Modelle in der Regression?
Ich frage mich, ob jemand einen Einblick geben könnte, ob eine Warum-Imputation für fehlende Daten besser ist, als einfach verschiedene Modelle für Fälle mit fehlenden Daten zu erstellen. Besonders im Fall von [verallgemeinerten] linearen Modellen (ich kann vielleicht in nichtlinearen Fällen sehen, dass die Dinge anders sind) Angenommen, wir haben …

4
So überprüfen Sie, ob mein Regressionsmodell gut ist
Eine Möglichkeit, die Genauigkeit des logistischen Regressionsmodells mithilfe von 'glm' zu ermitteln, besteht darin, das AUC-Diagramm zu ermitteln. Wie kann man dasselbe für ein Regressionsmodell überprüfen, das mit einer kontinuierlichen Antwortvariablen gefunden wurde (family = 'gaussian')? Mit welchen Methoden wird überprüft, wie gut mein Regressionsmodell zu den Daten passt?

2
Kerndichteschätzung für asymmetrische Verteilungen
Sei Beobachtungen, die aus einer unbekannten (aber sicherlich asymmetrischen) Wahrscheinlichkeitsverteilung stammen.{ x1, … , X.N.}}{x1,…,xN.}}\{x_1,\ldots,x_N\} Ich mag die Wahrscheinlichkeitsverteilung finden , indem Sie den KDE - Ansatz: f ( x ) = 1 Ich habe jedoch versucht, einen Gaußschen Kernel zu verwenden, der jedoch eine schlechte Leistung erbrachte, da er …







2
Was ist der Unterschied zwischen logit-transformierter linearer Regression, logistischer Regression und einem logistischen gemischten Modell?
Angenommen, ich habe 10 Schüler, die jeweils versuchen, 20 mathematische Probleme zu lösen. Die Probleme werden richtig oder falsch bewertet (in Langdaten) und die Leistung jedes Schülers kann durch ein Genauigkeitsmaß (in Unterdaten) zusammengefasst werden. Die folgenden Modelle 1, 2 und 4 scheinen unterschiedliche Ergebnisse zu liefern, aber ich verstehe, …



1
Wie kann man eine marginale Verteilung aus einer gemeinsamen Verteilung mit einer Abhängigkeit von mehreren Variablen finden?
Eines der Probleme in meinem Lehrbuch ist wie folgt. Ein zweidimensionaler stochastischer kontinuierlicher Vektor hat die folgende Dichtefunktion: fX., Y.( x , y) = { 15 x y20wenn 0 <x <1 und 0 <y <xAndernfallsfX,Y(x,y)={15xy2if 0 < x < 1 and 0 < y < x0otherwise f_{X,Y}(x,y)= \begin{cases} 15xy^2 & …

4
Gutes Tutorial für eingeschränkte Boltzmann-Maschinen (RBM)
Ich studiere die Restricted Boltzmann Machine (RBM) und habe einige Probleme beim Verständnis der Log-Likelihood-Berechnungen in Bezug auf die Parameter des RBM. Obwohl viele Forschungsarbeiten zu RBM veröffentlicht wurden, gibt es keine detaillierten Schritte der Derivate. Nachdem ich online gesucht hatte, konnte ich sie in diesem Dokument finden: Fischer, A. …
10 references  rbm 

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.