Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


1
Es besteht die Möglichkeit, dass das Bootstrap-Beispiel genau dem Originalbeispiel entspricht
Ich möchte nur einige Argumente überprüfen. Wenn mein Originalmuster die Größe und ich es boote, ist mein Denkprozess wie folgt:nnn 1n1n\frac{1}{n} ist die Wahrscheinlichkeit einer Beobachtung aus der Originalprobe. Um sicherzustellen, dass die nächste Ziehung nicht die zuvor untersuchte Beobachtung ist, beschränken wir die Stichprobengröße auf . So erhalten wir …


1
Generieren Sie Zufallszahlen aus der "geneigten Gleichverteilung" aus der mathematischen Theorie
Für einen bestimmten Zweck muss ich Zufallszahlen (Daten) aus einer "geneigten gleichmäßigen" Verteilung generieren. Die "Steigung" dieser Verteilung kann in einem angemessenen Intervall variieren, und dann sollte sich meine Verteilung basierend auf der Steigung von gleichmäßig zu dreieckig ändern. Hier ist meine Ableitung: Machen wir es einfach und generieren Daten …

2
Simulieren Sie lineare Regression mit Heteroskedastizität
Ich versuche, einen Datensatz zu simulieren, der mit meinen empirischen Daten übereinstimmt, bin mir jedoch nicht sicher, wie ich die Fehler in den Originaldaten abschätzen soll. Die empirischen Daten beinhalten Heteroskedastizität, aber ich bin nicht daran interessiert, sie weg zu transformieren, sondern ein lineares Modell mit einem Fehlerterm zu verwenden, …


1
Farbverläufe für das Skipgramm word2vec
Ich gehe die Probleme in den schriftlichen Aufgabenproblemen der Stanford NLP Deep Learning-Klasse durch http://cs224d.stanford.edu/assignment1/assignment1_soln Ich versuche die Antwort für 3a zu verstehen, wo sie nach der Ableitung zum Vektor für das Mittelwort suchen. Angenommen, Sie erhalten einen vorhergesagten Wortvektor , der dem Mittelwort c für das Sprunggramm entspricht, und …

1
Multivariate lineare Regression mit Lasso in r
Ich versuche, ein reduziertes Modell zu erstellen, um viele abhängige Variablen (DV) (~ 450) vorherzusagen, die stark korreliert sind. Meine unabhängigen Variablen (IV) sind ebenfalls zahlreich (~ 2000) und stark korreliert. Wenn ich das Lasso verwende, um ein reduziertes Modell für jede Ausgabe einzeln auszuwählen, wird nicht garantiert, dass ich …


1
Was ist der Unterschied zwischen vielfältigem Lernen und nichtlinearer Dimensionsreduktion?
Was ist der Unterschied zwischen vielfältigem Lernen und nichtlinearer Dimensionsreduktion ? Ich habe gesehen, dass diese beiden Begriffe synonym verwendet werden. Beispielsweise: http://www.cs.cornell.edu/~kilian/research/manifold/manifold.html : Manifold Learning (oft auch als nichtlineare Dimensionsreduktion bezeichnet) verfolgt das Ziel, Daten, die ursprünglich in einem hochdimensionalen Raum liegen, in einen Raum mit niedrigeren Dimensionen einzubetten …

1
Modell mit gemischten Effekten und Splines
Ich passe ein Modell mit gemischten Effekten mit einem Spline-Term in einer Anwendung an, bei der der zeitliche Trend bekanntermaßen kurvenlinear ist. Ich möchte jedoch beurteilen, ob der kurvenlineare Trend aufgrund einer individuellen Abweichung von der Linearität auftritt oder ob es sich um einen Effekt auf Gruppenebene handelt, der eine …
9 r  splines  lme4-nlme 

2
Größe der Bootstrap-Beispiele
Ich lerne Bootstrapping als Mittel zur Schätzung der Varianz einer Stichprobenstatistik. Ich habe einen grundsätzlichen Zweifel. Zitat aus http://web.stanford.edu/class/psych252/tutorials/doBootstrapPrimer.pdf : • Wie viele Beobachtungen sollten wir erneut abtasten? Ein guter Vorschlag ist die ursprüngliche Stichprobengröße. Wie können wir so viele Beobachtungen wie in der Originalprobe erneut abtasten? Wenn ich eine …

1
Zweifel an der Ableitung von Gaußschen Prozessregressionsgleichungen in einer Arbeit
Ich lese diesen Papiervorabdruck und habe Schwierigkeiten, die Gleichungen für die Gaußsche Prozessregression abzuleiten. Sie verwenden die Einstellung und Notation von Rasmussen & Williams . Somit wird additives, mittleres, stationäres und normalverteiltes Rauschen mit Varianz angenommen:σ2noiseσnoise2\sigma^2_{noise} y=f(x)+ϵ,ϵ∼N(0,σ2noise)y=f(x)+ϵ,ϵ∼N(0,σnoise2)y=f(\mathbf{x})+\epsilon, \quad \epsilon\sim N(0,\sigma^2_{noise}) Für wird ein GP vor dem Mittelwert Null angenommen , …

1
Nomenklatur für die linke und rechte Seite in Regressionsmodellen
y=β0+β1x1+ε0y=β0+β1x1+ε0y = \beta_{0} + \beta_{1}x_{1} + \varepsilon_{0} Die Sprache zur Beschreibung von Regressionsmodellen, wie die oben angegebene sehr einfache lineare Regression, variiert häufig, und solche Variationen weisen häufig geringfügige Bedeutungsverschiebungen auf. Zum Beispiel kann der Teil des Modells auf der linken Seite der Gleichung mit Konnotationen und Bezeichnungen in Klammern …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.