Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Warum funktioniert die CLT Arbeit für
Wir wissen also, dass eine Summe von Poisson mit dem nnnParameter λλ\lambda selbst eine Poisson mit nλnλn\lambda . So hypothetisch könnte man nehmen x∼poisson(λ=1)x∼poisson(λ=1)x \sim poisson(\lambda = 1) und sagen , dass es tatsächlich ist ∑n1xi∼poisson(λ=1)∑1nxi∼poisson(λ=1)\sum_1^n x_i \sim poisson(\lambda = 1) , wobei jedes xixix_i ist: xi∼poisson(λ=1/n)xi∼poisson(λ=1/n)x_i \sim poisson(\lambda = …

2
Eine dynamische Systemansicht des zentralen Grenzwertsatzes?
(Ursprünglich auf MSE gepostet .) Ich habe viele heuristische Diskussionen über den klassischen zentralen Grenzwertsatz gesehen, die von der Normalverteilung (oder einer der stabilen Verteilungen) als einem "Attraktor" im Raum der Wahrscheinlichkeitsdichten sprechen. Betrachten Sie zum Beispiel diese Sätze ganz oben in der Behandlung von Wikipedia : Im allgemeinen Sprachgebrauch …

3
Intuition hinter der Hazard Rate
Ich bin verwirrt über die Gleichung, die als Definition der Gefährdungsrate dient. Ich habe eine Vorstellung davon, wie hoch die Gefährdungsrate ist, verstehe aber nicht, wie die Gleichung diese Intuition ausdrückt. Wenn xxx eine Zufallsvariable ist, die den Zeitpunkt des Todes einer Person in einem Zeitintervall darstellt [0,T][0,T][0,T] . Dann …



1
Caret - Wiederholte K-fache Kreuzvalidierung gegen verschachtelte K-fache Kreuzvalidierung, n-mal wiederholt
Das Caret- Paket ist eine brillante R-Bibliothek zum Erstellen mehrerer maschineller Lernmodelle und verfügt über mehrere Funktionen zum Erstellen und Bewerten von Modellen. Für die Parametereinstellung und das Modelltraining bietet das Caret-Paket "repeatedcv" als eine der Methoden an. Als bewährte Methode kann die Parameteroptimierung mithilfe einer verschachtelten K-fach-Kreuzvalidierung durchgeführt werden, …

1
Sollte eine wiederholte Kreuzvalidierung verwendet werden, um Vorhersagemodelle zu bewerten?
Ich bin auf diesen Artikel von Gitte Vanwinckelen und Hendrik Blockeel aus dem Jahr 2012 gestoßen, in dem die Nützlichkeit der wiederholten Kreuzvalidierung in Frage gestellt wurde. Die Autoren haben gezeigt, dass wiederholte Kreuzvalidierungen zwar die Varianz der Modellvorhersagen verringern, der Mittelwert der erneut abgetasteten Kreuzvalidierungsschätzungen jedoch mit einer verzerrten …


2
Stand der Technik im Allgemeinen Lernen aus Daten in '69
Ich versuche den Kontext des berühmten Buches "Perceptrons" von Minsky und Papert aus dem Jahr 1969 zu verstehen, der für neuronale Netze so wichtig ist. Soweit ich weiß, gab es außer Perceptron noch keine anderen generischen überwachten Lernalgorithmen: Entscheidungsbäume wurden erst Ende der 70er Jahre wirklich nützlich, Zufallswälder und SVMs …

2
Warum heißt es die „Standardabweichung“?
Ich habe eine einfache - und möglicherweise offensichtlich triviale - Frage: Warum heißt die Standardabweichung genau so " Standard "? Liegt es daran, dass der Vergleich von Datensätzen und Ergebnissen hinsichtlich ihrer Streuung standardisiert wird? Eine Suche in Stack Exchange wirft weder diese Frage auf, noch liefert eine Google-Suche nach …

5
Wie bleiben Sie auf dem neuesten Stand der Forschung?
Nachdem ich diese Frage zu arXiv gelesen und einen Link zu GitXiv gefunden hatte, von dem ich zuvor nichts wusste , fragte ich mich, welche Websites / Ressourcen die Leute verwenden, um über die neuesten Forschungsergebnisse in ihrem Bereich auf dem Laufenden zu bleiben.
16 academia 

1
Pearson VS Deviance Residuen in der logistischen Regression
Ich weiß, dass standardisierte Pearson-Residuen auf traditionelle probabilistische Weise erhalten werden: rich= yich- πichπich( 1 - πich)--------√ri=yi−πiπi(1−πi) r_i = \frac{y_i-\pi_i}{\sqrt{\pi_i(1-\pi_i)}} und Abweichungsreste werden auf statistischere Weise erhalten (der Beitrag jedes Punktes zur Wahrscheinlichkeit): dich= sich- 2 [ yichLogπich^+ ( 1 - yich) log( 1 - πich) ]--------------------------√di=si−2[yilog⁡πi^+(1−yi)log⁡(1−πi)] d_i = s_i …

1
Warum liegt bei der multiplen linearen Regression eine grafische Darstellung der vorhergesagten Punkte nicht auf einer geraden Linie?
Ich benutze multiple lineare Regression, um Beziehungen zwischen Y und X1, X2 zu beschreiben. Aus der Theorie habe ich verstanden, dass multiple Regression lineare Beziehungen zwischen Y und jedem von X (Y und X1, Y und X2) annimmt. Ich verwende keine Transformation von X. Also bekam ich das Modell mit …

2
Warum sollten die Daten protokolliert werden, bevor eine Hauptkomponentenanalyse durchgeführt wird?
Ich folge hier einem Tutorial: http://www.r-bloggers.com/computing-and-visualizing-pca-in-r/ um ein besseres Verständnis von PCA zu erlangen. Das Lernprogramm verwendet das Iris-Dataset und wendet eine Protokolltransformation vor PCA an: Beachten Sie, dass wir im folgenden Code eine Protokolltransformation auf die kontinuierlichen Variablen anwenden, wie in [1] vorgeschlagen, centerund im Aufruf zum Standardisieren der …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.