Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


2
Berechnung der Wahrscheinlichkeit von x1> x2
Ich lerne selbst über die Wahrscheinlichkeit mithilfe von R, linearen Modellen und Wahrscheinlichkeitsberechnungen. Ich bin derzeit nicht sicher, wie ich zwei Vorhersagen aus einem Modell vergleichen kann. Die von mir verwendeten Daten werden (kostenlos) von hier heruntergeladen: wmbriggs.com/public/sat.csv df <- read.csv("sat.csv") # Load data lm <- lm(cgpa~hgpa+sat+ltrs,data=df) # model to …

2
Wird das Testen von Modellannahmen als P-Hacking / Fischen angesehen?
"P-Hacking", "Fischen" und "Garten der Gabelpfade", wie hier und hier erläutert , beschreiben einen explorativen Datenanalyse-ähnlichen Forschungsstil, der voreingenommene Schätzungen liefert. Wird das Testen von Modellannahmen (z. B. Normalität, Homoskedastizität in der Regression) unter Verwendung statistischer Tests für denselben Datensatz, der zur Anpassung an das Modell verwendet wird, als "p-Hacking" …

1
Warum ist die Abweichung für den OLS-Schätzer in Bezug auf die lineare Regression gleich Null?
Ich verstehe das Konzept des Bias-Varianz-Kompromisses. Eine nach meinem Verständnis basierende Verzerrung stellt den Fehler dar, weil ein einfacher Klassifikator (z. B. linear) verwendet wird, um eine komplexe nichtlineare Entscheidungsgrenze zu erfassen. Daher habe ich erwartet, dass der OLS-Schätzer eine hohe Verzerrung und eine geringe Varianz aufweist. Aber ich bin …

4
Kurse für maschinelles Lernen: Mathematik erklärt
Ich suche einen Kurs für maschinelles Lernen, der die Mathematik hinter Algorithmen vermittelt, anstatt nur zu lehren, wie man sie anwendet. Ich habe mir Udacity Into to Machine Learning und Andrew Ngs Kurs über Coursera angesehen, und beide scheinen mir zu zutreffend zu sein. Empfehlungen von Lehrbüchern wären ebenfalls sehr …


2
Wenn
Wenn E|Xn|=O(an)E|Xn|=O(an)\mathbb{E}|X_n|=O(a_n), wo an→0an→0a_n\to 0 und XnXnX_n ist eine Folge von positiven Zufallsvariablen, wie groß sie sind Yn=Xnln(1Xn)Yn=Xnln⁡(1Xn)Y_n = X_n\ln\left(\frac{1}{X_n}\right)? Mein Versuch: durch Markovs Ungleichung E|Xn|=O(an)E|Xn|=O(an)\mathbb{E}|X_n|=O(a_n) impliziert Xn=Op(an)Xn=Op(an)X_n=O_p(a_n) und Y.n=Öp(einn) ln(1X.n)Yn=Op(an)ln⁡(1Xn)Y_n = O_p(a_n)\ln\left(\frac{1}{X_n}\right). Es bleibt zu beurteilenln(1X.n)ln⁡(1Xn)\ln\left(\frac{1}{X_n}\right). Für eine positive Folge von ZufallsvariablenZ.n=Öp( 1 )Zn=Op(1)Z_n=O_p(1) X.n=einnZ.n⟺ln(X.n) = ln(einn) + ln(Z.n)⟺ln(1X.n)ln(1einn)=ln(Z.n)ln(einn)+ …

1
Wann ist es wichtig, einen unvoreingenommenen Schätzer zu haben?
Wir haben ein paar Fragen und Antworten darüber, wann man eine voreingenommene Schätzung einer unvoreingenommenen vorziehen würde, aber ich habe auf der umgekehrten Frage nichts gefunden: In welchen Situationen ist es wichtig, nur unvoreingenommene Schätzer zu berücksichtigen ? Es wird viel Wert auf das Konzept der Unparteilichkeit bei statistischen Einführungskursen …


1
Quantifizieren Sie die Ähnlichkeit von Wortsäcken
Ich habe zwei Datensätze, die die häufigsten Wörter und ihre Häufigkeit von zwei verschiedenen Artikeln enthalten. z.B: A = [apple: 23, healthy: 15, tasty: 4] B = [apple: 19, healthy: 21, bad: 7] Beide Datensätze enthalten ähnliche Wörter. Ich möchte eine Maßnahme finden, die mir eine Vorstellung davon gibt, ob …

2
Motivation für die Gammaverteilung mit einem nicht ganzzahligen Parameter
Die Erlang-Verteilung lässt sich in Bezug auf die Wartezeit auf das Auftreten einer vordefinierten Anzahl von Ereignissen in einem Poisson-Prozess oder einer Summe einer vordefinierten Anzahl von exponentiellen Zufallsvariablen einfach interpretieren. Die Gammaverteilung ist allgemeiner, da sie einen nicht ganzzahligen Parameter zulässt, aber normalerweise die gleiche Motivation erhält. Ich weiß, …

2
Wie viele zufällig ausgewählte Amerikaner werden benötigt, um eine 50% ige Chance zu haben, dass zwei in demselben oder einem benachbarten Staat leben?
Hintergrund Ich studiere häufige Zufälle und "nahe" Zufälle, die den Durchschnittsmenschen dennoch (übermäßig) beeindrucken. Die folgende Frage ist eine Erweiterung des berühmten Geburtstagsproblems , bei dem gefragt wird: "Wie viele zufällig ausgewählte Personen werden benötigt, damit eine 50% ige Chance besteht, dass zwei von ihnen denselben Geburtstag haben?" Die Antwort …


1
Wer ist der Vater (oder die Mutter) der linearen Analyse der kleinsten Quadrate, wie wir sie kennen?
Hintergrund: Die kleinste quadratische Fehleranpassung gibt es schon seit einiger Zeit. Laplace, PS "Des méthodes analytiques du Calcul des Probabilités." CH. 4 in Théorie analytique des probabilités, Livre 2, 3. Aufl. Paris: Kurier, 1820. Gauß, CF "Theoria Kombination ist obsevationum erroribus minimis obnoxiae." Werke, Bd. 4. Göttingen, Deutschland: p. 1, …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.