Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

5
Beurteilung der Bedeutung von Verteilungsunterschieden
Ich habe zwei Datengruppen. Jeweils mit unterschiedlicher Verteilung mehrerer Variablen. Ich versuche festzustellen, ob sich die Verteilungen dieser beiden Gruppen statistisch signifikant unterscheiden. Ich habe die Daten sowohl in Rohform als auch in einfacher zu verarbeitenden diskreten Kategorien mit Häufigkeitszählern zusammengefasst. Welche Tests / Verfahren / Methoden sollte ich verwenden, …

3
Bestimmungskoeffizient (
Ich möchte den Begriff von , der das Ausmaß der Variation zwischen Variablen beschreibt , vollständig erfassen . Jede Weberklärung ist ein bisschen mechanisch und stumpf. Ich möchte das Konzept "verstehen" und die Zahlen nicht nur mechanisch verwenden.r2r2r^2 ZB: Stunden studiert vs. Testergebnis = 0,8rrr = 0,64r2r2r^2 Also, was bedeutet …





4
Entropie eines Bildes
Was ist die informations- / physikalisch-theoretisch korrekteste Methode, um die Entropie eines Bildes zu berechnen? Die Recheneffizienz ist mir momentan egal - ich möchte, dass sie theoretisch so korrekt wie möglich ist. Beginnen wir mit einem Graustufenbild. Eine intuitive Vorgehensweise ist das Bild als eine Tasche von Pixeln zu prüfen …

2
Wie funktioniert die inverse Transformationsmethode?
Wie funktioniert die Inversionsmethode? Sagen , ich habe eine Stichprobe X1, X2, . . . , XnX1,X2,...,XnX_1,X_2,...,X_n mit der Dichte f(x;θ)=1θx(1−θ)θf(x;θ)=1θx(1-θ)θf(x;\theta)={1\over \theta} x^{(1-\theta)\over \theta} über 0 &lt; x &lt; 10&lt;x&lt;10<x<1und daher mit cdfFX(x)=x1/θFX(x)=x1/θF_X(x)=x^{1/\theta}auf(0,1)(0,1)(0,1). Dann erhalte ich mit der Inversionsmethode die Verteilung vonXXXalsF−1X(u)=uθFX-1(u)=uθF_X^{-1}(u)=u^\theta. Hat uθuθu^\theta also die Verteilung von XXX ? …

2
Wie man glaubwürdige Intervalle für ein medizinisches Publikum zusammenfasst
Mit Stan und Frontend - Paketen rstanarmoder brmsich kann einfach Daten für den Bayesian analysiert , wie ich zuvor mit gemischten Modellen wie lme. Obwohl ich die meisten Bücher und Artikel von Kruschke-Gelman-Wagenmakers-etc auf meinem Schreibtisch habe, verraten diese nicht, wie ich die Ergebnisse für ein medizinisches Publikum zusammenfassen soll, …

5
Ein statistischer Ansatz, um festzustellen, ob zufällig Daten fehlen
Ich habe eine große Menge von Merkmalsvektoren, die ich verwenden werde, um ein Binärklassifizierungsproblem anzugreifen (mit Scikit Learn in Python). Bevor ich mich mit Imputation beschäftige, möchte ich anhand der verbleibenden Teile der Daten feststellen, ob die fehlenden Daten "zufällig" oder nicht zufällig fehlen. Was ist ein vernünftiger Weg, um …



1
Sollte ich Entscheidungen treffen, die auf mikro- oder makro-gemittelten Bewertungsmaßstäben basieren?
Ich führte eine 10-fache Kreuzvalidierung mit verschiedenen binären Klassifizierungsalgorithmen mit demselben Datensatz durch und erhielt sowohl mikro- als auch makromittelte Ergebnisse. Es sollte erwähnt werden, dass dies ein Mehrfachetiketten-Klassifizierungsproblem war. In meinem Fall werden echte Negative und echte Positive gleich gewichtet. Das bedeutet, dass die korrekte Vorhersage von echten Negativen …

1
Warum wird das Quasi-Poisson in GLM nicht als Sonderfall eines negativen Binomials behandelt?
Ich versuche, verallgemeinerte lineare Modelle an einige Sätze von Zähldaten anzupassen, die möglicherweise überdispers sind oder nicht. Die beiden hier geltenden kanonischen Verteilungen sind das Poisson- und das Negative Binomial (Negbin) mit EV und Varianzμμ\mu VarP=μVarP=μVar_P = \mu VarNB=μ+μ2θVarNB=μ+μ2θVar_{NB} = \mu + \frac{\mu^2}{\theta} in denen R montiert werden unter Verwendung …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.