Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Spezielle Wahrscheinlichkeitsverteilung
Wenn p(x)p(x)p(x) eine Wahrscheinlichkeitsverteilung mit Nicht-Null-Werten für [0,+∞)[0,+∞)[0,+\infty) , für welche Art (en) von p(x)p(x)p(x) gibt es eine Konstante c>0c>0c\gt 0 so dass ∫∞0p(x)logp(x)(1+ϵ)p(x(1+ϵ))dx≤cϵ2∫0∞p(x)log⁡p(x)(1+ϵ)p(x(1+ϵ))dx≤cϵ2\int_0^{\infty}p(x)\log{\frac{ p(x)}{(1+\epsilon)p({x}(1+\epsilon))}}dx \leq c \epsilon^2für alle0<ϵ<10<ϵ<10\lt\epsilon\lt 1? Die obige Ungleichung ist tatsächlich eine Kullback-Leibler-Divergenz zwischen der Verteilung p(x)p(x)p(x) und einer komprimierten Version davon (1+ϵ)p(x(1+ϵ))(1+ϵ)p(x(1+ϵ)){(1+\epsilon)}p({x}{(1+\epsilon)}) . Ich habe …

2
Ist Gelenknormalität eine notwendige Bedingung für die Normalität der Summe normaler Zufallsvariablen?
In Kommentaren , die meiner Antwort auf eine verwandte Frage folgen, fragten Benutzer ssdecontrol und Glen_b, ob eine gemeinsame Normalität von und notwendig ist, um die Normalität der Summe zu behaupten . Dass Gelenknormalität ausreicht, ist natürlich bekannt. Diese Zusatzfrage wurde dort nicht angesprochen und ist vielleicht für sich allein …

1
Erwarteter Wert von
Ich bin neugierig auf die Erklärung am Ende der ersten Seite in diesem Text in Bezug auf die R2adjustedRadjusted2R^2_\mathrm{adjusted} Einstellung R2adjusted=1−(1−R2)(n−1n−m−1).Radjusted2=1−(1−R2)(n−1n−m−1).R^2_\mathrm{adjusted} =1-(1-R^2)\left({\frac{n-1}{n-m-1}}\right). Der Text besagt: Die Logik der Anpassung lautet wie folgt: Bei der gewöhnlichen multiplen Regression erklärt ein Zufallsvorhersagefaktor im Durchschnitt ein Verhältnis m1/(n–1)1/(n–1)1/(n – 1) der Variation der …

2
Wie wählt man die optimale Behälterbreite beim Kalibrieren von Wahrscheinlichkeitsmodellen?
Hintergrund: Hier gibt es einige gute Fragen und Antworten zur Kalibrierung von Modellen, die die Wahrscheinlichkeiten eines eintretenden Ergebnisses vorhersagen. Beispielsweise Brier-Score und seine Zerlegung in Auflösung, Unsicherheit und Zuverlässigkeit . Kalibrierungsdiagramme und isotonische Regression . Diese Methoden erfordern häufig die Verwendung einer Binning-Methode für die vorhergesagten Wahrscheinlichkeiten, sodass das …


1
Identische Koeffizienten, geschätzt in Poisson vs. Quasi-Poisson-Modell
Bei der Modellierung von Anspruchszählungsdaten in einer Versicherungsumgebung begann ich mit Poisson, bemerkte dann aber eine Überdispersion. Ein Quasi-Poisson-Modell modellierte die größere Mittelwert-Varianz-Beziehung besser als das Basis-Poisson-Modell, aber ich bemerkte, dass die Koeffizienten sowohl im Poisson- als auch im Quasi-Poisson-Modell identisch waren. Wenn dies kein Fehler ist, warum geschieht dies? …

2
Ableitung eines Gaußschen Prozesses
Ich glaube, dass die Ableitung eines Gaußschen Prozesses (GP) eine andere GP ist, und daher würde ich gerne wissen, ob es geschlossene Formgleichungen für die Vorhersagegleichungen der Ableitung eines GP gibt. Insbesondere verwende ich den quadratisch exponentiellen (auch als Gauß'schen) Kovarianzkern und möchte wissen, wie Vorhersagen über die Ableitung des …

4
Hinweise darauf, dass ein Problem für die lineare Regression gut geeignet ist
Ich lerne die lineare Regression mithilfe der Einführung in die lineare Regressionsanalyse von Montgomery, Peck und Vining . Ich möchte ein Datenanalyseprojekt auswählen. Ich habe den naiven Gedanken, dass eine lineare Regression nur dann geeignet ist, wenn man vermutet, dass es lineare funktionale Beziehungen zwischen erklärenden Variablen und der Antwortvariablen …


1
Anpassungstest in der logistischen Regression; Welche "Passform" möchten wir testen?
Ich beziehe mich auf die Frage und ihre Antworten: Wie kann die (Wahrscheinlichkeits-) Vorhersagefähigkeit von Modellen verglichen werden, die aus logistischen Regressionen entwickelt wurden? von @Clark Chong und Antworten / Kommentare von @Frank Harrell. und auf die Frage Freiheitsgrade von χ2χ2\chi^2 im Hosmer-Lemeshow-Test und die Kommentare. Ich habe den Aufsatz …

1
Ordinale logistische Regression in Python
Ich möchte eine ordinale logistische Regression in Python ausführen - für eine Antwortvariable mit drei Ebenen und einigen erklärenden Faktoren. Das statsmodelsPaket unterstützt Modelle mit binärer und multinomialer Protokollierung (MNLogit), jedoch keine geordnete Protokollierung. Da die zugrunde liegende Mathematik nicht so unterschiedlich ist, frage ich mich, ob sie mit diesen …


2
Erfassung von Anfangsmustern bei Verwendung der verkürzten Backpropagation durch die Zeit (RNN / LSTM)
Angenommen, ich verwende ein RNN / LSTM, um eine Stimmungsanalyse durchzuführen, bei der es sich um einen 1: 1-Ansatz handelt (siehe diesen Blog ). Das Netzwerk wird durch eine verkürzte Backpropagation Through Time (BPTT) trainiert, bei der das Netzwerk wie gewohnt nur für 30 letzte Schritte abgewickelt wird. In meinem …


5
Ist automatisiertes maschinelles Lernen ein Traum?
Wenn ich maschinelles Lernen entdecke, sehe ich verschiedene interessante Techniken wie: automatisch tune Algorithmen mit Techniken wie grid search, Erhalten Sie genauere Ergebnisse durch die Kombination verschiedener Algorithmen desselben "Typs" boosting. Erhalten Sie genauere Ergebnisse durch die Kombination verschiedener Algorithmen (aber nicht derselben Art von Algorithmen) stacking. und wahrscheinlich noch …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.