Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Modell für die Behandlung von Redundanzen mit zufälligen Effekten
Ich versuche, mit einer Time-to-Event-Analyse unter Verwendung wiederholter binärer Ergebnisse umzugehen. Angenommen, die Zeit bis zum Ereignis wird in Tagen gemessen, aber im Moment diskretisieren wir die Zeit auf Wochen. Ich möchte einen Kaplan-Meier-Schätzer mit wiederholten binären Ergebnissen approximieren (aber Kovariaten berücksichtigen). Dies scheint ein Umweg zu sein, aber ich …




2
Wie finde ich die Kovarianzmatrix eines Polygons?
Stellen Sie sich vor, Sie haben ein Polygon, das durch einen Satz von Koordinaten und dessen Schwerpunkt bei . Sie können das Polygon als gleichmäßige Verteilung mit einer polygonalen Grenze behandeln. (x1,y1)...(xn,yn)(x1,y1)...(xn,yn)(x_1,y_1)...(x_n,y_n)(0,0)(0,0)(0,0) Ich bin nach einer Methode, die die Kovarianzmatrix eines Polygons findet . Ich vermute, dass die Kovarianzmatrix eines …

2
Wie ob ?
Angenommen, ich habe drei unabhängige Gruppen mit dem Mittelwert .μ1, μ2, μ3μ1, μ2, μ3\mu_1,~ \mu_2,~\mu_3 Wie kann ich testen, ob oder nicht, indem Proben aus jeder Gruppe verwende?μ1&lt;μ2&lt;μ3μ1&lt;μ2&lt;μ3\mu_1 < \mu_2 <\mu_3n1, n2, n3n1, n2, n3n_1,~n_2,~n_3 Ich möchte eine allgemeine Methodik kennen, keine detaillierte Berechnung. Ich konnte nicht herausfinden, wie ich …

2
Wahrscheinlichkeit von
Angenommen, und sind unabhängige geometrische Zufallsvariablen mit dem Parameter . Wie ist die Wahrscheinlichkeit, dass ?X1X1X_1X2X2X_2pppX1≥X2X1≥X2X_1 \geq X_2 Ich bin verwirrt über diese Frage, weil uns nichts anderes über und gesagt wird, als dass sie geometrisch sind. Wäre das nicht weil und alles im Bereich sein können?X1X1X_1X2X2X_250%50%50\%X1X1X_1X2X2X_2 EDIT: Neuer Versuch …

3
So reduzieren Sie Prädiktoren auf die richtige Weise für ein logistisches Regressionsmodell
Daher habe ich einige Bücher (oder Teile davon) über Modellierung gelesen (unter anderem F. Harrells "Regressionsmodellierungsstrategien"), da ich derzeit ein logistisches Modell erstellen muss, das auf binären Antwortdaten basiert. Ich habe sowohl kontinuierliche, kategoriale als auch binäre Daten (Prädiktoren) in meinem Datensatz. Grundsätzlich habe ich momentan ungefähr 100 Prädiktoren, was …

1
Warum konzentriert sich der Bayes'sche Posterior um den Minimierer der KL-Divergenz?
Betrachten Sie die Bayes - posterior θ∣Xθ∣X\theta\mid X . Asymptotisch tritt ihr Maximum bei der Schätzung MLE θ , der nur die Wahrscheinlichkeit maximiert argmin θθ^θ^\hat \thetaargminθfθ(X)argminθfθ(X)\operatorname{argmin}_\theta\, f_\theta(X) . Alle diese Konzepte - Bayesianische Prioritäten, die die Wahrscheinlichkeit maximieren - klingen super prinzipiell und überhaupt nicht willkürlich. Es ist kein …

2
Warum ist die logistische Regression gut kalibriert und wie kann ihre Kalibrierung ruiniert werden?
In den Scikit-Lerndokumenten zur Wahrscheinlichkeitskalibrierung vergleichen sie die logistische Regression mit anderen Methoden und stellen fest, dass die zufällige Gesamtstruktur weniger gut kalibriert ist als die logistische Regression. Warum ist die logistische Regression gut kalibriert? Wie könnte man die Kalibrierung einer logistischen Regression ruinieren (nicht, dass man es jemals wollen …

2
Unsicherheitsschätzung bei hochdimensionalen Inferenzproblemen ohne Abtastung?
Ich arbeite an einem hochdimensionalen Inferenzproblem (ca. 2000 Modellparameter), für das wir eine MAP-Schätzung robust durchführen können, indem wir das globale Maximum des log-posterior unter Verwendung einer Kombination aus gradientenbasierter Optimierung und einem genetischen Algorithmus ermitteln. Ich würde sehr gerne in der Lage sein, zusätzlich zur MAP-Schätzung eine Schätzung der …


1
Warum gehen Informationen über die Validierungsdaten verloren, wenn ich beim Optimieren von Hyperparametern die Modellleistung anhand von Validierungsdaten bewerte?
In François Chollets Deep Learning with Python heißt es: Infolgedessen kann das Optimieren der Konfiguration des Modells basierend auf seiner Leistung im Validierungssatz schnell zu einer Überanpassung an den Validierungssatz führen, obwohl Ihr Modell niemals direkt darauf trainiert wird. Zentral für dieses Phänomen ist der Begriff der Informationslecks. Jedes Mal, …

1
Überprüfen, ob eine Münze fair ist
Die folgende Frage wurde mir von einem Freund gestellt. Ich konnte ihr nicht helfen, aber ich hoffe, jemand kann es mir erklären. Ich konnte kein ähnliches Beispiel finden. Vielen Dank für Hilfe und Erklärung. F: Die Ergebnisse von 100 Münzwurfversuchen werden als 0 = "Schwanz" und 1 = "Kopf" aufgezeichnet. …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.