Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Warum ist das arithmetische Mittel kleiner als das Verteilungsmittel in einer logarithmischen Normalverteilung?
Ich habe also einen zufälligen Prozess, der logarithmisch normalverteilte Zufallsvariablen . Hier ist die entsprechende Wahrscheinlichkeitsdichtefunktion:XXX Ich wollte die Verteilung einiger Momente dieser ursprünglichen Verteilung schätzen , sagen wir den ersten Moment: das arithmetische Mittel. Zu diesem Zweck habe ich 100 Zufallsvariablen 10000-mal gezeichnet, um 10000-Schätzungen des arithmetischen Mittels zu …

2
Aus einem frequentistischen Ergebnis einen Bayesianischen Prior machen
Wie sollte man ein frequentistisches Ergebnis in einen bayesianischen Prior verwandeln? Stellen Sie sich das folgende ziemlich allgemeine Szenario vor: In der Vergangenheit wurde ein Experiment durchgeführt und ein Ergebnis für einen Parameter ϕϕ\phi gemessen. Die Analyse wurde mit einer frequentistischen Methodik durchgeführt. Ein Konfidenzintervall für ϕϕ\phi ist in den …

1
Was ist der Unterschied zwischen der logistischen Regression und der Regression nach Fractional Response?
Soweit ich weiß, besteht der Unterschied zwischen dem logistischen Modell und dem Teilantwortmodell (frm) darin, dass die abhängige Variable (Y), in der frm [0,1] ist, logistisch jedoch {0, 1} ist. Ferner verwendet frm den Quasi-Likelihood-Schätzer, um seine Parameter zu bestimmen. Normalerweise können wir verwenden glm, um die logistischen Modelle von …

4
Vorhersageintervalle für Algorithmen für maschinelles Lernen
Ich möchte wissen, ob der unten beschriebene Prozess gültig / akzeptabel ist und ob eine Begründung vorliegt. Die Idee: Überwachte Lernalgorithmen setzen keine zugrunde liegenden Strukturen / Verteilungen der Daten voraus. Am Ende des Tages geben sie Punktschätzungen aus. Ich hoffe, die Unsicherheit der Schätzungen irgendwie zu quantifizieren. Der Prozess …

1
Vorgabe der Effektgröße in der Metaanalyse
Meine Frage betrifft priors auf Effektgrößen, in meinem Projekt die Maßnahme Cohens . Durch das Lesen der Literatur scheint es, dass vage Prioritäten häufig verwendet werden, wie in den bekannten acht Schulen am Beispiel einer hierarchischen Bayes'schen Metaanalyse. Im Beispiel der acht Schulen habe ich ein vages Prior gesehen, das …

1
Verhinderung einer Überanpassung von LSTM bei kleinen Datenmengen
Ich modelliere 15000 Tweets für die Stimmungsvorhersage unter Verwendung eines einschichtigen LSTM mit 128 verborgenen Einheiten unter Verwendung einer word2vec-ähnlichen Darstellung mit 80 Dimensionen. Nach 1 Epoche erhalte ich eine Abstiegsgenauigkeit (38% bei Zufall = 20%). Mehr Training führt dazu, dass die Validierungsgenauigkeit abnimmt, wenn die Trainingsgenauigkeit zu steigen beginnt …

4
Warum gibt es immer mindestens eine Richtlinie, die besser oder gleich allen anderen Richtlinien ist?
Reinforcement Learning: Eine Einführung. Zweite Auflage, in Bearbeitung . Richard S. Sutton und Andrew G. Barto (c) 2012, S. 67-68. Das Lösen einer Bestärkungslernaufgabe bedeutet ungefähr, eine Politik zu finden, die auf lange Sicht eine Menge Belohnung bringt. Für endliche MDPs können wir eine optimale Richtlinie auf folgende Weise präzise …



2
Unabhängiger Stichproben-T-Test: Müssen Daten bei großen Stichproben wirklich normal verteilt werden?
Angenommen, ich möchte testen, ob zwei unabhängige Stichproben unterschiedliche Mittelwerte haben. Ich weiß, dass die zugrunde liegende Verteilung nicht normal ist . Wenn ich das richtig verstehe, ist meine Teststatistik der Mittelwert , und bei ausreichend großen Stichproben sollte der Mittelwert normalverteilt sein, auch wenn die Stichproben nicht vorhanden sind. …

2
Was sind die bekannten praktischen Anwendungen der Chaostheorie im Data Mining?
Während ich in den letzten Jahren gelegentlich einige Massenmarktwerke zur Chaostheorie las, begann ich mich zu fragen, wie verschiedene Aspekte davon auf Data Mining und verwandte Bereiche wie neuronale Netze, Mustererkennung, Unsicherheitsmanagement usw. angewendet werden könnten Ich habe so wenige Beispiele für solche Anwendungen in der veröffentlichten Forschung gefunden, dass …


3
Wie können maschinelle Lernmodelle (GBM, NN usw.) für die Überlebensanalyse verwendet werden?
Ich weiß , dass traditionelle statistische Modelle wie Cox Proportional - Hazards - Regression und einige Kaplan-Meier - Modelle verwendet werden können Tage bis zum nächsten Auftreten eines Ereignisses sagt Ausfall etc. dh zur Vorhersage überleben Analyse Fragen Wie können Regressionsversionen von Modellen für maschinelles Lernen wie GBM, neuronale Netze …

2
Laymans Erklärung der Zensur in der Überlebensanalyse
Ich habe gelesen, was Zensur ist und wie sie in der Überlebensanalyse berücksichtigt werden muss, aber ich würde gerne eine weniger mathematische Definition und eine intuitivere Definition hören (Bilder wären toll!). Kann mir jemand eine Erklärung zu 1) Zensur und 2) Auswirkungen wie Kaplan-Meier-Kurven und Cox-Regression geben?

1
Bewerten Sie Random Forest: OOB vs CV
Wenn wir die Qualität einer zufälligen Gesamtstruktur beurteilen, zum Beispiel mithilfe der AUC, ist es angemessener, diese Mengen anhand der Out-of-Bag-Proben oder anhand des Hold-out-Satzes der Kreuzvalidierung zu berechnen. Ich habe gehört, dass die Berechnung über die OOB-Samples eine pessimistischere Einschätzung ergibt, aber ich verstehe nicht, warum.

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.