Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Versteckte Zustandsmodelle vs. staatenlose Modelle für die Zeitreihenregression
Dies ist eine recht allgemeine Frage: Angenommen, ich möchte ein Modell erstellen, um die nächste Beobachtung basierend auf den vorherigen Beobachtungen vorherzusagen ( kann ein Parameter zur experimentellen Optimierung sein). Wir haben also im Grunde ein Schiebefenster mit Eingabemerkmalen, um die nächste Beobachtung vorherzusagen.N.NNNNNN Ich kann einen Hidden-Markov-Modell-Ansatz verwenden, dh …





1
Würde es ein Modellauswahlproblem geben, wenn wir Zugriff auf ein Orakel hätten, das uns den genauen Generalisierungsfehler gegeben hätte?
Sei eine Funktion, die bei gegebener Hypothese den Generalisierungsfehler für dieses feste zurückgibt .E.( h )E.(h)\mathcal{E(h)}hhhhhh Ich habe einige Anmerkungen zur Modellauswahl und zum Generalisierungsfehler gelesen und darin stand: "Wenn wir Zugriff auf , gäbe es auch kein Problem bei der Modellauswahl. Wir würden einfach die großen auswählen , um …

1
Wie können Epidemiologen / Mitarbeiter des öffentlichen Gesundheitswesens sanft in die fortschrittliche Vorhersagemodellierung eingeführt werden?
Aus sozialwissenschaftlichen und epidemiologischen Gründen wurden meine Mitarbeiter in Regression der kleinsten Quadrate, logistischer Regression und Überlebensanalyse geschult. Sie möchten 95% -Konfidenzintervalle und p-Werte mit den Parameterkoeffizienten sehen und misstrauen aktuelleren Vorhersagewerkzeugen wie neuronalen Netzen, CART, Bagging & Boosting sowie bestraften Regressionstechniken.


1
Wahrscheinlichkeit vs. Wahrscheinlichkeit
Ich habe Schwierigkeiten mit Wahrscheinlichkeiten . Ich verstehe den Satz von Bayes p(A|B,H)=p(B|A,H)p(A|H)p(B|H)p(A|B,H)=p(B|A,H)p(A|H)p(B|H)p(A|B, \mathcal{H}) = \frac{p(B|A, \mathcal{H}) p(A|\mathcal{H})}{p(B|\mathcal{H})} was direkt aus der Anwendung von . In meiner Interpretation sind die -Funktionen im Bayes-Theorem also irgendwie alle Wahrscheinlichkeiten, entweder marginal oder bedingt. Ich habe also tatsächlich gedacht, dass die Wahrscheinlichkeit als …

1
Bei der Optimierung eines logistischen Regressionsmodells führen manchmal mehr Daten dazu, dass die Dinge * schneller * laufen. Irgendeine Idee warum?
Ich habe mit logistischer Regression mit verschiedenen Batch-Optimierungsalgorithmen (konjugierter Gradient, Newton-Raphson und verschiedene Quasinewton-Methoden) herumgespielt. Eine Sache, die mir aufgefallen ist, ist, dass das Hinzufügen von mehr Daten zu einem Modell manchmal dazu führen kann, dass das Training des Modells viel weniger Zeit in Anspruch nimmt. Für jede Iteration müssen …


1
Polynomterm in der logistischen Regression
Ich habe ein logistisches Regressionsmodell erstellt, das einen Polynomterm bis Grad 2 enthält. Mir ist bekannt, dass die logistische Regression die Antwortvariable als nichtlineare Funktion der Prädiktoren modelliert. Ist es sinnvoll, einen Polynombegriff in die logistische Regression einzubeziehen?

2
Kann die effektive Stichprobengröße in der MCMC-Simulation größer sein als die tatsächliche Stichprobengröße?
Ich habe Coda-Pakete verwendet effectiveSize(), um die effektive Stichprobengröße meiner MCMC-Simulation zu ermitteln. Meine effektive Stichprobengröße ist größer als die tatsächliche Stichprobengröße, z. B. 9813,626 größer als 9501. Ich frage mich, ob das sinnvoll ist. Mein Verständnis ist, dass die effektive Stichprobengröße nicht größer als die tatsächliche Stichprobengröße sein kann …

2
Überlappender Proben-T-Test
Ich habe 10 Leute, die zusammenarbeiten. Sie arbeiten 6 Tage lang in Gruppen: Drei Tage in Woche 1, drei Tage in Woche 2. An jedem Tag habe ich nicht die gesamte Gruppe von Personen, sondern eine Untergruppe von ihnen. An jedem Tag messe ich die einzelnen Leistungen. Ich muss sagen, …

1
Was ist die Autokorrelationsfunktion einer Zeitreihe, die sich aus der Berechnung einer sich bewegenden Standardabweichung ergibt?
Angenommen, ich habe eine Zeitreihe von Beobachtungen und berechne ein Maß für die Varianz dieser Zeitreihe als Standardabweichung (SD) in einem rollenden Fenster der Breite und dieses Fenster wird in einzelnen Zeitschritten über die Reihe verschoben. Nehmen wir weiter an, dass , wobei die Anzahl der Beobachtungen ist und dass …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.