Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Wie verwende ich Anova für den Vergleich zweier Modelle?
Wie soll ich das anovaErgebnis beim Vergleich zweier Modelle verstehen ? Beispiel: Res.Df RSS Df Sum of Sq F Pr(>F) 1 9 54.032 2 7 4.632 2 49.4 37.329 0.0001844 *** In der Manpage heißt es: "Berechnen Sie die Analyse von Varianz- (oder Abweichungs-) Tabellen für ein oder mehrere angepasste …
9 r  regression  anova 

1
Abgleichen von Boosted-Regressionsbäumen (BRT), Generalized-Boosted-Modellen (GBM) und Gradienten-Boosting-Maschine (GBM)
Fragen: Was ist der Unterschied zwischen Boosted Regression Tree (BRT) und Generalized Boosted Models (GBM)? Können sie austauschbar verwendet werden? Ist das eine eine bestimmte Form des anderen? Warum verwendete Ridgeway den Ausdruck "Generalized Boosted Regression Models" (GBM), um zu beschreiben, was Friedman zuvor als "Gradient Boosting Machine" (GBM) vorgeschlagen …

2
Backtesting oder Kreuzvalidierung, wenn der Modellbildungsprozess interaktiv war
Ich habe einige Vorhersagemodelle, deren Leistung ich zurücktesten möchte (dh ich nehme meinen Datensatz, spule ihn zu einem früheren Zeitpunkt zurück und sehe, wie sich das Modell prospektiv entwickelt hätte). Das Problem ist, dass einige meiner Modelle über einen interaktiven Prozess erstellt wurden. Zum Beispiel habe ich gemäß den Ratschlägen …


1
Wie hoch ist bei zwei absorbierenden Markov-Ketten die Wahrscheinlichkeit, dass eine vor der anderen endet?
Ich habe zwei verschiedene Markov-Ketten mit jeweils einem absorbierenden Zustand und einer bekannten Ausgangsposition. Ich möchte die Wahrscheinlichkeit bestimmen, dass Kette 1 in weniger Schritten einen absorbierenden Zustand erreicht als Kette 2. Ich denke, ich kann die Wahrscheinlichkeit berechnen, nach n Schritten einen absorbierenden Zustand in einer bestimmten Kette zu …


1
Wie finde und bewerte ich die optimale Diskretisierung für eine kontinuierliche Variable mit dem Kriterium ?
Ich habe einen Datensatz mit kontinuierlicher Variable und einer binären Zielvariablen (0 und 1). Ich muss die kontinuierlichen Variablen (für die logistische Regression) in Bezug auf die Zielvariable und mit der Einschränkung diskretisieren, dass die Beobachtungshäufigkeit in jedem Intervall ausgeglichen sein sollte. Ich habe maschinelle Lernalgorithmen wie Chi Merge und …

2
Erfassen CART-Bäume Interaktionen zwischen Prädiktoren?
In diesem Artikel wird behauptet, dass in CART, da bei jedem Schritt eine binäre Aufteilung an einer einzelnen Kovariate durchgeführt wird, alle Aufteilungen orthogonal sind und daher Wechselwirkungen zwischen Kovariaten nicht berücksichtigt werden. Viele sehr ernsthafte Referenzen behaupten jedoch im Gegenteil, dass die hierarchische Struktur eines Baums garantiert, dass Interaktionen …

4
Fisher-Exakttest auf gepaarte Daten
Bei Fällen mit Lungenkrebs und übereinstimmenden Kontrollen (ohne Lungenkrebs) (Übereinstimmung basierend auf Alter, Geschlecht usw.). Um Beweise für die Auswirkung des Rauchens auf Lungenkrebs zu finden, habe ich den genauen Fisher-Test in der Kontingenztabelle verwendet. Dies berücksichtigte jedoch nicht, dass die Kontrollen und Fälle übereinstimmten. 404040404040 Also habe ich mich …

2
Wie kann ich diese Daten verwenden, um Marker mit unterschiedlicher Großzügigkeit bei der Bewertung von Studienarbeiten zu kalibrieren?
12 Lehrer unterrichten 600 Schüler. Die 12 von diesen Lehrern unterrichteten Kohorten haben eine Größe von 40 bis 90 Schülern, und wir erwarten systematische Unterschiede zwischen den Kohorten, da Doktoranden überproportional bestimmten Kohorten zugeordnet wurden. Frühere Erfahrungen haben gezeigt, dass die Absolventen im Durchschnitt erheblich höher sind als die Studenten. …

5
Poisson-Hypothesentest für zwei Parameter
Zum Spaß nehme ich einige Daten von Anrufen aus dem Callcenter, in dem ich arbeite, und versuche, Hypothesentests für sie durchzuführen, insbesondere die Anzahl der in einer Woche eingegangenen Anrufe, und verwende eine Poisson-Verteilung, um sie anzupassen. Aufgrund des Themas meines Jobs gibt es zwei Arten von Wochen. Rufen wir …

2
Lineare Kombination von zwei zufälligen Nicht-Normalen, die immer noch zur selben Familie gehören
Es ist bekannt, dass eine lineare Kombination von 2 zufälligen Normalvariablen auch eine zufällige Normalvariable ist. Gibt es gemeinsame nicht normale Verteilungsfamilien (z. B. Weibull), die diese Eigenschaft ebenfalls teilen? Es scheint viele Gegenbeispiele zu geben. Beispielsweise ist eine lineare Kombination von Uniformen typischerweise nicht einheitlich. Gibt es insbesondere nicht …

1
Verwendung der Informationstheorie in der angewandten Datenwissenschaft
Heute bin ich auf das Buch "Informationstheorie: Eine Einführung in ein Tutorial" von James Stone gestoßen und habe ein oder zwei Momente über das Ausmaß der Verwendung der Informationstheorie in der angewandten Datenwissenschaft nachgedacht (wenn Sie mit diesem noch etwas unscharfen Begriff nicht vertraut sind, Denken Sie an Datenanalyse , …


1
Was ist der Unterschied zwischen der Konditionierung von Regressoren und der Behandlung als fixiert?
Manchmal nehmen wir an, dass Regressoren fest sind, dh sie sind nicht stochastisch. Ich denke , das bedeutet , dass alle unsere Prädiktoren, Parameterschätzungen usw. bedingungslos sind, oder? Darf ich überhaupt so weit gehen, dass es sich nicht mehr um Zufallsvariablen handelt? Wenn wir andererseits akzeptieren, dass die meisten Regressoren …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.