Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
WARENKORB: Auswahl des besten Prädiktors für die Aufteilung, wenn die Gewinne bei der Abnahme der Verunreinigungen gleich sind?
Meine Frage befasst sich mit Klassifikationsbäumen . Betrachten Sie das folgende Beispiel aus dem Iris-Datensatz: Ich möchte den besten Prädiktor für die erste Aufteilung manuell auswählen. Nach dem CART-Algorithmus ist das beste Merkmal für eine Aufteilung dasjenige, das die Abnahme der Verunreinigung der Partition maximiert, auch Gini-Verstärkung genannt: G i …


2
Kann jemand erklären, was das Foldid-Argument in glmnet bewirkt?
Ich versuche zu bestimmen, welches Alpha in meiner glmnetFunktion verwendet werden soll, aber die Hilfedatei sagt mir: Beachten Sie, dass cv.glmnet NICHT nach Werten für Alpha sucht. Es sollte ein bestimmter Wert angegeben werden, andernfalls wird standardmäßig Alpha = 1 angenommen. Wenn Benutzer auch Alpha kreuzvalidieren möchten , sollten sie …






2
Anwendung der Rubin-Regel zum Kombinieren mehrfach unterstellter Datensätze
Ich hoffe, die Ergebnisse einer ziemlich einfachen Analyse zusammenfassen zu können, die mit mehrfach unterstellten Daten durchgeführt wurde (z. B. multiple Regression, ANOVA). Die mehrfache Imputation und die Analysen wurden in SPSS abgeschlossen, aber SPSS liefert keine gepoolten Ergebnisse für einige Statistiken, einschließlich F-Wert, Kovarianzmatrix, R-Quadrat usw. Ich habe einige …

1
Regression ohne Abfangen: Ableiten von in kleinsten Quadraten (keine Matrizen)
In einer Einführung in das statistische Lernen (James et al.) In Abschnitt 3.7, Übung 5, heißt es, dass die Formel für Annahme einer linearen Regression ohne Achsenabschnitt lautet wobei und sind die unter OLS üblichen Schätzungen für einfache lineare Regression ( ).β^1β^1\hat{\beta}_1& bgr;0=ˉy-β1ˉxβ1=Sxyβ^1= ∑i = 1nxichyich∑i = 1nx2ich,β^1=∑i=1nxiyi∑i=1nxi2,\hat{\beta}_1 = \dfrac{\displaystyle\sum\limits_{i=1}^{n}x_iy_i}{\displaystyle …


1
Mehrere ARIMA-Modelle passen gut zu Daten. Wie bestimme ich die Reihenfolge? Richtiger Ansatz?
Ich habe zwei Zeitreihen (Parameter eines Modells für Männer und Frauen) und möchte ein geeignetes ARIMA-Modell identifizieren, um Prognosen zu erstellen. Meine Zeitreihe sieht aus wie: Die Darstellung und der ACF sind instationär (die Spitzen des ACF schneiden sehr langsam ab). Daher verwende ich Differenzierung und erhalte: Dieses Diagramm zeigt, …

1
Wird angenommen, dass Gruppeneffekte in einem Modell mit gemischten Effekten aus einer Normalverteilung ausgewählt wurden?
Angenommen, wir sind daran interessiert, wie sich die Anzahl der Stunden, die diese Schüler studieren, auf die Noten der Schülerprüfungen auswirkt. Wir befragen Schüler aus verschiedenen Schulen. Wir führen das folgende Modell mit gemischten Effekten aus: Exam.gradesich= a + β1× Stunden studiertich+ Schulej+ eichexam.gradesi=a+β1×hours.studiedi+schoolj+ei \text{exam.grades}_i = a + \beta_1 \times …

1
Grundlegendes zur Warnmeldung „Krawatten sind vorhanden“ in Kruskal-Wallis post hoc
Ich führe Post-hoc-Vergleiche nach einem Kruskal-Wallis-Test durch. Ich verwende das PMCMR- Paket. > posthoc.kruskal.nemenyi.test( preference ~ instrument) Pairwise comparisons using Tukey and Kramer (Nemenyi) test with Tukey-Dist approximation for independent samples data: preference by instrument Cello Drums Guitar Drums 0.157 - - Guitar 0.400 0.953 - Harp 0.013 0.783 0.458 …
8 r  ties 

3
Wahrscheinlichkeit von 10000: 1 Wahrscheinlichkeit tritt genau einmal in 10.000 Versuchen auf
Ich bin daran interessiert, den Unterschied zwischen der "Wahrscheinlichkeit" eines zufälligen Ereignisses und einer bestimmten Wahrscheinlichkeit, die tatsächlich auftritt, genau so zu verstehen, wie es als wahrscheinlich bezeichnet wird. dh wenn ein Ereignis eine Wahrscheinlichkeit von 1 zu 10000 hat, wie hoch ist die Wahrscheinlichkeit, dass es in 10000 Versuchen …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.