Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
"Umgekehrt" Shapiro-Wilk
Der Sharipo-Wilk-Test testet laut Wikipedia die Nullhypothese ( ) "Die Population ist normal verteilt".H0H0H_0 Ich suche einen ähnlichen Normalitätstest mit "Die Bevölkerung ist nicht normal verteilt".H0H0H_0 Mit einem solchen Test möchte ich einen Wert berechnen , um H 0 auf dem Signifikanzniveau α abzulehnen, wenn p < α ist ; …

1
Berechnungsschwelle für Mindestrisikoklassifikator?
Angenommen, zwei Klassen C1C1C_1 und haben ein Attribut und die Verteilung und . wenn wir gleich vor für folgende Kostenmatrix haben:C2C2C_2xxxN(0,0.5)N(0,0.5) \cal{N} (0, 0.5)N(1,0.5)N(1,0.5) \cal{N} (1, 0.5)P(C1)=P(C2)=0.5P(C1)=P(C2)=0.5P(C_1)=P(C_2)=0.5 L=[010.50]L=[00.510]L= \begin{bmatrix} 0 & 0.5 \\ 1 & 0 \end{bmatrix} Warum ist der Schwellenwert für den Klassifikator für das minimale Risiko (Kosten)?x0&lt;0.5x0&lt;0,5x_0 < …

1
Modelldesign mit gemischten Effekten und Stichprobenvariable
Ich versuche, eine Formel für ein lineares Mischeffektmodell (mit lme4) für mein experimentelles Design anzugeben , bin mir aber nicht sicher, ob ich es richtig mache. Das Design: Im Grunde messe ich einen Antwortparameter an Pflanzen. Ich habe 4 Behandlungsstufen und 2 Bewässerungsstufen. Die Pflanzen sind in 16 Parzellen gruppiert, …

3
Wie wird eine Faktoranalyse durchgeführt, wenn die Kovarianzmatrix nicht eindeutig positiv ist?
Ich habe einen Datensatz, der aus 717 Beobachtungen (Zeilen) besteht, die durch 33 Variablen (Spalten) beschrieben werden. Die Daten werden durch Z-Scoring aller Variablen standardisiert. Keine zwei Variablen sind linear abhängig ( ). Ich habe auch alle Variablen mit sehr geringer Varianz (weniger als ) entfernt. Die folgende Abbildung zeigt …

2
Wirf einen 6-seitigen Würfel, bis die Summe
Hier ist die Frage: Sie würfeln iterativ einen fairen 6-seitigen Würfel, bis die Summe der Würfelwürfe größer oder gleich M ist. Was ist der Mittelwert und die Standardabweichung der Summe minus M, wenn M = 300? Sollte ich einen Code schreiben, um diese Art von Fragen zu beantworten? Bitte geben …

1
Wie wähle ich die beste Anpassung aus, ohne die Daten zu überanpassen? Modellierung einer bimodalen Verteilung mit N Normalfunktionen usw.
Ich habe eine offensichtlich bimodale Werteverteilung, die ich anpassen möchte. Die Daten können entweder mit 2 normalen Funktionen (bimodal) oder mit 3 normalen Funktionen gut angepasst werden. Darüber hinaus gibt es einen plausiblen physikalischen Grund für die Anpassung der Daten an 3. Je mehr Parameter eingeführt werden, desto perfekter ist …

1
Testen Sie das GLM-Modell mit Null und Modellabweichungen
Ich habe ein glm-Modell in R erstellt und es mithilfe einer Test- und Trainingsgruppe getestet. Ich bin daher zuversichtlich, dass es gut funktioniert. Die Ergebnisse von R sind: Coefficients: Estimate Std. Error t value Pr(&gt;|t|) (Intercept) -2.781e+00 1.677e-02 -165.789 &lt; 2e-16 *** Coeff_A 1.663e-05 5.438e-06 3.059 0.00222 ** log(Coeff_B) 8.925e-01 …


1
Wie interpretiere ich die Lavaan-Ausgabe?
Ich versuche eine Bestätigungsfaktoranalyse (CFA) mit lavaan. Es fällt mir schwer, die Ausgabe von zu interpretieren lavaan. Ich habe ein einfaches Modell - 4 Faktoren, die jeweils durch Elemente aus gesammelten Umfragedaten unterstützt werden. Die Faktoren stimmen mit dem überein, was von den Elementen gemessen wird, sofern es wahrscheinlich ist, …

2
VC-Dimension von Regressionsmodellen
In der Vorlesungsreihe Learning from Data erwähnt der Professor, dass die VC-Dimension die Komplexität des Modells daran misst, wie viele Punkte ein bestimmtes Modell zerbrechen kann. Dies funktioniert also perfekt für Klassifizierungsmodelle, bei denen wir aus N Punkten sagen können, ob der Klassifizierer in der Lage ist, k Punkte effektiv …



1
Was konvergiert schneller, Mittelwert oder Median?
Wenn ich iid-Variablen aus N (0,1) zeichne, konvergiert dann der Mittelwert oder der Median schneller? Wie viel schneller? Um genauer zu sein, sei eine Folge von iid-Variablen, die aus N (0,1) gezogen werden. Definieren Sie und als Median von . Was konvergiert schneller zu 0, oder ?x1,x2,…x1,x2,…x_1, x_2, \ldots x¯n=1n∑ni=1xix¯n=1n∑i=1nxi\bar{x}_n …


2
Wann unterscheiden sich die durch logistische und logitlineare Regression geschätzten Koeffizienten?
Bei der Modellierung kontinuierlicher Proportionen (z. B. proportionale Vegetationsbedeckung bei Erhebungsquadraten oder Anteil der Zeit, die an einer Aktivität beteiligt ist) wird die logistische Regression als unangemessen angesehen (z. B. Warton &amp; Hui (2011). Der Arkussinus ist asinin: die Analyse der Proportionen in der Ökologie ). Vielmehr ist eine OLS-Regression …
11 r  regression  logistic 

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.