Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Likelihood-Ratio-Test in R
Angenommen, ich werde eine univariate logistische Regression für mehrere unabhängige Variablen durchführen: mod.a <- glm(x ~ a, data=z, family=binominal("logistic")) mod.b <- glm(x ~ b, data=z, family=binominal("logistic")) Ich habe einen Modellvergleich (Likelihood Ratio Test) durchgeführt, um festzustellen, ob das Modell mit diesem Befehl besser ist als das Nullmodell 1-pchisq(mod.a$null.deviance-mod.a$deviance, mod.a$df.null-mod.a$df.residual) Dann …
25 r  logistic  diagnostic 

8
Wie kann man abschätzen, wie viele Personen an einer Veranstaltung teilgenommen haben (z. B. an einer politischen Versammlung)?
Ein Student fragte mich heute: "Woher wissen sie, wie viele Menschen an einer Großgruppenveranstaltung teilgenommen haben, zum Beispiel an der Stewart / Colbert 'Rallye zur Wiederherstellung der Gesundheit' in Washington DC?" Nachrichtenagenturen geben Schätzungen in zehntausenden von Fällen an, aber mit welchen Methoden werden diese Schätzungen ermittelt, und wie zuverlässig …


4
Frage in Vorstellungsgesprächen bei Amoeba
Diese Frage wurde mir während eines Interviews für eine Handelsposition bei einer Eigenhandelsfirma gestellt. Ich würde sehr gerne die Antwort auf diese Frage und die Intuition dahinter wissen. Amöben Frage: Eine Amöbenpopulation beginnt mit 1. Nach 1 Periode kann sich die Amöbe mit gleicher Wahrscheinlichkeit in 1, 2, 3 oder …

2
Zuverlässigkeit zwischen Bewertern für Ordnungs- oder Intervalldaten
Welche Zuverlässigkeitsmethoden zwischen Bewertern eignen sich am besten für Ordnungs- oder Intervalldaten? Ich glaube, dass "Joint Probability of Agreement" oder "Kappa" für Nenndaten ausgelegt sind. Während "Pearson" und "Spearman" verwendet werden können, werden sie hauptsächlich für zwei Bewerter verwendet (obwohl sie für mehr als zwei Bewerter verwendet werden können). Welche …

2
Wie gehe ich mit explorativer Datenanalyse und Datenbaggerung in Studien mit kleinen Stichproben um?
Die explorative Datenanalyse (EDA) führt häufig dazu, dass andere "Spuren" untersucht werden, die nicht unbedingt zum ursprünglichen Satz von Hypothesen gehören. Bei Studien mit einer begrenzten Stichprobengröße und einer Vielzahl von Daten, die über verschiedene Fragebögen gesammelt wurden (soziodemografische Daten, neuropsychologische oder medizinische Maßstäbe - z. B. geistige oder körperliche …

3
Visualisierung von Likert Item-Antwortdaten
Was sind gute Möglichkeiten, um Likert-Antworten zu visualisieren? Zum Beispiel eine Reihe von Elementen, die nach der Wichtigkeit von X für Entscheidungen über A, B, C, D, E, F und G fragen? Gibt es etwas Besseres als gestapelte Balkendiagramme? Was ist mit Antworten von N / A zu tun? Wie …


3
Gradient des Scharnierverlustes
Ich versuche, eine grundlegende Gradientenabsenkung zu implementieren und teste sie mit einer Scharnierverlustfunktion, dh . Ich bin jedoch verwirrt über den Gradienten des Scharnierverlustes. Ich habe den Eindruck, dass es so istlhinge=max(0,1−y x⋅w)lhinge=max(0,1−y x⋅w)l_{\text{hinge}} = \max(0,1-y\ \boldsymbol{x}\cdot\boldsymbol{w}) ∂∂wlhinge={−y x0if y x⋅w<1if y x⋅w≥1∂∂wlhinge={−y xif y x⋅w<10if y x⋅w≥1 \frac{\partial }{\partial …


5
Ich suche nach einer bestimmten Art von ARIMA-Erklärung
Diese nur schwer zu finden, aber ich möchte ein lesen gut erklärt ARIMA Beispiel , dass verwendet minimale Mathematik erweitert die Diskussion über die Erstellung eines Modells hinaus auf die Verwendung dieses Modells zur Vorhersage spezifischer Fälle Verwendet Grafiken sowie numerische Ergebnisse, um die Übereinstimmung zwischen prognostizierten und tatsächlichen Werten …


3
LASSO mit Interaktionsbegriffen - ist es in Ordnung, wenn die Haupteffekte auf Null geschrumpft sind?
Die LASSO-Regression verringert die Koeffizienten auf Null und bietet so eine effektive Modellauswahl. Ich glaube, dass es in meinen Daten bedeutsame Wechselwirkungen zwischen nominalen und kontinuierlichen Kovariaten gibt. Nicht unbedingt sind jedoch die "Haupteffekte" des wahren Modells aussagekräftig (nicht Null). Natürlich weiß ich das nicht, da das wahre Modell unbekannt …


6
Zeigt der Gradient in Stochastic Gradient Descent (SGD) bei konvexen Problemen immer auf den globalen Extremwert?
Bei einer konvexen Kostenfunktion, bei der SGD für die Optimierung verwendet wird, haben wir zu einem bestimmten Zeitpunkt während des Optimierungsprozesses einen Gradienten (Vektor). Meine Frage ist, angesichts des Punktes auf der Konvexen, zeigt der Gradient nur in die Richtung, in die die Funktion am schnellsten zunimmt / abnimmt, oder …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.