Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Welches binomiale Vorhersageintervall für Schwanzwahrscheinlichkeiten gut funktioniert, dh für großes
Ich arbeite an einem Problem mit den folgenden Eigenschaften. Die verfügbaren Daten sind zahlreich - in der Größenordnung vonxxx10610610^6 Der CDF unterstützt nichtnegative reelle Zahlen.F.X.FXF_X Ich kenne .F.X.FXF_X Wir können davon ausgehen, dass die Daten iid sind. Ich versuche die Wahrscheinlichkeit abzuschätzen, dass eine zukünftige Stichprobe aus unter das Stichprobenminimum …

1
Gibt es einen Unterschied zwischen der Schätzung von und in einer Simulationsstudie?
Gibt es in einer Simulationsstudie einen Unterschied zwischen ∙∙\bullet schätzt die Varianz , mal und nimmt ihren Durchschnitt undσ2σ2\sigma^2100010001000 ∙∙\bullet Abschätzen der Standardabweichung , mal und seine durchschnittliche Einnahme?σσ\sigma100010001000 Kann ich irgendjemanden davon machen? Gibt es eine Präferenz für eine bestimmte?

1
Poisson-Abweichung (xgboost vs gbm vs Regression)
Ich würde gerne wissen, welches der Abweichungsausdruck in der Poisson-Regression ist, der mit einem xgboostWerkzeug verwendet wird (extreme Gradientenverstärkung). Laut Quellcode lautet die Auswertungsfunktion: struct EvalPoissonNegLogLik : public EvalEWiseBase { const char *Name() const override { return "poisson-nloglik"; } inline bst_float EvalRow(bst_float y, bst_float py) const { const bst_float eps …


1
Interpretation der Kalibrierkurve
Ich habe ein schrittweise abgeleitetes binäres logistisches Regressionsmodell. Ich habe die calibrate(, bw=200, bw=TRUE)Funktion im rmsPaket in R verwendet, um die zukünftige Kalibrierung abzuschätzen. Die Ausgabe ist unten angegeben und zeigt die durch die Bootstrap-Überanpassung korrigierte Kalibrierungskurvenschätzung für das logistische Rückwärts-Abwärtsmodell. Ich bin mir jedoch nicht sicher, wie ich es …

2
Vorausschauendes Wartungsmodell zur Identifizierung von Anzeichen eines Fehlers, bevor dieser auftritt
Situation Ich arbeite an einem Problem, bei dem ich Sensordaten verwende, um einen Maschinenausfall vorherzusagen, bevor der Fehler auftritt, und ich benötige einige Ratschläge zu den zu untersuchenden Methoden. Insbesondere möchte ich Hinweise auf einen bevorstehenden Fehler identifizieren, bevor der Fehler tatsächlich auftritt. Im Idealfall ist dies mit einer ausreichenden …

1
Warum werden Deep-Believe-Netzwerke (DBN) selten verwendet?
Ich habe dieses Buch über tiefes Lernen von Ian und Aron gelesen. In der Beschreibung von DBN heißt es, DBN sei in Ungnade gefallen und werde selten verwendet. Deep-Believe-Netzwerke haben gezeigt, dass Deep-Architekturen erfolgreich sein können, indem sie kernelisierte Support-Vektor-Maschinen im MNIST-Datensatz übertreffen (Hinton et al., 2006). Heutzutage sind Deep-Believe-Netzwerke …

3
Ganzzahlige Daten: kategorisch oder kontinuierlich?
Ich frage mich, ob ganzzahlige Prädiktordaten als kategorisch (daher codierungsbedürftig) oder kontinuierlich behandelt werden sollten. Wenn der Bereich eines bestimmten Prädiktors Xbeispielsweise alle Ganzzahlen zwischen 1 und 230 sind, kann ich ihn dann als kontinuierliche Variable behandeln oder sollte ich ihn codieren, um 230 (oder vielleicht 229) neue Dummy-Variablen zu …






1
Ausdrücken der LASSO-Regressionsbeschränkung über den Strafparameter
Angesichts der beiden äquivalenten Formulierungen des Problems für die LASSO-Regression, und \ min (RSS), so dass \ sum | \ beta_i | \ leq t , wie können wir die eine ausdrücken -zu-eins Korrespondenz zwischen \ lambda und t ?min(RSS+λ∑|βi|)min(RSS+λ∑|βi|)\min(RSS + \lambda\sum|\beta_i|)min(RSS)min(RSS)\min(RSS)∑|βi|≤t∑|βi|≤t\sum|\beta_i|\leq tλλ\lambdattt
7 lasso 


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.