Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Hessischer Wert der Profilwahrscheinlichkeit, der für die Standardfehlerschätzung verwendet wird
Diese Frage ist von dieser motiviert . Ich habe zwei Quellen nachgeschlagen und das habe ich gefunden. A. van der Vaart, Assymptotische Statistik: Es ist selten möglich, eine Profilwahrscheinlichkeit explizit zu berechnen, aber ihre numerische Auswertung ist oft machbar. Dann kann die Profilwahrscheinlichkeit dazu dienen, die Dimension der Wahrscheinlichkeitsfunktion zu …

4
Reporting-Ergebnisse einer logistischen Regression
Ich habe die folgende logistische Regressionsausgabe: Coefficients: Estimate Std. Error z value Pr(>|z|) (Intercept) 0.5716 0.1734 3.297 0.000978 *** R1 -0.4662 0.2183 -2.136 0.032697 * R2 -0.5270 0.2590 -2.035 0.041898 * Ist es angebracht, dies folgendermaßen zu melden: Beta-Koeffizient, Odds Ratio, Z-Wert, P-Wert. Wenn ja, wie kann ich die Odds …
13 logistic 


2
Grundlegendes zum Bootstrapping für die Validierung und Modellauswahl
Ich denke, ich verstehe, wie die Grundlagen des Bootstrapping funktionieren, bin mir aber nicht sicher, wie ich das Bootstrapping zur Modellauswahl oder zur Vermeidung von Überanpassungen einsetzen kann. Würden Sie beispielsweise für die Modellauswahl nur das Modell auswählen, das den geringsten Fehler (möglicherweise die geringste Varianz?) In den Bootstrap-Beispielen ergibt? …


2
Was ist der beste Weg, um die Grundlagen der Wahrscheinlichkeit zu lernen, die für maschinelle Lernalgorithmen erforderlich sind?
Ich habe vor ein paar Jahren einen Wahrscheinlichkeits-Kurs an der Universität belegt, aber ich gehe jetzt einige Algorithmen für maschinelles Lernen durch und ein Teil der Mathematik ist nur verwirrend. Ich lerne gerade den EM-Algorithmus (Expectation Maximization) und es scheint, dass eine große Kluft zwischen dem, was benötigt wird und …

4
Wie fange ich an, über Data Mining zu lesen?
Ich bin ein Anfänger, der anfangen wird, über Data Mining zu lesen. Ich habe Grundkenntnisse in KI und Statistik. Da viele sagen, dass maschinelles Lernen auch beim Data Mining eine wichtige Rolle spielt, ist es notwendig, sich mit maschinellem Lernen zu befassen, bevor ich mit dem Data Mining fortfahren kann?

4
Zeichnen Sie mehrere Diagramme in einem Diagramm in R?
Mit dem folgenden Code habe ich versucht, vier Diagramme in einem Diagramm zu zeichnen R. Ich bin mit der Abbildung nicht zufrieden, da zwischen den Darstellungen viel Platz ist und daher die Breite der Darstellungen nicht ausreicht, um die Darstellungen zu analysieren. Könnte mir jemand helfen, eine schöne Grafik mit …

1
Wiedergabe von Tabelle 18.1 aus „Elemente des statistischen Lernens“
Tabelle 18.1 in den Elementen des statistischen Lernens fasst die Leistung mehrerer Klassifikatoren in einem 14-Klassen-Datensatz zusammen. Ich vergleiche einen neuen Algorithmus mit dem Lasso und dem elastischen Netz für solche Klassifizierungsprobleme mit mehreren Klassen. Unter Verwendung von glmnetVersion 1.5.3 (R 2.13.0) kann ich Punkt 7 (das mit -penalisierte Multinom) …

1
Ermittlung des wahren Mittels aus verrauschten Beobachtungen
Ich habe eine große Menge von Datenpunkten der Form (Mittelwert, stdev). Ich möchte dies auf einen einzigen (besseren) Mittelwert und eine (hoffentlich) kleinere Standardabweichung reduzieren. Offensichtlich konnte ich einfach berechnen berücksichtigt jedoch nicht die Tatsache, dass einige der Datenpunkte wesentlich genauer sind als andere.∑datameanN∑datameanN\frac{\sum data_{mean}}{N} Vereinfacht ausgedrückt möchte ich einen …

5
R nur Alternativen zu BUGS [geschlossen]
Geschlossen. Diese Frage ist nicht zum Thema . Derzeit werden keine Antworten akzeptiert. Möchten Sie diese Frage verbessern? Aktualisieren Sie die Frage so dass es beim Thema für Kreuz Validated. Geschlossen 11 Monate . Ich besuche einen Kurs zur Bayes'schen Statistik mit BUGS und R. Nun, ich kenne BUGS bereits, …
13 r  bayesian  bugs 

2
Boxplot in Bezug auf zwei Faktoren unter Verwendung von ggplot2 in R
Verschlossen . Diese Frage und ihre Antworten sind gesperrt, da die Frage nicht zum Thema gehört, aber von historischer Bedeutung ist. Derzeit werden keine neuen Antworten oder Interaktionen akzeptiert. Ich bin zu R und zu irgendwelchen Paketen in R sehr neu. Ich schaute die ggplot2-Dokumentation an, konnte diese aber nicht …
13 r  boxplot  ggplot2 

4
Wird der mittlere quadratische Fehler verwendet, um die relative Überlegenheit eines Schätzers gegenüber einem anderen zu bewerten?
Angenommen, wir haben zwei Schätzer α1α1\alpha_1 und für einen Parameter . Um festzustellen, welcher Schätzer "besser" ist, betrachten wir den MSE (Mean Squared Error)? Mit anderen Worten, wir betrachten wobei die Abweichung des Schätzers und die Varianz des Schätzers ist. Wer eine größere MSE hat, ist ein schlechterer Schätzer?α2α2\alpha_2xxxMSE=β2+σ2MSE=β2+σ2MSE = …
13 estimation  mse 

4
Verwenden Sie ANOVA für Prozentsätze?
Ich habe eine Tabelle mit vier Gruppen (4 BMI-Gruppen) als unabhängige Variable (Faktor). Ich habe eine abhängige Variable, die "Prozent Mutter raucht in der Schwangerschaft" ist. Darf ich ANOVA verwenden oder muss ich Chi-Quadrat oder einen anderen Test verwenden?
13 anova 

1
Optimaler Algorithmus zur Lösung von n-armigen Banditenproblemen?
Ich habe über eine Reihe von Algorithmen zur Lösung von Problemen mit n-bewaffneten Banditen wie -greedy, Softmax und UCB1 gelesen, habe jedoch einige Probleme, herauszufinden, welcher Ansatz zur Minimierung von Bedauern am besten geeignet ist.ϵϵ\epsilon Gibt es einen bekannten optimalen Algorithmus zur Lösung des n-bewaffneten Banditenproblems? Gibt es eine Auswahl …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.