Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren



2
Wie reduziert die lineare Diskriminanzanalyse die Dimensionen?
Es gibt Wörter aus "Die Elemente des statistischen Lernens" auf Seite 91: Die K-Schwerpunkte im p-dimensionalen Eingangsraum überspannen höchstens den K-1-dimensionalen Unterraum, und wenn p viel größer als K ist, ist dies ein beträchtlicher Dimensionsabfall. Ich habe zwei Fragen: Warum überspannen die K-Schwerpunkte im p-dimensionalen Eingaberaum höchstens den K-1-dimensionalen Unterraum? …


2
Wie kann ich eine signifikante Gesamt-ANOVA erhalten, aber keine signifikanten paarweisen Unterschiede zum Tukey-Verfahren?
Ich habe mit R an ANOVA gespielt und dabei signifikante Unterschiede festgestellt. Als ich jedoch nach dem Tukey-Verfahren überprüfte, welche Paare signifikant unterschiedlich waren, bekam ich keine davon. Wie kann das möglich sein? Hier ist der Code: fit5_snow<- lm(Response ~ Stimulus, data=audio_snow) anova(fit5_snow) > anova(fit5_snow) Analysis of Variance Table Response: …

5
Welche robusten Korrelationsmethoden werden tatsächlich verwendet?
Ich plane eine Simulationsstudie, in der ich die Leistung mehrerer robuster Korrelationstechniken mit unterschiedlichen Verteilungen (verzerrt, mit Ausreißern usw.) vergleiche. Mit robust meine ich den Idealfall, robust gegen a) verzerrte Verteilungen, b) Ausreißer und c) schwere Schwänze zu sein. Zusammen mit der Pearson-Korrelation als Grundlinie wollte ich folgende robustere Maßnahmen …


2
Variable Wichtigkeit von GLMNET
Ich möchte das Lasso als Methode zur Auswahl von Merkmalen und zur Anpassung eines Vorhersagemodells an ein binäres Ziel verwenden. Im Folgenden ist ein Code aufgeführt, mit dem ich die Methode mit regulierter logistischer Regression ausprobiert habe. Meine Frage ist, dass ich eine Gruppe von "signifikanten" Variablen erhalte, aber bin …

2
Deep Learning vs. Entscheidungsbäume und Methoden fördern
Ich suche nach Artikeln oder Texten, die vergleichen und diskutieren (entweder empirisch oder theoretisch): Boosting- und Entscheidungsbaum- Algorithmen wie Random Forests oder AdaBoost und GentleBoost werden auf Entscheidungsbäume angewendet. mit Deep Learning Methoden wie Restricted Boltzmann Machines , Hierarchical Temporal Memory , Convolutional Neural Networks , etc. Kennt jemand einen …

4
Wie lässt sich das Bayes'sche Gerüst besser interpretieren, wenn wir normalerweise uninformative oder subjektive Prioritäten verwenden?
Es wird oft argumentiert, dass das Bayes'sche Gerüst einen großen Vorteil bei der Interpretation hat (gegenüber dem Frequentisten), weil es die Wahrscheinlichkeit eines Parameters berechnet, wenn die Daten gegeben sind - anstelle von wie in frequentistischer Rahmen. So weit, ist es gut.p ( x | θ )p ( θ | …


5
Textklassifizierung in großem Maßstab
Ich möchte meine Textdaten klassifizieren. Ich habe 300 classes200 Schulungsunterlagen pro Klasse (so 60000 documents in total) und dies wird wahrscheinlich zu sehr hohen Maßangaben führen (wir suchen möglicherweise nach mehr als 1 Million Dimensionen ). Ich möchte die folgenden Schritte in der Pipeline ausführen (um Ihnen einen Eindruck von …




Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.