Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Wie passt man ein ungefähres PDF (dh: Dichteschätzung) unter Verwendung der ersten k (empirischen) Momente an?
Ich habe eine Situation, in der ich (die ersten) Momente eines Datensatzes schätzen kann und daraus eine Schätzung der Dichtefunktion erstellen möchte.kkk Ich bin bereits auf die Pearson-Distribution gestoßen , habe jedoch festgestellt, dass sie nur auf den ersten vier Momenten beruht (mit einigen Einschränkungen hinsichtlich der möglichen Kombinationen von …


1
Algorithmen zum Einbetten von Wörtern in Bezug auf die Leistung
Ich versuche, ungefähr 60 Millionen Phrasen in einen Vektorraum einzubetten und dann die Kosinusähnlichkeit zwischen ihnen zu berechnen . Ich habe sklearns CountVectorizermit einer speziell entwickelten Tokenizer-Funktion verwendet, die Unigramme und Bigramme erzeugt. Es stellt sich heraus, dass ich eine enorme Anzahl von Spalten berücksichtigen muss, die linear in der …

1
Warum ist die Merkmalsauswahl für Klassifizierungsaufgaben wichtig?
Ich lerne etwas über die Auswahl von Funktionen. Ich kann sehen, warum es für den Modellbau wichtig und nützlich wäre. Aber konzentrieren wir uns auf überwachte Lernaufgaben (Klassifizierungsaufgaben). Warum ist die Merkmalsauswahl für Klassifizierungsaufgaben wichtig? Ich sehe viel Literatur über die Auswahl von Funktionen und deren Verwendung für überwachtes Lernen, …

3
Was sind die Vorzüge verschiedener Ansätze zur Erkennung von Kollinearität?
Ich möchte feststellen, ob Kollinearität ein Problem in meiner OLS-Regression ist. Ich verstehe, dass Varianzinflationsfaktoren und der Zustandsindex zwei häufig verwendete Messgrößen sind, finde es jedoch schwierig, etwas Bestimmtes in Bezug auf die Vorzüge jedes Ansatzes oder die Höhe der Bewertungen zu finden. Eine prominente Quelle, die angibt, welcher Ansatz …

1
Wie lässt sich die Schätzung der Kerneldichte anhand der geografischen Koordinaten richtig berechnen?
Ich muss die 2d-Kernel-Dichteschätzung (kde) aus einer Liste von Breiten- und Längenkoordinaten berechnen. Ein Breitengrad ist jedoch nicht derselbe Abstand wie ein Längengrad. Dies bedeutet, dass die einzelnen Kerne oval sind, insbesondere je weiter der Punkt vom Äquator entfernt ist. In meinem Fall sind die Punkte alle nahe genug beieinander, …

2
Klassifizierung mit teilweise „unbekannten“ Daten
Angenommen, ich möchte einen Klassifizierer lernen, der einen Vektor von Zahlen als Eingabe verwendet und eine Klassenbezeichnung als Ausgabe gibt. Meine Trainingsdaten bestehen aus einer großen Anzahl von Eingabe-Ausgabe-Paaren. Wenn ich jedoch einige neue Daten teste, sind diese Daten normalerweise nur teilweise vollständig. Wenn der Eingabevektor beispielsweise die Länge 100 …


1
Was sind die "wünschenswerten" statistischen Eigenschaften des Likelihood-Ratio-Tests?
Ich lese einen Artikel, dessen Methode vollständig auf dem Likelihood-Ratio-Test basiert. Der Autor sagt, dass der LR-Test gegen einseitige Alternativen UMP ist. Er fährt fort, indem er das behauptet "... selbst wenn nicht gezeigt werden kann, dass es [der LR-Test] einheitlich am leistungsstärksten ist, hat der LR-Test oft wünschenswerte statistische …



1
Verwenden Statistiker den Prior von Jeffreys in der tatsächlich angewandten Arbeit?
Als ich in meinem Abschlusskurs für statistische Inferenz etwas über die Jeffreys erfuhr, ließen meine Professoren es so klingen, als wäre es hauptsächlich aus historischen Gründen interessant, anstatt weil irgendjemand es jemals benutzen würde. Als ich dann eine Bayes'sche Datenanalyse durchführte, wurden wir nie gebeten, Jeffreys 'Prioritäten zu verwenden. Verwendet …

2
Familienbezogene Fehlergrenze: Führt die Wiederverwendung von Datensätzen zu verschiedenen Studien unabhängiger Fragen zu mehreren Testproblemen?
Wenn ein Forscherteam mehrere (Hypothesen-) Tests an einem bestimmten Datensatz durchführt, gibt es eine Menge Literatur, in der behauptet wird, dass für mehrere Tests (Bonferroni usw.) eine Korrektur verwendet werden sollte, auch wenn die Tests unabhängig sind. Meine Frage lautet: Gilt dieselbe Logik für mehrere Teams, die Hypothesen mit demselben …



Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.