Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Schritte, um eine posteriore Verteilung herauszufinden, wenn es einfach genug sein könnte, eine analytische Form zu haben?
Dies wurde auch bei Computational Science gefragt . Ich versuche, eine Bayes'sche Schätzung einiger Koeffizienten für eine Autoregression mit 11 Datenproben zu berechnen: wobei ist Gauß mit Mittelwert 0 und Varianz Die vorherige Verteilung auf dem Vektor ist Gauß mit Mittelwert und einer diagonalen Kovarianzmatrix mit diagonale Einträge gleich .Yi=μ+α⋅Yi−1+ϵiYi=μ+α⋅Yi−1+ϵi …


1
Beeinträchtigt ein geringer Trainingsumfang eine SVM?
Ich versuche, Nachrichten mithilfe einer SVM in verschiedene Kategorien zu klassifizieren. Ich habe eine Liste der gewünschten Wörter / Symbole aus dem Trainingsset zusammengestellt. Für jeden Vektor, der eine Nachricht darstellt, setze ich die entsprechende Zeile auf, 1wenn das Wort vorhanden ist: "Corpus" ist: [Mary, Little, Lamm, Star, Twinkle] erste …


2
Anwenden von maschinellem Lernen für die DDoS-Filterung
In Stanfords Maschinellem Lernkurs erwähnte Andrew Ng die Anwendung von ML in der IT. Einige Zeit später, als ich DDoS von mittlerer Größe (ca. 20.000 Bots) auf unserer Site bekam, entschied ich mich, mit einem einfachen Neural Network-Klassifikator dagegen anzukämpfen. Ich habe dieses Python-Skript in ungefähr 30 Minuten geschrieben: https://github.com/SaveTheRbtz/junk/tree/master/neural_networks_vs_ddos …

2
Domain-Agnostic Feature Engineering, das semantische Bedeutung behält?
Feature Engineering ist oft ein wichtiger Bestandteil des maschinellen Lernens (es wurde stark genutzt, um den KDD Cup 2010 zu gewinnen ). Ich finde jedoch, dass die meisten Feature-Engineering-Techniken entweder Zerstören Sie jede intuitive Bedeutung der zugrunde liegenden Funktionen oder sind sehr spezifisch für eine bestimmte Domäne oder sogar bestimmte …


2
Anpassen des p-Wertes für die adaptive sequentielle Analyse (für den Chi-Quadrat-Test)?
Ich möchte wissen, welche statistische Literatur für das folgende Problem relevant ist, und vielleicht sogar eine Idee, wie man es löst. Stellen Sie sich folgendes Problem vor: Wir haben 4 mögliche Behandlungen für einige Krankheiten. Um herauszufinden, welche Behandlung besser ist, führen wir eine spezielle Studie durch. In der Studie …







4
Sidak oder Bonferroni?
Ich verwende ein verallgemeinertes lineares Modell in SPSS, um die Unterschiede in der durchschnittlichen Anzahl von Raupen (nicht normal, unter Verwendung der Tweedie-Verteilung) an 16 verschiedenen Pflanzenarten zu untersuchen. Ich möchte mehrere Vergleiche durchführen, bin mir jedoch nicht sicher, ob ich einen Sidak- oder Bonferroni-Korrekturtest verwenden soll. Was ist der …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.