Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


3
Der Vergleich von zwei Klassifikatorgenauigkeitsergebnissen für die statistische Signifikanz mit dem t-Test
Ich möchte die Genauigkeit von zwei Klassifikatoren für die statistische Signifikanz vergleichen. Beide Klassifikatoren werden mit demselben Datensatz ausgeführt. Dies lässt mich glauben, dass ich einen T-Test mit einer Stichprobe von dem verwenden sollte, was ich gelesen habe . Beispielsweise: Classifier 1: 51% accuracy Classifier 2: 64% accuracy Dataset size: …

1
Die Eingabeparameter für die Verwendung der latenten Dirichlet-Zuordnung
Bei Verwendung der Themenmodellierung (Latent Dirichlet Allocation) ist die Anzahl der Themen ein Eingabeparameter, den der Benutzer angeben muss. Ich denke, wir sollten auch eine Sammlung von Kandidatenthemensätzen bereitstellen, mit denen der Dirichlet-Prozess verglichen werden muss. Ist mein Verständnis korrekt? Wie kann man in der Praxis ein solches Kandidatenthemaset einrichten?

2
Beste Methode zur Ausführung von SVM für mehrere Klassen
Ich weiß, dass die SVM ein binärer Klassifikator ist. Ich würde es gerne auf SVM mit mehreren Klassen ausweiten. Welches ist der beste und vielleicht einfachste Weg, dies zu tun? Code: in MATLAB u=unique(TrainLabel); N=length(u); if(N>2) itr=1; classes=0; while((classes~=1)&&(itr<=length(u))) c1=(TrainLabel==u(itr)); newClass=double(c1); tst = double((TestLabel == itr)); model = svmtrain(newClass, TrainVec, …

4
Bestätigung der Verteilung von Residuen in linearer Regression
Angenommen, wir haben eine einfache lineare Regression , die Residuen gespeichert und ein Histogramm der Verteilung der Residuen erstellt. Wenn wir etwas bekommen, das wie eine vertraute Distribution aussieht, können wir annehmen, dass unser Fehlerbegriff diese Distribution hat? Wenn wir herausfinden, dass Residuen der Normalverteilung ähneln, ist es dann sinnvoll, …

4
Modellfehlerbegriffe mit gleitendem Durchschnitt
Dies ist eine grundlegende Frage zu Box-Jenkins MA-Modellen. Wie ich es verstehe, ist ein MA - Modell im Grunde eine lineare Regression von Zeitreihenwerten YYY gegen vorherige Fehlerterme et,...,et−net,...,et−ne_t,..., e_{t-n} . Das heißt, die Beobachtung YYY wird zuerst gegen ihre vorherigen Werte zurückgebildet Yt−1,...,Yt−nYt−1,...,Yt−nY_{t-1}, ..., Y_{t-n} und dann ein oder …

1
Bootstrap-basiertes Konfidenzintervall
Während ich das bootstrap-basierte Konfidenzintervall studierte, las ich einmal die folgende Aussage: Wenn die Bootstrap-Verteilung nach rechts verschoben ist, enthält das Bootstrap-basierte Konfidenzintervall eine Korrektur, um die Endpunkte noch weiter nach rechts zu verschieben. Das mag zwar nicht intuitiv erscheinen, ist aber die richtige Maßnahme. Ich versuche die Logik zu …

5
Schnelle Methode zum Finden der besten Metaparameter von SVM (das ist schneller als die Rastersuche)
Ich verwende SVM-Modelle zur kurzfristigen Vorhersage von Luftschadstoffen. Um ein neues Modell zu trainieren, muss ich geeignete Metaparameter für ein SVM-Modell finden (ich meine C, Gamma usw.). In der Libsvm-Dokumentation (und in vielen anderen Büchern, die ich gelesen habe) wird vorgeschlagen, diese Parameter mithilfe der Rastersuche zu finden. Daher trainiere …

2
Warum funktioniert der Ridge-Regressionsklassifikator für die Textklassifizierung recht gut?
Während eines Experiments zur Textklassifizierung habe ich Ergebnisse gefunden, die die Tests unter den Klassifizierern, die häufiger erwähnt und für Text-Mining-Aufgaben wie SVM, NB, kNN usw. angewendet werden, ständig übertreffen zur Optimierung jedes Klassifikators für diese spezielle Textklassifizierungsaufgabe, mit Ausnahme einiger einfacher Änderungen an den Parametern. Ein solches Ergebnis wurde …

2
Wie schreibt man die post-hoc-Ergebnisse von Tukey auf?
Wie schreibe ich ein Tukey-Post-Hoc-Ergebnis richtig? Gibt es mehrere Beispiele mit unterschiedlichen Ergebnissen? Angenommen, Sie haben Nord, Süd, Ost und West. North N=50 Mean=2.45 SD=3.9 std error=.577 LB=1.29 UB=3.62 South N=40 Mean=2.54 SD=3.8 std error=.576 LB=1.29 UB=3.63 East N=55 Mean=3.45 SD=3.7 std error=.575 LB=1.29 UB=3.64 West N=45 Mean=3.54 SD=3.6 std …


2
Was ist der Unterschied zwischen „Hypothesentest“ und „Signifikanztest“?
Gibt es einen Unterschied zwischen den Ausdrücken "Prüfung der Hypothese" und "Prüfung der Signifikanz" oder sind sie gleich? Nach einer ausführlichen Antwort von Michael Lew, habe ich eine Verwirrung, dass heutzutage Hypothesen (z. B. t-Test, um Mittelwert zu testen) entweder Beispiele für "Signifikanztests" oder "Hypothesentests" sind. Oder ist es eine …

3
Maximaler Wert des Variationskoeffizienten für den begrenzten Datensatz
In der Diskussion nach einer kürzlich gestellten Frage, ob die Standardabweichung den Mittelwert überschreiten kann, wurde eine Frage kurz aufgeworfen, aber nie vollständig beantwortet. Also frage ich es hier. Betrachten Sie eine Menge von nichtnegativen Zahlen wobei für . Es ist nicht erforderlich, dass x_i unterschiedlich ist, das heißt, dass …

4
Enges Konfidenzintervall - höhere Genauigkeit?
Ich habe zwei Fragen zu Konfidenzintervallen: Anscheinend impliziert ein enges Konfidenzintervall eine geringere Wahrscheinlichkeit, eine Beobachtung innerhalb dieses Intervalls zu erhalten, weshalb unsere Genauigkeit höher ist. Ein 95% -Konfidenzintervall ist auch enger als ein 99% -Konfidenzintervall, das breiter ist. Das Konfidenzintervall von 99% ist genauer als das von 95%. Kann …

1
Eigenschaften logistischer Regressionen
Wir arbeiten mit einigen logistischen Regressionen und haben festgestellt, dass die durchschnittliche geschätzte Wahrscheinlichkeit immer dem Anteil derjenigen in der Stichprobe entspricht. Das heißt, der Durchschnitt der angepassten Werte entspricht dem Durchschnitt der Stichprobe. Kann mir jemand den Grund erklären oder eine Referenz geben, wo ich diese Demonstration finden kann?

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.