Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren




2
Durchführen eines statistischen Tests nach der Datenvisualisierung - Datenbaggerung?
Ich werde diese Frage anhand eines Beispiels vorschlagen. Angenommen, ich habe einen Datensatz, z. B. den Preisdatensatz für Wohnimmobilien in Boston, in dem ich kontinuierliche und kategoriale Variablen habe. Hier haben wir eine "Qualitäts" -Variable von 1 bis 10 und den Verkaufspreis. Ich kann die Daten in Häuser mit "niedriger", …

4
Ist das Ergebnis einer Prüfung ein Binomial?
Hier ist eine einfache Statistikfrage, die mir gestellt wurde. Ich bin mir nicht sicher, ob ich das verstehe. X = Anzahl der in einer Prüfung erworbenen Punkte (Multiple Choice und richtige Antwort sind ein Punkt). Ist X-Binomial verteilt? Die Antwort des Professors war: Ja, weil es nur richtige oder falsche …


2
Kostenfunktion in der linearen OLS-Regression
Ich bin ein bisschen verwirrt mit einem Vortrag über lineare Regression von Andrew Ng über Coursera über maschinelles Lernen. Dort gab er eine Kostenfunktion an, die die Quadratsumme wie folgt minimiert: 12m∑i=1m(hθ(X(i))−Y(i))212m∑i=1m(hθ(X(i))−Y(i))2 \frac{1}{2m} \sum _{i=1}^m \left(h_\theta(X^{(i)})-Y^{(i)}\right)^2 Ich verstehe, woher das kommt. Ich denke, er hat es so gemacht, dass, wenn …

5
Was sagen Konfidenzintervalle über Präzision aus?
Morey et al. (2015) argumentieren, dass Konfidenzintervalle irreführend sind und es mehrere Vorurteile gibt, die mit ihrem Verständnis zusammenhängen. Unter anderem beschreiben sie den Präzisionsfehler wie folgt: Der Genauigkeitsfehler Die Breite eines Konfidenzintervalls zeigt die Genauigkeit unseres Wissens über den Parameter an. Enge Konfidenzintervalle zeigen genaues Wissen, während breite Konfidenzfehler …

3
Bündelung einer langen Liste von Zeichenfolgen (Wörtern) in Ähnlichkeitsgruppen
Ich habe das folgende Problem zur Hand: Ich habe eine sehr lange Liste von Wörtern, möglicherweise Namen, Nachnamen usw. Ich muss diese Wortliste so gruppieren, dass ähnliche Wörter, zum Beispiel Wörter mit ähnlichem Bearbeitungsabstand (Levenshtein), in der Liste angezeigt werden gleichen Cluster. Zum Beispiel sollten "Algorithmus" und "Alogrithmus" hohe Chancen …

6
Sollte Sparsamkeit wirklich noch der Goldstandard sein?
Nur ein Gedanke: Sparsame Modelle waren bei der Modellauswahl immer die Standardanwendung, aber inwieweit ist dieser Ansatz veraltet? Ich bin gespannt, wie sehr unsere Neigung zur Sparsamkeit ein Relikt aus einer Zeit von Abakus und Rechenschiebern (oder, im Ernst, nicht modernen Computern) ist. Die heutige Rechenleistung ermöglicht es uns, immer …


4
Sind kleinere p-Werte überzeugender?
Ich habe mich über Werte, Typ 1-Fehlerraten, Signifikanzniveaus, Leistungsberechnungen, Effektgrößen und die Debatte zwischen Fisher und Neyman-Pearson informiert. Das hat mich ein bisschen überwältigt. Ich entschuldige mich für die Textwand, aber ich hielt es für notwendig, einen Überblick über mein derzeitiges Verständnis dieser Konzepte zu geben, bevor ich zu meinen …

4
Was sind die relativen Vorteile von Winsorizing vs. Trimming-Daten?
Winsorizing Daten Mittel ersetzen die Extremwerte eines Datensatzes mit einem bestimmten Perzentilwert von jedem Ende, während Trimm- oder Abschneiden beinhaltet das Entfernen dieser Extremwerte. Ich sehe beide diskutierten Methoden immer als eine praktikable Option, um die Auswirkung von Ausreißern bei der Berechnung von Statistiken wie dem Mittelwert oder der Standardabweichung …



Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.