Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Interpretation der PCA-Ergebnisse
Kann mir jemand bei der Interpretation von PCA-Scores helfen? Meine Daten stammen aus einem Fragebogen zur Einstellung gegenüber Bären. Nach den Ladungen habe ich eine meiner Hauptkomponenten als "Angst vor Bären" interpretiert. Würden sich die Bewertungen dieser Hauptkomponente darauf beziehen, wie jeder Befragte diese Hauptkomponente bewertet (ob er / sie …
16 pca 


1
EM, gibt es eine intuitive Erklärung?
Das EM-Verfahren erscheint dem Uneingeweihten als mehr oder weniger schwarze Magie. Schätzen Sie die Parameter eines HMM (zum Beispiel) mit überwachten Daten. Dekodieren Sie dann nicht getaggte Daten, indem Sie Ereignisse vorwärts und rückwärts zählen, als ob die Daten mehr oder weniger getaggt wären. Warum macht dies das Modell besser? …

2
Warum machen wir viel Aufhebens um die Verwendung von Fisher Scoring, wenn wir ein GLM anpassen?
Ich bin gespannt, warum wir GLMS-Anpassungen so behandeln, als wären sie ein spezielles Optimierungsproblem. Sind sie? Es scheint mir, dass sie nur maximale Wahrscheinlichkeit sind und dass wir die Wahrscheinlichkeit aufschreiben und dann ... maximieren wir sie! Warum verwenden wir Fisher-Scoring anstelle der unzähligen Optimierungsschemata, die in der angewandten Mathematikliteratur …


4
Umfassender Überblick über Verlustfunktionen?
Ich versuche, eine globale Perspektive auf einige der wesentlichen Ideen des maschinellen Lernens zu bekommen, und ich habe mich gefragt, ob es eine umfassende Behandlung der verschiedenen Verlustbegriffe (Quadrat, Protokoll, Scharnier, Proxy usw.) gibt. Ich dachte an eine umfassendere, formale Darstellung von John Langfords hervorragendem Beitrag zur Verlustfunktionssemantik .




7
Was ist die Definition von "best", wie sie im Begriff "best fit" und Kreuzvalidierung verwendet wird?
Wenn Sie eine nichtlineare Funktion an eine Menge von Punkten anpassen (vorausgesetzt, es gibt nur eine Ordinate für jede Abszisse), kann das Ergebnis entweder sein: eine sehr komplexe Funktion mit kleinen Residuen eine sehr einfache Funktion mit großen Residuen Kreuzvalidierung wird häufig verwendet, um den "besten" Kompromiss zwischen diesen beiden …


5
Interpretation nicht signifikanter Ergebnisse als „Trends“
In letzter Zeit haben zwei verschiedene Mitarbeiter eine Art Argument über Unterschiede zwischen Bedingungen verwendet, die mir unkorrekt erscheinen. Beide Mitarbeiter verwenden Statistiken, sind jedoch keine Statistiker. Ich bin ein Neuling in der Statistik. In beiden Fällen habe ich argumentiert, dass es falsch ist, eine allgemeine Aussage über diese Gruppen …

2
T-Test für lineare Regression verstehen
Ich versuche herauszufinden, wie man Hypothesentests für eine lineare Regression durchführt (Nullhypothese ist keine Korrelation). Jede Anleitung und Seite zu dem Thema, auf die ich stoße, scheint einen T-Test zu verwenden. Aber ich verstehe nicht, was T-Test für lineare Regression eigentlich bedeutet. Ein t-Test wird verwendet, um zwei Populationen zu …


1
Hochdimensionale Regression: Warum ist
Ich versuche, mich über die Forschung im Bereich der hochdimensionalen Regression zu informieren. wenn größer als ist, ist das . Es scheint, als würde der Begriff häufig als Konvergenzrate für Regressionsschätzer verwendet.n p > > n log p / npppnnnp > > np>>np >> nLogp / nLog⁡p/n\log p/n Zum Beispiel …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.