Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Warum sollten wir Saisonalität aus einer Zeitreihe entfernen?
Während wir mit Zeitreihen arbeiten, erkennen und entfernen wir manchmal Saisonalität mithilfe der Spektralanalyse. Ich bin ein echter Anfänger in Zeitreihen und ich bin verwirrt, warum man Saisonalität aus der ursprünglichen Zeitreihe entfernen möchte. Verzerrt das Entfernen der Saisonalität nicht die ursprünglichen Daten? Welche Vorteile erhalten wir durch die Erstellung …


2
Warum funktioniert Faltung?
Ich weiß also, wenn wir die Wahrscheinlichkeitsverteilung einer Summe unabhängiger Zufallsvariablen , können wir sie aus den Wahrscheinlichkeitsverteilungen von X und Y berechnen , indem wir sagenX.+ Y.X+YX + YX.XXY.YY fX.+ Y.( a ) = ∫∞x = - ∞fX., Y.( X.= x , Y.= a - x ) d x …

2
Was ist eine Log-Odds-Verteilung?
Ich lese ein Lehrbuch über maschinelles Lernen (Data Mining von Witten et al., 2011) und bin auf diese Passage gestoßen: ... Außerdem können verschiedene Verteilungen verwendet werden. Obwohl die Normalverteilung normalerweise eine gute Wahl für numerische Attribute ist, ist sie nicht für Attribute geeignet, die ein vorbestimmtes Minimum, aber keine …



2
Genaue Definition des Abweichungsmaßes im glmnet-Paket mit Kreuzvalidierung?
Für meine aktuelle Forschung verwende ich die Lasso-Methode über das glmnet-Paket in R für eine binomialabhängige Variable. In glmnet wird das optimale Lambda durch Kreuzvalidierung ermittelt und die resultierenden Modelle können mit verschiedenen Maßnahmen verglichen werden, z. B. Fehlklassifizierungen oder Abweichungen. Meine Frage: Wie genau ist Abweichung in glmnet definiert? …

2
Wie führe ich eine Restanalyse für binäre / dichotome unabhängige Prädiktoren in der linearen Regression durch?
Ich führe die unten stehende multiple lineare Regression in R durch, um die Rendite des verwalteten Fonds vorherzusagen. reg <- lm(formula=RET~GRI+SAT+MBA+AGE+TEN, data=rawdata) Hier sind nur GRI & MBA binäre / dichotome Prädiktoren; Die verbleibenden Prädiktoren sind kontinuierlich. Ich verwende diesen Code, um Residuendiagramme für die binären Variablen zu generieren. plot(rawdata$GRI, …

3
Was ist eine gute AUC für eine Präzisionsrückrufkurve?
Da ich einen sehr unausgewogenen Datensatz habe (9% positive Ergebnisse), entschied ich, dass eine Präzisionsrückrufkurve geeigneter ist als eine ROC-Kurve. Ich habe das analoge zusammenfassende Flächenmaß unter der PR-Kurve erhalten (.49, wenn Sie interessiert sind), bin mir aber nicht sicher, wie ich es interpretieren soll. Ich habe gehört, dass .8 …

2
Ist es möglich, die alternative Hypothese zu akzeptieren?
Ich kenne hier einige verwandte Fragen (z. B. Terminologie zum Testen von Hypothesen in Bezug auf Null , Ist es möglich, eine Nullhypothese zu beweisen? ), Aber ich kenne die endgültige Antwort auf meine Frage unten nicht. Nehmen wir einen Hypothesentest an, bei dem wir testen möchten, ob eine Münze …


2
Ausreißererkennung mittels Regression
Kann die Regression zur Erkennung von Lier verwendet werden? Ich verstehe, dass es Möglichkeiten gibt, ein Regressionsmodell durch Entfernen der Ausreißer zu verbessern. Das Hauptziel hierbei ist jedoch nicht, ein Regressionsmodell anzupassen, sondern mithilfe der Regression die Liers herauszufinden

2
Perzentilverlustfunktionen
Die Lösung des Problems: minmE[|m−X|]minmE[|m−X|] \min_{m} \; E[|m-X|] ist bekanntlich der Median von , aber wie sieht die Verlustfunktion für andere Perzentile aus? Beispiel: Das 25. Perzentil von X ist die Lösung für:XXX minmE[L(m,X)]minmE[L(m,X)] \min_{m} \; E[ L(m,X) ] Was ist in diesem Fall?LLL

1
Vorteile von Jeffries Matusita Entfernung
Laut einem Artikel, den ich lese, wird häufig der Abstand zwischen Jeffries und Matusita verwendet. Aber ich konnte nicht viele Informationen darüber finden, außer der folgenden Formel JMD (x, y) =∑(xi−−√2−yi−−√2)2−−−−−−−−−−−−−√2∑(xi2−yi2)22\sqrt[2]{\sum(\sqrt[2]{x_i}-\sqrt[2]{y_i})^2} Es ähnelt dem euklidischen Abstand mit Ausnahme der Quadratwurzel E (x, y) =∑(xi−yi)2−−−−−−−−−−√2∑(xi−yi)22\sqrt[2]{\sum(x_i-y_i)^2} Die JM-Entfernung soll hinsichtlich der Klassifizierung …

5
Metropolis Hastings-Algorithmus
Ich muss Markov-Ketten-Monte-Carlo-Methoden studieren, um genauer zu sein, muss ich den Metropolis-Hastings-Algorithmus und alles darüber wie Konvergenzkriterien studieren. Wer kann mir ein Buch, ein Papier oder eine Website vorschreiben, die dieses Argument mit einfachen Begriffen erklären, ohne jedoch trivial zu sein?
11 references  mcmc 

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.