Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Die Varianz eines Regressionsmodells erklären
Dies kann eine einfache Erklärung sein (ich hoffe es trotzdem). Ich habe in Matlab mit der Regressions-Toolbox einige Regressionsanalysen durchgeführt. Ich bin jedoch auf eine Studie gestoßen, in der es heißt: "Mit Hilfe der Regressionsanalyse war es möglich, ein Vorhersagemodell mit nur vier Schallmerkmalen zu erstellen, die 60% der Varianz …
12 variance 

3
Bedeutet die Annahme von normalen Fehlern, dass Y auch normal ist?
Wenn ich mich nicht irre, wird in einem linearen Modell angenommen, dass die Verteilung der Antwort eine systematische und eine zufällige Komponente aufweist. Der Fehlerbegriff erfasst die zufällige Komponente. Wenn wir also davon ausgehen, dass der Fehlerterm normalverteilt ist, bedeutet das dann nicht, dass die Antwort auch normalverteilt ist? Ich …

1
Wie gehe ich mit Überdispersion in der Poisson-Regression um: Quasi-Wahrscheinlichkeit, negativer binomialer GLM oder zufälliger Effekt auf Subjektebene?
Ich habe drei Vorschläge zur Behandlung der Überdispersion in einer Poisson-Antwortvariablen und einem Startmodell mit allen festen Effekten gefunden: Verwenden Sie ein Quasi-Modell. Verwenden Sie negatives Binomial-GLM. Verwenden Sie ein gemischtes Modell mit einem zufälligen Effekt auf Subjektebene. Aber was soll man eigentlich wählen und warum? Gibt es ein tatsächliches …

2
Vor- und Nachteile der Protokollverknüpfung im Vergleich zur Identitätsverknüpfung für die Poisson-Regression
Ich trage eine Poisson - Regression mit dem Endziel aus zu vergleichen (und die Differenz der Einnahme) die vorhergesagten mittleren Zählungen zwischen zwei Faktorstufen in meinem , während anderes Modell Kovariaten halten (das ist alle binäre ) konstant. Ich habe mich gefragt, ob irgendjemand einen praktischen Rat geben kann, wann …

1
Beweisen Sie die Beziehung zwischen Mahalanobis Abstand und Hebelwirkung?
Ich habe Formeln auf Wikipedia gesehen. die Mahalanobis Distanz und Hebelwirkung in Beziehung setzen: Der Mahalanobis-Abstand hängt eng mit der Verschuldungsstatistik , hat jedoch eine andere Skala:hhhD2=(N−1)(h−1N).D2=(N−1)(h−1N).D^2 = (N - 1)(h - \tfrac{1}{N}). In einem verlinkten Artikel beschreibt Wikipedia :hhh Im linearen Regressionsmodell die Hebel Punktzahl für die wird Dateneinheit …

2
Wann ist eine logistische Regression sinnvoll?
Ich unterrichte mich derzeit selbst in der Klassifizierung und beschäftige mich speziell mit drei Methoden: Unterstützung von Vektormaschinen, neuronalen Netzwerken und logistischer Regression. Ich versuche zu verstehen, warum die logistische Regression jemals besser abschneiden würde als die beiden anderen. Nach meinem Verständnis der logistischen Regression besteht die Idee darin, eine …

2
Regression, wenn jeder Punkt sowohl in
Ich habe nnn Messungen mit zwei Variablen und . Sie haben beide bekannte Unsicherheiten und die mit ihnen verbunden sind. Ich möchte die Beziehung zwischen x und y finden . Wie kann ich es tun?y σ xxxxyyyσxσx\sigma_xσyσy\sigma_yxxxyyy BEARBEITEN : Mit jedem ist ein anderes und mit dem dasselbe .xixix_i y …



2
Unterschiedliche AIC-Definitionen
Aus Wikipedia gibt es eine Definition von Akaikes Informationskriterium (AIC) als , wobei die Anzahl der Parameter und die log-Wahrscheinlichkeit des Modells ist.AIC=2k−2logLAIC=2k−2log⁡L AIC = 2k -2 \log L kkklogLlog⁡L\log L Unsere Ökonometrie stellt jedoch an einer angesehenen Universität fest, dass . Hier ist die geschätzte Varianz für die Fehler …

2
Erwartung des Maximums von iid Gumbel-Variablen
Ich lese in Wirtschaftsmagazinen immer wieder über ein bestimmtes Ergebnis, das in zufälligen Gebrauchsmustern verwendet wird. Eine Version des Ergebnisses ist: wenn ϵi∼iid,ϵi∼iid,\epsilon_i \sim_{iid}, Gumbel ( μ,1),∀iμ,1),∀i\mu, 1), \forall i , dann gilt : E[maxi(δi+ϵi)]=μ+γ+ln(∑iexp{δi}),E[maxi(δi+ϵi)]=μ+γ+ln⁡(∑iexp⁡{δi}),E[\max_i(\delta_i + \epsilon_i)] = \mu + \gamma + \ln\left(\sum_i \exp\left\{\delta_i \right\} \right), wobei γ≈0.52277γ≈0.52277\gamma \approx 0.52277 …

2
Summe der Bewertungen im Vergleich zu den geschätzten Faktorbewertungen?
Es würde mich interessieren, Vorschläge zu erhalten, wann beim Erstellen von Skalen " Faktor-Scores " über einer einfachen Summe von Scores verwendet werden sollten. Dh "verfeinert" gegenüber "nicht verfeinerten" Methoden zur Bewertung eines Faktors. Aus DiStefano et al. (2009; pdf ), Hervorhebung hinzugefügt: Es gibt zwei Hauptklassen von Faktor-Score-Berechnungsmethoden: verfeinert …

2
Schlecht konditionierte Kovarianzmatrix in der GP-Regression zur Bayes'schen Optimierung
Hintergrund und Problem Ich verwende Gaußsche Prozesse (GP) zur Regression und anschließenden Bayes'schen Optimierung (BO). Für die Regression verwende ich das gpml- Paket für MATLAB mit mehreren benutzerdefinierten Modifikationen, aber das Problem ist allgemein. Es ist eine bekannte Tatsache, dass, wenn zwei Trainingseingaben im Eingaberaum zu nahe beieinander liegen, die …

3
Warum ist es wichtig, zwischen „linearer“ und „nichtlinearer“ Regression zu unterscheiden?
Welche Bedeutung hat die Unterscheidung zwischen linearen und nichtlinearen Modellen? Die Frage Nichtlineares vs. verallgemeinertes lineares Modell: Wie verweisen Sie auf logistische, Poisson usw. Regression? und ihre Antwort war eine äußerst hilfreiche Klärung der Linearität / Nichtlinearität verallgemeinerter linearer Modelle. Es scheint von entscheidender Bedeutung zu sein, lineare von nichtlinearen …

2
Ist Slutskys Theorem immer noch gültig, wenn zwei Folgen zu einer nicht entarteten Zufallsvariablen konvergieren?
Ich bin verwirrt über einige Details zu Slutskys Theorem : Sei , zwei Folgen von skalaren / Vektor / Matrix-Zufallselementen.{Xn}{Xn}\{X_n\}{Yn}{Yn}\{Y_n\} Konvergiert in der Verteilung zu einem zufälligen Element und Y_n in der Wahrscheinlichkeit zu einer Konstanten c , dann \ eqalign {X_ {n} + Y_ {n} \ & {\ xrightarrow …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.