Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren



1
Ockhams Rasiermesser veraltet?
Ich habe Vapniks Bücher über statistisches Lernen gesehen ... Ich habe die ersten Kapitel gelesen. Was mich jedenfalls am meisten überraschte, war, dass er dachte, das Rasiermesser des Occam sei veraltet. Ich dachte, es hängt mit der Situation zusammen, in der die Annahme einer höheren Dimension die Passform erheblich verbessert. …



2
Regression durch den Ursprung
Wir haben die folgenden Punkte: Wie können wir die am besten passende Linie durch die Punkte finden? Mein Rechner hat die Option, die am besten passende Linie durch diese Punkte zu finden, nämlich:y = a x y = a x + b( 0 , 0 ) ( 1 , 51,8 …


1
Was ist mit dem „Level“ einer Zeitreihe gemeint?
In einem Großteil der Literatur, die ich studiere, ist es einer dieser Begriffe, die häufig vorkommen, ohne dass eine strenge Definition gefunden werden muss. Insbesondere wird mir gesagt: Für zeitindizierte Zufallsvariablen (RVs) wird das additive Zerlegungsmodell wie folgt angegeben{ X.t}}{Xt}\{X_t\} X.t= l l ( X.t - 1, X.t - 2, …

1
Was ist der Unterschied zwischen der Maximierung der bedingten (logarithmischen) Wahrscheinlichkeit oder der gemeinsamen (logarithmischen) Wahrscheinlichkeit bei der Schätzung der Parameter eines Modells?
Betrachten Sie eine Antwort y und Datenmatrix X . Angenommen, ich erstelle ein Modell des Formulars - y ~ g (X, )θθ\theta (g () könnte eine beliebige Funktion von X und )θθ\theta Zur Schätzung von θθ\theta Verwendung der Maximum Likelihood (ML) -Methode könnte ich entweder mit der bedingten ML (vorausgesetzt, …



5
Bootstrapping hierarchischer / mehrstufiger Daten (Resampling-Cluster)
Ich erstelle ein Skript zum Erstellen von Bootstrap-Beispielen aus dem catsDataset (aus dem -MASS-Paket). Nach dem Lehrbuch von Davidson und Hinkley [1] führte ich eine einfache lineare Regression durch und übernahm ein grundlegendes nichtparametrisches Verfahren für das Bootstrapping von iid-Beobachtungen, nämlich das Resampling von Paaren . Das Originalmuster hat folgende …

3
Wie kann bei Verwendung von glmnet die p-Wert-Signifikanz gemeldet werden, um die Signifikanz von Prädiktoren zu beanspruchen?
Ich habe eine große Anzahl von Prädiktoren (mehr als 43.000) zur Vorhersage einer abhängigen Variablen, die 2 Werte annehmen kann (0 oder 1). Die Anzahl der Beobachtungen beträgt mehr als 45.000. Die meisten Prädiktoren sind Unigramme, Bigramme und Trigramme von Wörtern, daher besteht zwischen ihnen ein hohes Maß an Kollinearität. …

1
Posteriore Verteilung für die Bayes'sche lineare Regression
Ich habe die Verwendung der Bayes'schen linearen Regression untersucht, bin aber zu einem Beispiel gekommen, über das ich verwirrt bin. Angesichts des Modells: y=βX+ϵy=βX+ϵ{\bf y} = {\bf \beta}{\bf X} + \bf{\epsilon} Angenommen, und ein ,ϵ∼N(0,ϕI)ϵ∼N(0,ϕI){\bf \epsilon} \sim N(0, \phi I)p(β,ϕ)∝1ϕp(β,ϕ)∝1ϕp(\beta, \phi) \propto \frac{1}{\phi} Wie wird erreicht?p(β|ϕ,y)p(β|ϕ,y)p(\beta|\phi, {\bf y}) Wobei: .p(β|ϕ,y)∼N(XTX)−1XTy,ϕ(XTX)−1)p(β|ϕ,y)∼N(XTX)−1XTy,ϕ(XTX)−1)p(\beta|\phi, …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.