Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren



5
Wann ist die Quantilregression schlechter als die OLS?
Abgesehen von einigen besonderen Umständen, in denen wir die bedingte mittlere Beziehung unbedingt verstehen müssen, in welchen Situationen sollte ein Forscher OLS anstelle von Quantile Regression wählen? Ich möchte nicht, dass die Antwort "wenn es keinen Sinn macht, die Schwanzbeziehungen zu verstehen" lautet, da wir einfach die mediane Regression als …

3
Beaufsichtigtes Clustering oder Klassifikation?
Die zweite Frage ist, dass ich in einer Diskussion irgendwo im Internet über "überwachtes Clustering" gesprochen habe. Soweit ich weiß, ist Clustering nicht überwacht. Was genau bedeutet "überwachtes Clustering"? Was ist der Unterschied zur "Klassifizierung"? Es gibt viele Links, die darüber sprechen: http://www.cs.uh.edu/docs/cosc/technical-reports/2005/05_10.pdf http://books.nips.cc/papers/files/nips23/NIPS2010_0427.pdf http://engr.case.edu/ray_soumya/mlrg/supervised_clustering_finley_joachims_icml05.pdf http://www.public.asu.edu/~kvanlehn/Stringent/PDF/05CICL_UP_DB_PWJ_KVL.pdf http://www.machinelearning.org/proceedings/icml2007/papers/366.pdf http://www.cs.cornell.edu/~tomf/publications/supervised_kmeans-08.pdf http://jmlr.csail.mit.edu/papers/volume6/daume05a/daume05a.pdf etc …


1
Sind inkonsistente Schätzer jemals vorzuziehen?
Konsistenz ist offensichtlich ein natürlicher und wichtiger Eigenschaftsschätzer, aber gibt es Situationen, in denen es besser ist, einen inkonsistenten Schätzer als einen konsistenten zu verwenden? Gibt es Beispiele für einen inkonsistenten Schätzer, der einen vernünftigen konsistenten Schätzer für alle endlichen (in Bezug auf eine geeignete Verlustfunktion) übertrifft ?nnn




4
So schreiben Sie eine lineare Modellformel mit 100 Variablen in R
Verschlossen . Diese Frage und ihre Antworten sind gesperrt, da die Frage nicht zum Thema gehört, aber von historischer Bedeutung ist. Derzeit werden keine neuen Antworten oder Interaktionen akzeptiert. Gibt es in R eine einfache Möglichkeit, eine lineare Regression über ein Modell mit 100 Parametern in R zu erstellen? Angenommen, …
22 r 

2
Wie sollen Mixed-Effects-Modelle verglichen und / oder validiert werden?
Wie werden (lineare) Mischeffektmodelle normalerweise miteinander verglichen? Ich weiß, dass Likelihood-Ratio-Tests verwendet werden können, aber dies funktioniert nicht, wenn ein Modell nicht die richtige Teilmenge des anderen Modells ist. Ist die Schätzung der Modelle df immer einfach? Anzahl der Fixeffekte + Anzahl der geschätzten Varianzkomponenten? Ignorieren wir die Schätzungen für …

1
Wie zerlege ich eine Zeitreihe mit mehreren saisonalen Komponenten?
Ich habe eine Zeitreihe, die doppelte saisonale Komponenten enthält, und ich möchte die Reihe in die folgenden Zeitreihenkomponenten aufteilen (Trend, saisonale Komponente 1, saisonale Komponente 2 und unregelmäßige Komponente). Soweit mir bekannt ist, erlaubt die STL-Prozedur zum Zerlegen einer Reihe in R nur eine saisonale Komponente, daher habe ich versucht, …

1
Wie berechnet man in R bei einer Ausgabe von optim mit einer Hessischen Matrix die Parameter-Konfidenzintervalle mit der Hessischen Matrix?
Wie werden bei einer Ausgabe von optim mit einer Hessischen Matrix die Parameter-Konfidenzintervalle mithilfe der Hessischen Matrix berechnet? fit<-optim(..., hessian=T) hessian<-fit$hessian Ich interessiere mich hauptsächlich für den Kontext der Maximum-Likelihood-Analyse, bin aber gespannt, ob die Methode darüber hinaus erweitert werden kann.

2
Wie passe ich einen Datensatz an eine Pareto-Verteilung in R an?
Nehmen wir zum Beispiel folgende Daten an: 8232302 684531 116857 89724 82267 75988 63871 23718 1696 436 439 248 235 Sie möchten einen einfachen Weg finden, um dieses (und mehrere andere Datasets) an eine Pareto-Distribution anzupassen. Idealerweise würde es die passenden theoretischen Werte ausgeben, weniger idealerweise die Parameter.

1
Berechnung der statistischen Leistung
Nach meinem Verständnis muss ich mindestens drei Aspekte (von vier) meiner vorgeschlagenen Studie kennen, um eine Leistungsanalyse durchführen zu können: Art des Tests - Ich beabsichtige Pearson's R und ANCOVA / Regression - GLM zu verwenden Signifikanzniveau (Alpha) - Ich beabsichtige, 0,05 zu verwenden Erwartete Effektgröße - Ich beabsichtige, eine …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.