Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Verwenden von BIC zum Schätzen der Anzahl von k in KMEANS
Ich versuche derzeit, den BIC für meinen Spielzeugdatensatz (ofc iris (:)) zu berechnen. Ich möchte die hier gezeigten Ergebnisse reproduzieren (Abb. 5). Dieses Papier ist auch meine Quelle für die BIC-Formeln. Ich habe 2 Probleme damit: Notation: nichnichn_i = Anzahl der Elemente in Clusterichichi CichCichC_i = Mittelkoordinaten des Clustersichichi xjxjx_j …


5
Mehrfachzuschreibung für fehlende Werte
Ich möchte die Imputation verwenden, um fehlende Werte in meinem Datensatz unter bestimmten Bedingungen zu ersetzen. Zum Beispiel möchte ich, dass die unterstellte Variable x1größer oder gleich der Summe meiner beiden anderen Variablen ist, sagen wir x2und x3. Ich möchte x3auch von entweder 0oder unterstellt werden, >= 14und ich möchte …

5
Finden von Wendepunkten in R aus geglätteten Daten
Ich habe einige Daten, die ich glatt benutze loess. Ich möchte die Wendepunkte der geglätteten Linie finden. Ist das möglich? Ich bin mir sicher, dass jemand eine ausgefallene Methode entwickelt hat, um dieses Problem zu lösen. Ich meine, schließlich ist es R! Ich kann die Glättungsfunktion, die ich verwende, problemlos …
13 r  smoothing  loess 

4
Unterscheidung zwischen linearem und nichtlinearem Modell
Ich habe einige Erklärungen zu den Eigenschaften von linearen und nichtlinearen Modellen gelesen, bin mir aber manchmal nicht sicher, ob es sich bei dem vorliegenden Modell um ein lineares oder ein nichtlineares Modell handelt. Ist beispielsweise das folgende Modell linear oder nichtlinear? yt=β0+β1B(L;θ)Xt+εtyt=β0+β1B(L;θ)Xt+εty_t=\beta_0 + \beta_1B(L;\theta)X_t+\varepsilon_t Mit: B(L;θ)=∑k=1Kb(k;θ)LkB(L;θ)=∑k=1Kb(k;θ)LkB(L;\theta)=\sum_{k=1}^{K}b(k;\theta)L^k LkXt=Xt−kLkXt=Xt−kL^kX_t=X_{t-k} Wobei eine …

3
Muss ich korrelierte / kollineare Variablen löschen, bevor ich kmeans laufen lasse?
Ich laufe Kilometer, um Kundencluster zu identifizieren. Ich habe ungefähr 100 Variablen, um Cluster zu identifizieren. Jede dieser Variablen gibt den Prozentsatz der Ausgaben eines Kunden für eine Kategorie an. Wenn ich also 100 Kategorien habe, habe ich diese 100 Variablen, sodass die Summe dieser Variablen für jeden Kunden 100% …

1
Voraussetzungen für die Existenz einer Fisher-Informationsmatrix
Verschiedene Lehrbücher führen unterschiedliche Bedingungen für die Existenz einer Fisher-Informationsmatrix an. Im Folgenden sind einige dieser Bedingungen aufgeführt, von denen jede in einigen, aber nicht allen Definitionen der "Fisher-Informationsmatrix" vorkommt. Gibt es eine standardmäßige Mindestmenge an Bedingungen? Welche der folgenden 5 Bedingungen kann beseitigt werden? Wenn eine der Bedingungen beseitigt …


1
Können Sie AIC-Werte vergleichen, solange die Modelle auf demselben Datensatz basieren?
Ich mache eine Prognose in R mit Rob Hyndmans Prognosepaket . Das zum Paket gehörende Papier finden Sie hier . In dem Artikel implementieren die Autoren die Algorithmen nach der Erläuterung der automatischen Vorhersagealgorithmen auf demselben Datensatz. Nach der Schätzung eines exponentiellen Glättungsmodells und eines ARIMA-Modells geben sie jedoch eine …

2
Beziehung zwischen den Korrelationskoeffizienten phi, Matthews und Pearson
Sind die Phi- und Matthews-Korrelationskoeffizienten dasselbe Konzept? In welcher Beziehung stehen sie zum Pearson-Korrelationskoeffizienten für zwei Binärvariablen oder entsprechen diesen? Ich gehe davon aus, dass die Binärwerte 0 und 1 sind. Die Pearson-Korrelation zwischen zwei Bernoulli-Zufallsvariablen und y ist:xxxyyy ρ=E[(x−E[x])(y−E[y])]Var[x]Var[y]−−−−−−−−−−√=E[xy]−E[x]E[y]Var[x]Var[y]−−−−−−−−−−√=n11n−n1∙n∙1n0∙n1∙n∙0n∙1−−−−−−−−−−√ρ=E[(x−E[x])(y−E[y])]Var[x]Var[y]=E[xy]−E[x]E[y]Var[x]Var[y]=n11n−n1∙n∙1n0∙n1∙n∙0n∙1 \rho = \frac{\mathbb{E} [(x - \mathbb{E}[x])(y - \mathbb{E}[y])]} {\sqrt{\text{Var}[x] \, …


3
Gesamtrang aus mehreren Ranglisten
Ich habe eine Menge online verfügbarer Literatur durchgesehen, einschließlich dieses Forums, und gehofft, dass jemand bei einem statistischen Problem helfen kann, mit dem ich derzeit konfrontiert bin: Ich habe 5 Listen mit Rangdaten, von denen jede 10 Elemente von Position 1 (am besten) bis Position 10 (am schlechtesten) enthält. Aus …

1
Grundlegendes zu MCMC und dem Metropolis-Hastings-Algorithmus
In den letzten Tagen habe ich versucht zu verstehen, wie Markov Chain Monte Carlo (MCMC) funktioniert. Insbesondere habe ich versucht, den Metropolis-Hastings-Algorithmus zu verstehen und zu implementieren. Bisher denke ich, dass ich den Algorithmus allgemein verstehe, aber es gibt ein paar Dinge, die mir noch nicht klar sind. Ich möchte …


3
Euklidische Distanzbewertung und Ähnlichkeit
Ich arbeite gerade mit dem Buch Collective Intelligence (von Toby Segaran) und bin auf die euklidische Distanz-Bewertung gestoßen. In dem Buch zeigt der Autor, wie die Ähnlichkeit zwischen zwei Empfehlungsarrays (dh berechnet wird .person×movie↦score)person×movie↦score)\textrm{person} \times \textrm{movie} \mapsto \textrm{score}) Er berechnet den euklidischen Abstand für zwei Personen und p 2 durch …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.