Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Gaußsche Prozessregression für hochdimensionale Datensätze
Ich wollte nur sehen, ob jemand Erfahrung mit der Anwendung der Gaußschen Prozessregression (GPR) auf hochdimensionale Datensätze hat. Ich untersuche einige der verschiedenen spärlichen GPR-Methoden (z. B. spärliche Pseudo-Eingänge GPR), um herauszufinden, was für hochdimensionale Datensätze funktionieren könnte, bei denen die Auswahl von Merkmalen idealerweise Teil des Parameterauswahlprozesses ist. Vorschläge …

1
Ist es akzeptabel, zwei lineare Modelle mit demselben Datensatz auszuführen?
Ist es für eine lineare Regression mit mehreren Gruppen (natürliche Gruppen, die a priori definiert wurden) akzeptabel, zwei verschiedene Modelle mit demselben Datensatz auszuführen, um die folgenden zwei Fragen zu beantworten? Hat jede Gruppe eine Steigung ungleich Null und einen Achsenabschnitt ungleich Null und welche Parameter gibt es für jede …

4
Wie kann ich die Pearson -Teststatistik für mangelnde Übereinstimmung mit einem logistischen Regressionsmodell in R berechnen ?
Die Statistik des Wahrscheinlichkeitsverhältnisses (auch bekannt als Abweichung) und der Test auf mangelnde Anpassung (oder Anpassungsgüte) sind für ein logistisches Regressionsmodell (Anpassung unter Verwendung der Funktion) in R ziemlich einfach zu erhalten . Dies kann jedoch sein Es ist leicht, einige Zellzahlen so niedrig zu halten, dass der Test unzuverlässig …

1
Fisher Test in R.
Angenommen, wir haben den folgenden Datensatz: Men Women Dieting 10 30 Non-dieting 5 60 Wenn ich den Fisher-Exakt-Test in R durchführe, was bedeutet dann alternative = greater(oder weniger)? Beispielsweise: mat = matrix(c(10,5,30,60), 2,2) fisher.test(mat, alternative="greater") Ich bekomme das p-value = 0.01588und odds ratio = 3.943534. Wenn ich die Zeilen der …

1
R lineare Regression kategoriale Variable "versteckter" Wert
Dies ist nur ein Beispiel, auf das ich mehrmals gestoßen bin, daher habe ich keine Beispieldaten. Ausführen eines linearen Regressionsmodells in R: a.lm = lm(Y ~ x1 + x2) x1ist eine stetige Variable. x2ist kategorisch und hat drei Werte, z. B. "Niedrig", "Mittel" und "Hoch". Die von R gegebene Ausgabe …
10 r  regression  categorical-data  regression-coefficients  categorical-encoding  machine-learning  random-forest  anova  spss  r  self-study  bootstrap  monte-carlo  r  multiple-regression  partitioning  neural-networks  normalization  machine-learning  svm  kernel-trick  self-study  survival  cox-model  repeated-measures  survey  likert  correlation  variance  sampling  meta-analysis  anova  independence  sample  assumptions  bayesian  covariance  r  regression  time-series  mathematical-statistics  graphical-model  machine-learning  linear-model  kernel-trick  linear-algebra  self-study  moments  function  correlation  spss  probability  confidence-interval  sampling  mean  population  r  generalized-linear-model  prediction  offset  data-visualization  clustering  sas  cart  binning  sas  logistic  causality  regression  self-study  standard-error  r  distributions  r  regression  time-series  multiple-regression  python  chi-squared  independence  sample  clustering  data-mining  rapidminer  probability  stochastic-processes  clustering  binary-data  dimensionality-reduction  svd  correspondence-analysis  data-visualization  excel  c#  hypothesis-testing  econometrics  survey  rating  composite  regression  least-squares  mcmc  markov-process  kullback-leibler  convergence  predictive-models  r  regression  anova  confidence-interval  survival  cox-model  hazard  normal-distribution  autoregressive  mixed-model  r  mixed-model  sas  hypothesis-testing  mediation  interaction 

1
Auf welche Probleme sollte ich beim Kombinieren mehrerer Zeitreihen achten?
Angenommen, ich habe eine Reihe von Zeitreihen, z. B. eine Reihe von Temperaturaufzeichnungen von verschiedenen Stationen in einer Region. Ich möchte einen einzigen Temperaturrekord für die gesamte Region erhalten, mit dem ich Aspekte des regionalen Klimas beschreiben kann. Der intuitive Ansatz könnte darin bestehen, einfach den Durchschnitt aller Stationen zu …


2
Wie verteilt sich der Fehler auf logistische Wachstumsdaten?
In der Ökologie verwenden wir häufig die logistische Wachstumsgleichung: N.t= K.N.0er tK.+ N.0er t - 1Nt=KN0ertK+N0ert−1 N_t = \frac{ K N_0 e^{rt} }{K + N_0 e^{rt-1}} oder N.t= K.N.0N.0+ ( K.- N.0) e- r tNt=KN0N0+(K−N0)e−rt N_t = \frac{ K N_0}{N_0 + (K -N_0)e^{-rt}} wobei die Tragfähigkeit ist (maximale Dichte erreicht), …
10 r  distributions  pdf  ecology 


2
So behandeln Sie mehrere Datenpunkte pro Subjekt richtig
Ich diskutiere derzeit mit jemandem darüber, wie Daten mit mehreren Messungen für jedes Subjekt richtig behandelt werden können. In diesem Fall wurden für jedes Subjekt innerhalb kurzer Zeit Daten für unterschiedliche Bedingungen innerhalb jedes Subjekts gesammelt. Alle Messungen erfassen genau dieselbe Variable, nur mehrere. Eine Möglichkeit besteht nun darin, die …

3
Wo ist die gemeinsame Varianz zwischen allen IVs in einer linearen multiplen Regressionsgleichung?
Wenn in einer linearen multiplen Regressionsgleichung die Beta-Gewichte den Beitrag jeder einzelnen unabhängigen Variablen über den Beitrag aller anderen IVs hinaus widerspiegeln, wobei in der Regressionsgleichung die Varianz von allen IVs geteilt wird, die den DV vorhersagen? Wenn beispielsweise das unten angezeigte Venn-Diagramm (und von der Info -Seite des Lebenslaufs …

2
Wie simuliere ich multivariate Ergebnisse in R?
In den meisten Situationen beschäftigen wir uns nur mit einer Ergebnis- / Antwortvariablen wie . In einigen Szenarien, insbesondere in den klinischen Daten, können die Ergebnisvariablen jedoch hochdimensional / multivariat sein. Beispiel: , wobei die , und enthält und diese Ergebnisse alle korreliert sind. Wenn die Behandlung darstellt (Ja / …


3
Wie erstelle ich ein Empfehlungssystem, das sowohl kollaborative Filter- als auch Inhaltsfunktionen integriert?
Ich erstelle ein Empfehlungssystem und möchte sowohl die Bewertungen "ähnlicher" Benutzer als auch die Funktionen der Elemente berücksichtigen. Die Ausgabe ist eine vorhergesagte Bewertung [0-1]. Ich erwäge ein neuronales Netzwerk (zu Beginn). Die Eingaben sind also eine Kombination aus den Merkmalen der Elemente und den Bewertungen jedes Benutzers. Für Punkt …

1
Fehlende Werte in der Antwortvariablen in JAGS
Gelman & Hill (2006) sagen: In Bugs können fehlende Ergebnisse in einer Regression einfach behandelt werden, indem einfach der Datenvektor, die NAs und alle eingeschlossen werden. Bugs modellieren die Ergebnisvariable explizit. Daher ist es trivial, dieses Modell zu verwenden, um fehlende Werte bei jeder Iteration zu unterstellen. Dies klingt nach …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.