Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Restanalyse der logistischen Regression
Diese Frage ist allgemein und langwierig, aber bitte nehmen Sie Kontakt mit mir auf. In meiner Anwendung habe ich viele Datensätze, die jeweils aus ~ 20.000 Datenpunkten mit ~ 50 Features und einer einzelnen abhängigen Binärvariablen bestehen. Ich versuche, die Datensätze mithilfe einer regulierten logistischen Regression (R-Paket glmnet ) zu …

1
Wie kann ich die Recheneffizienz optimieren, wenn ich ein komplexes Modell wiederholt an einen großen Datensatz anpasse?
Ich habe Leistungsprobleme mit dem MCMCglmmPaket in R, um ein Modell mit gemischten Effekten auszuführen. Der Code sieht folgendermaßen aus: MC1<-MCMCglmm(bull~1,random=~school,data=dt,family="categorical" , prior=list(R=list(V=1,fix=1), G=list(G1=list(V=1, nu=0))) , slice=T, nitt=iter, ,burnin=burn, verbose=F) Die Daten enthalten rund 20.000 Beobachtungen, die in rund 200 Schulen zusammengefasst sind. Ich habe alle nicht verwendeten Variablen aus …

2
Wie werden Funktionsdaten simuliert?
Ich versuche verschiedene Ansätze zur Funktionsdatenanalyse zu testen. Idealerweise möchte ich das Panel meiner Ansätze an simulierten Funktionsdaten testen. Ich habe versucht, eine simulierte FD mithilfe eines Ansatzes zu generieren, der auf einer Summierung von Gaußschen Rauschen basiert (Code unten), aber die resultierenden Kurven sehen im Vergleich zur Realität viel …

2
Wie gehe ich mit dem Deckeneffekt durch das Messwerkzeug um?
Ich habe psychophysiologische Daten gesammelt, die die Fähigkeit der Probanden (zwei Gruppen) messen, Schwingungen wahrzunehmen. Eine vibrierende Sonde bewegt sich bei immer kleineren Verschiebungen gegen die Haut, und das Subjekt zeigt an, wann es die Vibration spürt. Leider kann sich die Sonde bei hohen Frequenzen nur eine kurze Strecke bewegen, …


2
Wahrscheinlichkeitsverteilung bei gegebenem Datensatz automatisch bestimmen
Gegeben ein Datensatz: x <- c(4.9958942,5.9730174,9.8642732,11.5609671,10.1178216,6.6279774,9.2441754,9.9419299,13.4710469,6.0601435,8.2095239,7.9456672,12.7039825,7.4197810,9.5928275,8.2267352,2.8314614,11.5653497,6.0828073,11.3926117,10.5403929,14.9751607,11.7647580,8.2867261,10.0291522,7.7132033,6.3337642,14.6066222,11.3436587,11.2717791,10.8818323,8.0320657,6.7354041,9.1871676,13.4381778,7.4353197,8.9210043,10.2010750,11.9442048,11.0081195,4.3369520,13.2562675,15.9945674,8.7528248,14.4948086,14.3577443,6.7438382,9.1434984,15.4599419,13.1424011,7.0481925,7.4823108,10.5743730,6.4166006,11.8225244,8.9388744,10.3698150,10.3965596,13.5226492,16.0069239,6.1139247,11.0838351,9.1659242,7.9896031,10.7282936,14.2666492,13.6478802,10.6248561,15.3834373,11.5096033,14.5806570,10.7648690,5.3407430,7.7535042,7.1942866,9.8867927,12.7413156,10.8127809,8.1726772,8.3965665) .. Ich möchte die am besten passende Wahrscheinlichkeitsverteilung (Gamma, Beta, Normal, Exponentiell, Poisson, Chi-Quadrat usw.) mit einer Schätzung der Parameter bestimmen. Die Frage auf dem folgenden Link, wo eine Lösung mit R bereitgestellt wird, ist mir bereits bekannt: /programming/2661402/given-a-set-of-random-numbers-drawn-from-a- kontinuierliche-univariate-verteilung-f die beste vorgeschlagene lösung …

1
Wie kann man mit rjags Vorhersagen erstellen?
Ich habe rjags verwendet, um MCMC auf einem Modell auszuführen, das in der JAGS-Sprache angegeben ist. Gibt es eine gute Möglichkeit, dieses Modell zu extrahieren und Vorhersagen damit durchzuführen (unter Verwendung der posterioren Verteilungen meiner Parameter)? Ich kann das Modell in R neu spezifizieren und die Modi meiner Parameter posteriors …
12 r  jags 

1
Gibt es einen Zusammenhang zwischen empirischen Bayes und zufälligen Effekten?
Ich habe kürzlich etwas über empirische Bayes gelesen (Casella, 1985, Eine Einführung in die empirische Bayes-Datenanalyse) und es sah einem Zufallseffektmodell sehr ähnlich. dass beide Schätzungen auf den globalen Mittelwert geschrumpft sind. Aber ich habe es nicht durchgelesen ... Hat jemand einen Einblick in die Ähnlichkeit und Unterschiede zwischen ihnen?

3
Stellen Sie fest, ob sich ein verteilter Prozess mit starkem Schwanz erheblich verbessert hat
Ich beobachte die Bearbeitungszeiten eines Prozesses vor und nach einer Änderung, um festzustellen, ob sich der Prozess durch die Änderung verbessert hat. Der Prozess hat sich verbessert, wenn die Bearbeitungszeit reduziert wird. Die Verteilung der Verarbeitungszeit ist fett begrenzt, daher ist ein Vergleich anhand des Durchschnitts nicht sinnvoll. Stattdessen möchte …

1
Unterschiede zwischen PROC Mixed und lme / lmer in R - Freiheitsgraden
Hinweis: Diese Frage ist ein Repost, da meine vorherige Frage aus rechtlichen Gründen gelöscht werden musste. Beim Vergleich von PROC MIXED von SAS mit der Funktion lmeaus dem nlmePaket in R bin ich auf einige verwirrende Unterschiede gestoßen. Insbesondere unterscheiden sich die Freiheitsgrade in den verschiedenen Tests zwischen PROC MIXEDund …
12 r  mixed-model  sas  degrees-of-freedom  pdf  unbiased-estimator  distance-functions  functional-data-analysis  hellinger  time-series  outliers  c++  relative-risk  absolute-risk  rare-events  regression  t-test  multiple-regression  survival  teaching  multiple-regression  regression  self-study  t-distribution  machine-learning  recommender-system  self-study  binomial  standard-deviation  data-visualization  r  predictive-models  pearson-r  spearman-rho  r  regression  modeling  r  categorical-data  data-visualization  ggplot2  many-categories  machine-learning  cross-validation  weka  microarray  variance  sampling  monte-carlo  regression  cross-validation  model-selection  feature-selection  elastic-net  distance-functions  information-theory  r  regression  mixed-model  random-effects-model  fixed-effects-model  dataset  data-mining 


2
Wie erklären Sie den Unterschied zwischen dem relativen Risiko und dem absoluten Risiko?
Neulich habe ich mich mit einem Epidemiologen beraten lassen. Sie ist Ärztin mit einem Abschluss in Epidemiologie im Gesundheitswesen und verfügt über umfangreiche statistische Kenntnisse. Sie betreut ihre Forschungsstipendiaten und Bewohner und hilft ihnen bei statistischen Fragen. Sie versteht Hypothesentests ziemlich gut. Sie hatte das typische Problem, zwei Gruppen zu …

1
Warum ergibt das Quadrieren von
Dies mag eine grundlegende Frage sein, aber ich habe mich gefragt, warum ein RRR Wert in einem Regressionsmodell einfach quadriert werden kann, um eine Zahl der erklärten Varianz zu erhalten. Ich verstehe, dass der RRR Koeffizient die Stärke einer Beziehung angeben kann, aber ich verstehe nicht, wie einfach das Quadrieren …



Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.