Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


3
Cluster für k-means auswählen: der Fall 1 Cluster
Kennt jemand eine gute Methode, um festzustellen, ob Clustering mit kmeans überhaupt angemessen ist? Was ist, wenn Ihre Probe tatsächlich homogen ist? Ich weiß, dass so etwas wie ein Mischungsmodell (über mclust in R) Anpassungsstatistiken für den 1: k-Clusterfall liefert, aber es scheint, dass alle Techniken zur Bewertung von kmean …
9 r  clustering  k-means 


2
Buch für nicht parametrische Statistiken
Was wäre ein gutes Buch für nichtparametrische Statistiken? Nicht nur die Einführung, sondern auch das fortgeschrittene Niveau. Außerdem schaue ich mir etwas an, das ich zum Lernen und nicht als Referenz verwenden kann. Insbesondere suche ich nach einem Buch, das Grundlagen hinter nichtparametrischen Methoden, nichtparametrischen Inferenzen, Methoden zur Bewertung nichtparametrischer …

2
Verwenden des EM-Algorithmus für die Datensatzverknüpfung
Ich bin daran interessiert, Datensätze über 2 Datensätze nach Vorname, Nachname und Geburtsjahr zu verknüpfen. Könnte dies mit dem EM-Algorithmus machbar sein, und wenn ja, wie? Betrachten Sie die folgende Aufzeichnung im 1. als Beispiel: Carl McCarthy, 1967. Ich werde alle Datensätze im 2. Datensatz durchsuchen und einen Jaro-Winkler-Abstand zwischen …

3
Regression auf das mittlere Rätsel
Im Kapitel "Regression to the Mean" von Daniel Kahneman "Denken, schnell und langsam" wird ein Beispiel gegeben, und der Leser wird gebeten, den Umsatz einzelner Geschäfte anhand der Gesamtumsatzprognose und der Verkaufszahlen des Vorjahres zu prognostizieren . Zum Beispiel (das Beispiel des Buches hat 4 Geschäfte, der Einfachheit halber verwende …

2
Annahmen verallgemeinerter linearer Modelle
Auf Seite 232 von "Ein R-Begleiter zur angewandten Regression" bemerken Fox und Weisberg Nur die Gaußsche Familie hat eine konstante Varianz, und in allen anderen GLMs hängt die bedingte Varianz von y bei vonxx\bf{x}μ(x)μ(x)\mu(x) Zuvor haben sie festgestellt, dass die bedingte Varianz des Poisson und die des Binomials .μμ\muμ(1−μ)Nμ(1−μ)N\frac{\mu(1-\mu)}{N} Für …


2
Die Whisker eines Boxplots verstehen
Ich habe eine Frage zur Interpretation der Whisker eines Boxplots. Ich habe Folgendes gelesen: "Oben und unten im Rechteck zeigen die" Whisker "den Bereich des 1,5-fachen Abstands zwischen den 0,25- und 0,75-Quantilen", verstehe aber nicht ganz, was unter "Abstand" zu verstehen ist. . Es kann nicht sein, dass die Wahrscheinlichkeitsmasse …

2
Wie kann ich die Bedeutung verschiedener Eingaben für die Prognose für ein nichtlineares Black-Box-Modell visualisieren?
Ich erstelle ein interaktives Prognosetool (in Python) als Hilfe für Prognosen, die in meiner Organisation durchgeführt werden. Bisher war der Prognoseprozess weitgehend vom Menschen gesteuert, wobei Prognostiker die Daten in ihren natürlichen neuronalen Netzen assimilierten und ihr erlerntes Bauchgefühl verwendeten, um Vorhersagen zu treffen. Aus einer Langzeitstudie zur Überprüfung der …


3
Berechnung von Jaccard oder einem anderen Assoziationskoeffizienten für Binärdaten unter Verwendung der Matrixmultiplikation
Ich möchte wissen, ob es eine Möglichkeit gibt, den Jaccard-Koeffizienten mithilfe der Matrixmultiplikation zu berechnen. Ich habe diesen Code verwendet jaccard_sim <- function(x) { # initialize similarity matrix m <- matrix(NA, nrow=ncol(x),ncol=ncol(x),dimnames=list(colnames(x),colnames(x))) jaccard <- as.data.frame(m) for(i in 1:ncol(x)) { for(j in i:ncol(x)) { jaccard[i,j]= length(which(x[,i] & x[,j])) / length(which(x[,i] | …


5
Darstellung experimenteller Daten
Ich habe mit meinem Berater einen Streit über die Datenvisualisierung. Er behauptet, dass bei der Darstellung der experimentellen Ergebnisse die Werte nur mit " Markern " dargestellt werden sollten, wie im Bild unten dargestellt. Während Kurven nur ein " Modell " darstellen sollten Andererseits glaube ich, dass eine Kurve in …

1
Enorme Koeffizienten in der logistischen Regression - was bedeutet das und was ist zu tun?
Während der logistischen Regression erhalte ich enorme Koeffizienten, siehe Koeffizienten mit krajULKV: > summary(m5) Call: glm(formula = cbind(ml, ad) ~ rok + obdobi + kraj + resid_usili2 + rok:obdobi + rok:kraj + obdobi:kraj + kraj:resid_usili2 + rok:obdobi:kraj, family = "quasibinomial") Deviance Residuals: Min 1Q Median 3Q Max -2.7796 -1.0958 -0.3101 …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.