Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren





2
Komplexes Regressionsdiagramm in R.
Ich muss eine komplexe Grafik für die visuelle Datenanalyse zeichnen. Ich habe 2 Variablen und eine große Anzahl von Fällen (> 1000). Zum Beispiel (die Zahl ist 100, wenn die Dispersion weniger "normal" sein soll): x <- rnorm(100,mean=95,sd=50) y <- rnorm(100,mean=35,sd=20) d <- data.frame(x=x,y=y) 1) Ich muss Rohdaten mit Punktgröße …

1
Metaanalyse in R mit metafor package
Wie soll ich die rmaFunktion aus dem Metafor- Paket syntaxieren , um Ergebnisse im folgenden realen Beispiel einer kleinen Metaanalyse zu erhalten? (Zufallseffekt, zusammenfassende Statistik SMD) study, mean1, sd1, n1, mean2, sd2, n2 Foo2000, 0.78, 0.05, 20, 0.82, 0.07, 25 Sun2003, 0.74, 0.08, 30, 0.72, 0.05, 19 Pric2005, 0.75, 0.12, …
10 r  meta-analysis 

1
Wie korreliere ich zwei Zeitreihen mit Lücken und unterschiedlichen Zeitbasen?
Ich habe diese Frage bei StackOverflow gestellt und wurde empfohlen, sie hier zu stellen. Ich habe zwei Zeitreihen von 3D-Beschleunigungsmesserdaten, die unterschiedliche Zeitbasen haben (Uhren wurden zu unterschiedlichen Zeiten gestartet, mit einem sehr geringen Kriechen während der Abtastzeit) sowie viele Lücken unterschiedlicher Größe (aufgrund von Verzögerungen beim Schreiben zum Trennen) …

1
Alternatives Trichterdiagramm ohne Verwendung des Standardfehlers (SE)
Vor Einreichung meiner Metaanalyse möchte ich ein Trichterdiagramm erstellen, um die Heterogenität und die Publikationsverzerrung zu testen. Ich habe die gepoolte Effektgröße und die Effektgrößen aus jeder Studie, die Werte von -1 bis +1 annehmen. Ich habe die Stichprobengrößen n1, n2 für Patienten und Kontrollen aus jeder Studie. Da ich …

4
Statistische Software testen
Welche Techniken / Ansätze sind beim Testen statistischer Software nützlich? Ich interessiere mich besonders für Programme, die parametrische Schätzungen mit maximaler Wahrscheinlichkeit durchführen. Der Vergleich von Ergebnissen mit denen aus anderen Programmen oder veröffentlichten Quellen ist nicht immer möglich, da die meiste Zeit, wenn ich ein eigenes Programm schreibe, die …

2
RNG, R, mclapply und Cluster von Computern
Ich führe eine Simulation auf R und einem Computercluster aus und habe das folgende Problem. Auf jedem der X Computer, die ich ausführe: fxT2 <- function(i) runif(10) nessay <- 100 c(mclapply(1:nessay, fxT2), recursive=TRUE) Es gibt 32 Computer mit jeweils 16 Kernen. Etwa 2% der Zufallszahlen sind jedoch identisch. Welche Strategien …


4
Eine Ressource zu Konzepten, die Statistiken zugrunde liegen, nicht zu den Techniken, die in angewandten Statistiken verwendet werden
Welches Buch behandelt grundlegende Konzepte in der Statistik am gründlichsten? Ich bitte nicht um ein Buch über Details der Berechnungsmethoden und -verfahren, sondern hauptsächlich um ein Buch, das die grundlegenden Konzepte gründlich erklärt ... eine intuitive / illustrierte / visuelle Herangehensweise an die Kernideen ... anstatt zu laden von mathematischen …
10 references 

1
Verwenden des Statistikpakets in R für kmeans-Clustering
Ich habe Schwierigkeiten, einen oder zwei Aspekte des Cluster-Pakets zu verstehen. Ich verfolge das Beispiel von Quick-R genau, verstehe aber einen oder zwei Aspekte der Analyse nicht. Ich habe den Code eingefügt, den ich für dieses spezielle Beispiel verwende. ## Libraries library(stats) library(fpc) ## Data mydata = structure(list(a = c(461.4210925, …
10 r  clustering 

1
Wie quantifiziere ich die Redundanz von Features?
Ich habe drei Funktionen, mit denen ich ein Klassifizierungsproblem lösen kann. Ursprünglich erzeugten diese Features boolesche Werte, sodass ich ihre Redundanz bewerten konnte, indem ich mir ansah, wie stark sich die Sätze positiver und negativer Klassifikationen überschneiden. Jetzt habe ich die Funktionen erweitert, um stattdessen echte Werte (Scores) zu erzeugen, …

3
Wie schätze ich Parameter für die abgeschnittene Zipf-Verteilung aus einer Datenprobe?
Ich habe ein Problem mit dem Schätzparameter für Zipf. Meine Situation ist folgende: Ich habe einen Beispielsatz (gemessen aus einem Experiment, das Aufrufe generiert, die einer Zipf-Verteilung folgen sollten). Ich muss zeigen, dass dieser Generator wirklich Anrufe mit zipf-Verteilung generiert. Ich habe diese Fragen und Antworten bereits gelesen. Wie berechnet …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.