Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

7
Zeichnen von Konfidenzintervallbalken aus zusammenfassenden Statistiken
Ein bisschen wie ein Boxplot. Ich meine nicht unbedingt das Standard-obere Konfidenzintervall, das untere Konfidenzintervall, den Mittelwert und die Box-Plots, die den Datenbereich anzeigen, aber ich meine wie ein Box-Plot mit nur den drei Daten: dem 95% -Konfidenzintervall und dem Mittelwert . Dies ist ein Screenshot eines Zeitschriftenartikels, der genau …

3
Auswahl zwischen Transformationen in der logistischen Regression
Bei der linearen Regression werden die Transformationen erklärender Variablen so durchgeführt, dass eine maximale Korrelation mit der abhängigen Variablen besteht. Was ist das beste Maß für die Wahl zwischen mehreren Transformationen in der logistischen Regression, da die abhängige Variable binär und nicht kontinuierlich ist? Das Endziel besteht darin, den Auftrieb …

1
Ausgelassene Kreuzvalidierung: Relativ unvoreingenommene Schätzung der Generalisierungsleistung?
Ich habe gelesen, dass eine ausgelassene Kreuzvalidierung eine relativ „unvoreingenommene Schätzung der tatsächlichen Generalisierungsleistung“ liefert (z. B. hier ) und dass dies eine vorteilhafte Eigenschaft des ausgelassenen Lebenslaufs ist. Ich sehe jedoch nicht, wie sich dies aus den Eigenschaften eines ausgelassenen Lebenslaufs ergibt. Warum ist die Tendenz dieses Schätzers im …

2
Gewichte in der Quantilregression für komplexe Erhebungen in R.
Ich möchte Stichprobengewichte in mein Quantil-Regressionsmodell aufnehmen, bin mir aber nicht sicher, wie ich das machen soll. Ich habe bereits mein Gewicht definiert. Hierbei handelt es sich um replizierte Gewichte, die bereits im Umfragedatensatz angegeben sind (berechnet im Umfragepaket): w<-svrepdesign(variables=data[,1:10],repweights=data[,11:30],type="BRR", combined.weights=TRUE, weights=r.weights, rho=0.5,dbname="") und mein rq modell ist: rq(y~x,tau=c(.1,.2,.3,.4,.5,.6,.7,.8,.9),data=my.data)) Ich …

1
Anpassen eines Gaußschen Mischungsmodells unter Verwendung eines stochastischen Gradientenabfalls
Ich arbeite an einem Online-Lernmodell für Kategorien, das einen stochastischen Gradientenabstieg verwendet, um ein Gaußsches Mischungsmodell anzupassen. Das Modell basiert auf dem Online-Lernmodell von Toscano & McMurray (2010). Während der Gradientenabstieg ziemlich gut zu funktionieren scheint, um die Mittelwerte und Häufigkeiten / Mischungswahrscheinlichkeiten der Kategorien abzuschätzen, habe ich Probleme mit …

2
Nichtnormalität in Residuen
Ich beziehe mich auf diesen Beitrag, der die Bedeutung der Normalverteilung der Residuen in Frage zu stellen scheint, und argumentiere, dass dies zusammen mit der Heteroskedastizität möglicherweise durch die Verwendung robuster Standardfehler vermieden werden könnte. Ich habe verschiedene Transformationen in Betracht gezogen - Wurzeln, Protokolle usw. - und alles erweist …

1
Mahalanobis-Abstand bei nicht normalen Daten
Der Mahalanobis-Abstand nimmt bei Verwendung zu Klassifizierungszwecken typischerweise eine multivariate Normalverteilung an, und die Abstände vom Schwerpunkt sollten dann einer Verteilung folgen (wobei Freiheitsgrade gleich der Anzahl der Dimensionen / Merkmale sind). Wir können die Wahrscheinlichkeit, dass ein neuer Datenpunkt zur Menge gehört, anhand seiner Mahalanobis-Entfernung berechnen.χ2χ2\chi^2ddd Ich habe Datensätze, …

2
Wie kombiniere ich mehrere unterstellte Datensätze?
Ich benötige einen einzelnen unterstellten Datensatz (z. B. um einen Ländergruppen-Dummy aus den unterstellten Pro-Kopf-Einkommensdaten des Landes zu erstellen). R bietet ein Paketpaket zum Erstellen mehrerer unterstellter Daten (z. B. Amelia) und zum Kombinieren von Ergebnissen aus mehreren Datensätzen (wie in MItools). Ich mache mir Sorgen, ob ich alle unterstellten …

1
Stationarität - Annahmen und Prüfung
Ich untersuche Nagetierfänge auf sechs permanenten Nagetierfanggittern mit einer Größe von 150 x 150 Metern, die aus 121 Fangstationen bestehen, die gleichmäßig 15 Meter voneinander entfernt sind. Auf dem Untersuchungsgebiet gibt es sechs solcher Fanggitter mit einer Größe von <1000 Hektar. Ich möchte die Erfassungsdaten interpolieren, um eine Kriged-Oberfläche mit …

1
Wie verallgemeinert das verallgemeinerte lineare Modell das allgemeine lineare Modell?
Aus Wikipedia Das allgemeine lineare Modell (GLM) ist ein statistisches lineares Modell. Es kann geschrieben werden als 1 Y=XB+U,Y=XB+U, \mathbf{Y} = \mathbf{X}\mathbf{B} + \mathbf{U}, wobei YYY eine Matrix mit einer Reihe multivariater Messungen ist, XXX eine Matrix ist, die eine Entwurfsmatrix sein kann, BBB eine Matrix ist, die Parameter enthält, …

2
Ist es technisch „gültig“, eine logistische Regression mit einer abhängigen Variablen anzupassen, die ein Anteil ist?
Mehrere Beiträge ( hier und hier ) legen nahe, dass die Beta-Regression besser geeignet ist, wenn die abhängige Variable natürlich zwischen 0 und 1 liegt. Meine Frage ist, ob es technisch falsch ist, eine logistische Regression an die proportionale Antwortvariable anzupassen, wenn man die Angemessenheit beiseite lässt. R gibt eine …

1
Auswahl nicht informativer Prioritäten
Ich arbeite an einem Modell, das auf einer hässlichen parametrisierten Funktion beruht, die als Kalibrierungsfunktion für einen Teil des Modells fungiert. Bei Verwendung einer Bayes'schen Einstellung muss ich nicht informative Prioritäten für die Parameter erhalten, die meine Funktion beschreiben. Ich weiß, dass ich im Idealfall Referenz- oder zumindest Jeffreys-Prioritäten ableiten …

2
Große Cox-Regression mit R (Big Data)
Ich versuche, eine Cox-Regression für einen Beispieldatensatz von 2.000.000 Zeilen wie folgt mit nur R auszuführen. Dies ist eine direkte Übersetzung eines PHREG in SAS. Die Stichprobe ist repräsentativ für die Struktur des Originaldatensatzes. ## library(survival) ### Replace 100000 by 2,000,000 test <- data.frame(start=runif(100000,1,100), stop=runif(100000,101,300), censor=round(runif(100000,0,1)), testfactor=round(runif(100000,1,11))) test$testfactorf <- as.factor(test$testfactor) …

2
Anwenden einer Mehrfachtestkorrektur für die Überlappung von Genlisten mit R.
Ich habe 2 Studien, die die Reaktion des Patienten auf dasselbe Medikament untersuchen. In Studie 1 wurden 10.000 über dem Hintergrund exprimierte Gene gefunden, von denen 500 differentiell exprimiert und als Signatur der Arzneimittelantwort bezeichnet werden. In Studie 2 wurden 1.000 Gene gefunden, die die Signatur der Arzneimittelantwort darstellen. Die …

1
Analysieren Sie ein Fußballspiel: ähnliche Spieler mit DBSCAN und ähnliche Flugbahnen mit TRACLUS
Ich versuche, einen Datensatz zu analysieren, der von Sensoren stammt, die sich in einem Spiel in der Nähe der Schuhe der Spieler befinden ( http://www.orgs.ttu.edu/debs2013/index.php?goto=cfchallengedetails ). Ich habe mich für Clustering entschieden, um Folgendes zu identifizieren: Ähnliche Flugbahnen von Spielern im Spiel unter Verwendung des TRACLUS-Clustering-Algorithmus Ähnliche Spieler zählen einige …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.