Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Welches R-Paket zur Berechnung der Komponentenparameter für ein Mischungsmodell verwendet werden soll
Ich möchte ein Mischungsmodell an von Monte Carlo generierte Daten mit Wahrscheinlichkeitsdichten anpassen, die normalerweise wie im angehängten Bild aussehen. Aus der Sichtprüfung scheint es, dass ein normales Mischungsmodell anwendbar sein könnte, aber beim Überprüfen der CRAN-Aufgabenansicht weiß ich wirklich nicht, welches Paket für meine Anforderungen geeignet sein könnte. Grundsätzlich …
8 r  mixed-model 

1
Können Steigungen in linearen Regressionen als unabhängige oder abhängige Variablen in anderen Regressionsmodellen verwendet werden?
Ich habe 100 Patienten und jeder Patient hat 10 longitudinale Serumkreatininmessungen. Die geschätzten glomerulären Filtrationsraten (eGFR) wurden aus einer MDRD-Formel berechnet, die Geschlecht, Alter und Serumkreatinin umfasste. eGFR ist die abhängige Variable und die Zeit ist die unabhängige Variable in der linearen Regression für jeden Patienten. Verstoßen lineare Regressionen gegen …


3
Testdifferenz zwischen zwei (angepassten) r ^ 2
Angenommen, ich habe zwei Regressionsmodelle, eines mit drei Variablen und eines mit vier. Jeder spuckt ein angepasstes r ^ 2 aus, das ich direkt vergleichen kann. Natürlich ist das Modell mit dem höher eingestellten r ^ 2 die bessere Anpassung, aber gibt es eine Möglichkeit, die Differenz zwischen den beiden …

1
Wie kann der Informationsverlust durch Verzögerungsvariablen verringert werden?
Ich verwende ein verteiltes Verzögerungsmodell, um Zeitreihendaten zu analysieren. Die Studiendauer beträgt 18 Jahre, und die Beobachtung besteht aus jährlichen Daten. Wenn ein 1-Jahres-Verzögerungseffekt einbezogen wird, fehlt das erste Jahr der Verzögerungsvariablen. Bei einem Verzögerungseffekt von 2 Jahren fehlen dann die ersten beiden Daten der Verzögerungsvariablen usw. Ich werde in …

1
Wie berechnet ein Frequentist die Wahrscheinlichkeit, dass Gruppe A Gruppe B in Bezug auf die binäre Antwort schlägt?
... (optional) im Kontext von Google Web Optimizer. Angenommen, Sie haben zwei Gruppen und eine binäre Antwortvariable. Jetzt erhalten Sie folgendes Ergebnis: Original : 401 Studien, 125 erfolgreiche Studien Kombination 16 : 441 Studien, 141 erfolgreiche Studien Der Unterschied ist statistisch nicht signifikant, man kann jedoch eine Wahrscheinlichkeit berechnen, dass …

3
Was ist eine gute Einführung in das Testen statistischer Hypothesen für Informatiker?
Ich war kürzlich bei der Arbeit einigen statistischen Hypothesentestmethoden (z. B. Friedman-Test) ausgesetzt und möchte mein Wissen zu diesem Thema erweitern. Können Sie einem Informatiker eine gute Einführung in das Testen statistischer Signifikanz / statistischer Hypothesen vorschlagen? Ich denke an ein PDF-Buch oder ähnliches, aber jede andere Art von Hilfe …

5
Wie kann ich den Zeitpunkt abschätzen, zu dem 50% einer Binomialvariablen übergegangen sind?
Ich habe die folgenden Daten, die den Binärzustand von vier Subjekten zu vier Zeiten darstellen. Beachten Sie, dass es nur möglich ist, dass jedes Subjekt , nicht aber 1 → 0 übergeht :0 → 10→10\to 11 → 01→01\to 0 testdata <- data.frame(id = c(1,2,3,4,1,2,3,4,1,2,3,4,1,2,3,4,1,2,3,4), day = c(1,1,1,1,8,8,8,8,16,16,16,16,24,24,24,24,32,32,32,32), obs = c(0,0,0,0,0,1,0,0,0,1,1,0,0,1,1,1,1,1,1,1)) …


4
Was muss ich beachten, wenn ich multiple Regression verwende, um „kausale“ Zusammenhänge in meinen Daten zu finden?
Zunächst stelle ich fest, dass multiple Regression nicht wirklich "kausale" Rückschlüsse auf die Daten liefert. Lassen Sie mich meinen aktuellen Fall erklären: Ich habe vier unabhängige Variablen, von denen ich hoffe (aber nicht sicher bin), dass sie das messen, was ich messe. Ich wollte die multiple Regression verwenden, um zu …

1
Clustering von Zeitreihen
Ich habe viele Zeitreihen in diesem Format 1 Spalte, in der ich Datumsformat (d / m / Jahr) habe, und viele Spalten, die verschiedene Zeitreihen darstellen, wie hier: DATE TS1 TS2 TS3 ... 24/03/2003 0.00 0.00 ... 17/04/2003 -0.05 1.46 11/05/2003 0.46 -3.86 04/06/2003 -2.21 -1.08 28/06/2003 -1.18 -2.16 22/07/2003 …



1
Korrelation kontinuierlicher klinischer Variablen und Genexpressionsdaten
In SVM-Klassifizierungsanalysen (linearer Kernel) eines Datensatzes der Genexpression (~ 400 Variablen / Gene) für jeweils ~ 25 Fälle und Kontrollen stelle ich fest, dass die auf Genexpression basierenden Klassifikatoren sehr gute Leistungsmerkmale aufweisen. Die Fälle und Kontrollen unterscheiden sich nicht signifikant für eine Reihe von kategorialen und kontinuierlichen klinischen / …

1
Welche Beziehung besteht zwischen Statistik- und Entscheidungstheorie?
Ich habe mich gefragt, wie Statistik und Entscheidungstheorie zusammenhängen. Es sieht für mich so aus, als könnten alle statistischen Probleme / Aufgaben in der Entscheidungstheorie formuliert werden. Auch Probleme in der Entscheidungstheorie können in Statistiken / Wahrscheinlichkeitsproblemen oder auf deterministische Weise formuliert werden. Ist Statistik also nur ein Teil der …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.