Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Konvertieren (Normalisieren) sehr kleiner Wahrscheinlichkeitswerte in Wahrscheinlichkeit
Ich schreibe einen Algorithmus, bei dem ich anhand eines Modells Wahrscheinlichkeiten für eine Liste von Datensätzen berechne und dann jede Wahrscheinlichkeit normalisieren muss. So könnte etwas wie [0,00043, 0,00004, 0,00321] in [0,2, 0,03, 0,77] umgewandelt werden. Mein Problem ist, dass die Log-Wahrscheinlichkeiten, mit denen ich arbeite, ziemlich klein sind (zum …

6
Was ist der Unterschied zwischen deskriptiver und inferentieller Statistik?
Mein Verständnis war, dass deskriptive Statistiken Merkmale einer Datenprobe quantitativ beschreiben, während inferentielle Statistiken Rückschlüsse auf die Populationen zuließen, aus denen Proben entnommen wurden. Auf der Wikipedia-Seite für statistische Rückschlüsse heißt es jedoch: Die statistische Inferenz macht zum größten Teil Aussagen über Populationen, wobei Daten verwendet werden, die aus der …

1
Erkennen von Ausreißern in Zähldaten
Ich habe das, was ich naiv für ein recht einfaches Problem hielt, das die Erkennung von Ausreißern für viele verschiedene Sätze von Zähldaten beinhaltet. Insbesondere möchte ich feststellen, ob einer oder mehrere Werte in einer Reihe von Zählungsdaten im Verhältnis zu den restlichen Zählungen in der Verteilung höher oder niedriger …

5
Zufälliger Wald vs. Regression
Ich habe ein OLS-Regressionsmodell für einen Datensatz mit 5 unabhängigen Variablen ausgeführt. Die unabhängigen Variablen und die abhängige Variable sind beide stetig und stehen in linearer Beziehung zueinander. Der R-Platz ist ungefähr 99,3%. Aber wenn ich dasselbe mit einer zufälligen Gesamtstruktur in R ausführe, ist mein Ergebnis '% Var Explained: …


1
Was sind einige bekannte Verbesserungen gegenüber Lehrbuch-MCMC-Algorithmen, die Menschen für die Bayes'sche Inferenz verwenden?
Wenn ich eine Monte-Carlo-Simulation für ein Problem programmiere und das Modell einfach genug ist, verwende ich ein sehr einfaches Gibbs-Sampling-Lehrbuch. Wenn es nicht möglich ist, Gibbs-Sampling zu verwenden, codiere ich das Lehrbuch Metropolis-Hastings, das ich vor Jahren gelernt habe. Der einzige Gedanke, den ich mir überlege, ist die Auswahl der …

4
Multiple Imputation und Modellauswahl
Mehrere Anrechnungs ist recht einfach , wenn Sie eine haben a - priori - lineares Modell , dass Sie schätzen möchten. Die Dinge scheinen jedoch etwas kniffliger zu sein, wenn Sie tatsächlich ein Modell auswählen möchten (z. B. finden Sie die "beste" Menge von Prädiktorvariablen aus einer größeren Menge von …

5
Wie kann man die Kosten einer Fehlklassifizierung in zufälligen Wäldern kontrollieren?
Ist es möglich, die Kosten einer Fehlklassifizierung im R-Paket randomForest zu kontrollieren ? In meiner eigenen Arbeit sind falsch negative Ergebnisse (z. B. das Fehlen einer Krankheit) weitaus kostspieliger als falsch positive Ergebnisse. Das Paket rpart ermöglicht es dem Benutzer, Fehlklassifizierungskosten zu kontrollieren, indem eine Verlustmatrix angegeben wird, um Fehlklassifizierungen …


3
Was passiert, wenn Sie SVD auf ein Problem mit der kollaborativen Filterung anwenden? Was ist der Unterschied zwischen den beiden?
Bei der kollaborativen Filterung gibt es Werte, die nicht ausgefüllt sind. Angenommen, ein Benutzer hat keinen Film angesehen, und wir müssen dort ein 'na' einfügen. Wenn ich eine SVD dieser Matrix erstellen möchte, muss ich eine Zahl eingeben, z. B. 0. Wenn ich die Matrix faktorisiere, kann ich ähnliche Benutzer …

2
So testen Sie die Varianzgleichheit mit Zirkeldaten
Ich bin daran interessiert, das Ausmaß der Variabilität in 8 verschiedenen Stichproben (jeweils aus einer anderen Population) zu vergleichen. Mir ist bekannt, dass dies mit verschiedenen Methoden mit Verhältnisdaten durchgeführt werden kann: F-Test-Varianzgleichheit, Levene-Test usw. Meine Daten sind jedoch kreisförmig / gerichtet (dh Daten, die Periodizität aufweisen, wie z. B. …


3
Vergleichen und Gegenüberstellen von p-Werten, Signifikanzniveaus und Typ-I-Fehlern
Ich habe mich gefragt, ob irgendjemand einen genauen Überblick über die Definitionen und Verwendungen von p-Werten, Signifikanzniveau und Typ-I-Fehler geben kann. Ich verstehe, dass p-Werte definiert sind als "die Wahrscheinlichkeit, eine Teststatistik zu erhalten, die mindestens so extrem ist wie die, die wir tatsächlich beobachtet haben", während ein Signifikanzniveau nur …

3
Was sagt mir eine nicht positiv definierte Kovarianzmatrix über meine Daten?
Ich habe mehrere multivariate Beobachtungen und möchte die Wahrscheinlichkeitsdichte über alle Variablen bewerten. Es wird angenommen, dass die Daten normal verteilt sind. Bei einer geringen Anzahl von Variablen funktioniert alles so, wie ich es erwarten würde. Wenn Sie jedoch zu einer höheren Zahl wechseln, wird die Kovarianzmatrix nicht mehr positiv. …

1
Restdiagnostik in MCMC-basierten Regressionsmodellen
Ich habe kürzlich begonnen, Regressionsmischmodelle im Bayes'schen Rahmen unter Verwendung eines MCMC-Algorithmus (Funktion MCMCglmm in R) anzupassen. Ich glaube, ich habe verstanden, wie man die Konvergenz des Schätzprozesses diagnostiziert (Kurve, Geweke-Plot, Autokorrelation, posteriore Verteilung ...). Eines der Dinge, die mir im Bayes'schen Rahmen auffallen, ist, dass viel Aufwand für diese …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.