Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren



3
Geeigneter Umgang mit einer dreistufigen Notfalltabelle
Ich habe eine dreistufige Kontingenztabelle mit Zähldaten für mehrere Arten, der Wirtspflanze, von der sie gesammelt wurden, und ob diese Sammlung an einem regnerischen Tag stattgefunden hat (das ist tatsächlich wichtig!). Mit R könnten gefälschte Daten ungefähr so ​​aussehen: count <- rpois(8, 10) species <- rep(c("a", "b"), 4) host <- …

1
Gesamtfehler Typ I beim wiederholten Testen akkumulierender Daten
Ich habe eine Frage zu gruppensequenziellen Methoden . Laut Wikipedia: In einer randomisierten Studie mit zwei Behandlungsgruppen werden klassische Gruppensequenztests auf folgende Weise durchgeführt: Stehen n Probanden in jeder Gruppe zur Verfügung, wird eine Zwischenanalyse der 2n Probanden durchgeführt. Die statistische Analyse wird durchgeführt, um die beiden Gruppen zu vergleichen, …

2
Was sollte ich über das Entwerfen eines guten Hybrid / Hamilton-Monte-Carlo-Algorithmus wissen?
Ich entwerfe einen hybriden Monte-Carlo- Abtastalgorithmus für PyMC und versuche, ihn so unkompliziert und allgemein wie möglich zu gestalten. Daher suche ich nach guten Ratschlägen für den Entwurf eines HMC-Algorithmus. Ich habe Radfords Umfragekapitel gelesen und Beskos et. In dem kürzlich erschienenen Artikel von al. zur optimalen (schrittweisen) Abstimmung von …

2
Wie kann man schnell X abtasten, wenn exp (X) ~ Gamma?
Ich habe ein einfaches Stichprobenproblem, bei dem meine innere Schleife wie folgt aussieht: v = sample_gamma(k, a) wobei sample_gammaProben aus der Gamma-Verteilung eine Dirichlet-Probe bilden. Es funktioniert gut, aber für einige Werte von k / a läuft ein Teil der nachgeschalteten Berechnung unter. Ich habe es angepasst, um Log Space-Variablen …


2
GLM nach Modellauswahl oder Regularisierung
Ich möchte diese Frage in zwei Teile teilen. Beide befassen sich mit einem verallgemeinerten linearen Modell, aber das erste befasst sich mit der Modellauswahl und das andere mit der Regularisierung. Hintergrund: Ich benutze GLMs (lineare, logistische, Gamma-Regressions-) Modelle sowohl zur Vorhersage als auch zur Beschreibung. Wenn ich mich auf die …

1
Online skalierbare statistische Methoden
Dies wurde durch eine effiziente lineare Online-Regression inspiriert , die ich sehr interessant fand. Gibt es Texte oder Ressourcen, die für statistische Berechnungen in großem Maßstab vorgesehen sind, bei denen die Datenmengen zu groß sind, um in den Hauptspeicher zu passen, und die möglicherweise zu unterschiedlich sind, um eine effektive …

5
Beste Entfernungsmessung zu verwenden
Kontext Ich habe zwei Datensätze, die ich vergleichen möchte. Jedes Datenelement in beiden Mengen ist ein Vektor mit 22 Winkeln (alle zwischen - π-π-\pi und ππ\pi ). Die Winkel beziehen sich auf eine bestimmte Konfiguration der menschlichen Pose, sodass eine Pose durch 22 Gelenkwinkel definiert ist. Letztendlich versuche ich, die …

4
Sweave, R, Latex, Eclipse StatET einrichten [closed]
Geschlossen. Diese Frage ist nicht zum Thema . Derzeit werden keine Antworten akzeptiert. Möchten Sie diese Frage verbessern? Aktualisieren Sie die Frage so dass es beim Thema für Kreuz Validated. Geschlossen vor 2 Jahren . Vor ein paar Tagen habe ich einen Beitrag über das Einrichten eines SweaveR gelesen, mit …
12 r 

2
Woher weiß ich, welche Methode zur Parameterschätzung ich wählen soll?
Es gibt eine ganze Reihe von Methoden zur Parameterschätzung. MLE, UMVUE, MoM, Entscheidungstheorie und andere scheinen alle einen ziemlich logischen Grund dafür zu haben, warum sie für die Parameterschätzung nützlich sind. Ist eine Methode besser als die andere, oder handelt es sich nur darum, wie wir den Schätzer für die …

4
Analysieren von Winddaten mit R
Hallo, ich analysiere Winddaten, um die Energie einer Windkraftanlage abzuschätzen. Ich habe 10 Jahre Winddaten genommen und ein Histogramm erstellt. Meine zweite Stufe bestand darin, eine Weibull-Verteilung an die Daten anzupassen. Ich habe R mit dem Paket verwendet lmom, um die Weibul-Form zu berechnen und zu skalieren. Dies ist der …
12 r  distributions 


2
80% der fehlenden Daten in einer einzelnen Variablen
Es gibt eine Variable in meinen Daten, bei der 80% der Daten fehlen. Die Daten fehlen wegen Nichtvorhandenseins (dh wie viel Bankdarlehen das Unternehmen schuldet). Ich bin auf einen Artikel gestoßen, in dem es heißt, dass die Dummy-Variable-Einstellmethode die Lösung für dieses Problem ist. Bedeutet das, dass ich diese stetige …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.