Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Methoden zur Anpassung eines „einfachen“ Messfehlermodells
Ich suche nach Methoden, mit denen sich das Messfehlermodell "OLS" abschätzen lässt. yi=Yi+ey,iyi=Yi+ey,iy_{i}=Y_{i}+e_{y,i} xi=Xi+ex,ixi=Xi+ex,ix_{i}=X_{i}+e_{x,i} Yi=α+βXiYi=α+βXiY_{i}=\alpha + \beta X_{i} Wobei die Fehler unabhängig normal sind mit unbekannten Varianzen und . "Standard" OLS funktioniert in diesem Fall nicht.σ2yσy2\sigma_{y}^{2}σ2xσx2\sigma_{x}^{2} Wikipedia hat einige unattraktive Lösungen - die beiden genannten zwingen Sie anzunehmen, dass entweder …

3
Was ist der Unterschied zwischen der Verwendung von aov () und lme () bei der Analyse eines Längsdatensatzes?
Kann mir jemand den Unterschied zwischen der Verwendung aov()und lme()Analyse von Längsschnittdaten und der Interpretation der Ergebnisse dieser beiden Methoden erklären? Unten analysiere ich den gleichen Datensatz mit aov()und lme()und erhalte 2 unterschiedliche Ergebnisse. Mit habe aov()ich ein signifikantes Ergebnis in der Zeit durch die Interaktion mit der Behandlung erhalten, …


2
Vergleiche von Clustering-Ergebnissen verstehen
Ich experimentiere mit der Klassifizierung von Daten in Gruppen. Ich bin ziemlich neu in diesem Thema und versuche, die Ergebnisse einiger Analysen zu verstehen. Anhand von Beispielen aus Quick-R werden mehrere RPakete vorgeschlagen. Ich habe versucht, zwei dieser Pakete zu verwenden ( fpcmit der kmeansFunktion und mclust). Ein Aspekt dieser …
13 r  clustering 

3
Wahrscheinlichkeitsformel für eine multivariate Bernoulli-Verteilung
Ich benötige eine Formel für die Wahrscheinlichkeit eines Ereignisses in einer n-variablen Bernoulli-Verteilung mit gegebenen Wahrscheinlichkeiten für ein einzelnes Element und für Paare von Elementen . Entsprechend könnte ich Mittelwert und Kovarianz von angeben .X∈{0,1}nX∈{0,1}nX\in\{0,1\}^nP(Xi=1)=piP(Xi=1)=piP(X_i=1)=p_iP(Xi=1∧Xj=1)=pijP(Xi=1∧Xj=1)=pijP(X_i=1 \wedge X_j=1)=p_{ij}XXX Ich habe bereits erfahren, dass es viele Verteilungen mit den Eigenschaften gibt, genauso …

3
GLMNET oder LARS für die Berechnung von LASSO-Lösungen?
Ich möchte die Koeffizienten für das LASSO-Problem erhalten ||Y−Xβ||+λ||β||1.||Y−Xβ||+λ||β||1.||Y-X\beta||+\lambda ||\beta||_1. Das Problem ist, dass die Funktionen glmnet und lars unterschiedliche Antworten geben. Für die glmnet-Funktion frage ich nach den Koeffizienten von statt nur λ , aber ich bekomme immer noch andere Antworten.λ/||Y||λ/||Y||\lambda/||Y||λλ\lambda Wird das erwartet? Wie ist die Beziehung zwischen …

2
Explorative Analyse von räumlich-zeitlichen Prognosefehlern
Die Daten: Ich habe kürzlich an der Analyse der stochastischen Eigenschaften eines räumlich-zeitlichen Feldes von Prognosefehlern für die Windkraftproduktion gearbeitet. Formal kann man sagen, dass es sich um einen Prozess handelt zweimal in der Zeit (mittundh) und einmal im Raum (p)indiziert,wobeiHdie Anzahl der Vorausschauzeiten ist (entspricht etwa24, regelmäßig abgetastet),Tdie Anzahl …

7
Statistiktheorie und -anwendungen sinnvoll nutzen
Ich habe vor kurzem meinen Master in medizinischer und biologischer Modellierung abgeschlossen, begleitet von Ingenieurmathematik als Hintergrund. Obwohl mein Ausbildungsprogramm eine beträchtliche Anzahl von Kursen in mathematischer Statistik (siehe unten für eine Liste) enthielt, die ich mit ziemlich hohen Noten absolvierte, habe ich es häufig völlig verloren, sowohl auf Theorie …

1
Bieten Wahrscheinlichkeitsverhältnisse und Bayes'scher Modellvergleich überlegene und ausreichende Alternativen zu Nullhypothesentests?
Als Reaktion auf eine wachsende Zahl von Statistikern und Forschern, die den Nutzen von Nullhypothesentests (NHT) für die Wissenschaft als kumulatives Unterfangen kritisieren, hat die Task Force für statistische Inferenz der American Psychological Association ein völliges Verbot von NHT vermieden, aber stattdessen vorgeschlagen, dass Forscher geben die Effektgrößen zusätzlich zu …


1
LARS gegen Koordinatenabstieg für das Lasso
Welche Vor- und Nachteile hat die Verwendung von LARS [1] im Vergleich zur Verwendung der Koordinatenabsenkung für die Anpassung der L1-regulierten linearen Regression? Ich interessiere mich hauptsächlich für Leistungsaspekte (meine Probleme sind Nin der Regel Hunderttausende und p<20). Es sind jedoch auch andere Erkenntnisse erwünscht. edit: Seitdem ich die Frage …

5
Schrittweise logistische Regression und Stichprobe
Ich setze eine schrittweise logistische Regression auf einen Datensatz in SPSS. Während der Prozedur passe ich mein Modell an eine zufällige Teilmenge an, die ca. 60% der Gesamtstichprobe, das sind ca. 330 Fälle. Was ich interessant finde, ist, dass bei jedem erneuten Abtasten meiner Daten verschiedene Variablen im endgültigen Modell …


2
Online-Ressourcen zum Lernen von Statistiken, Übungen (mit Lösungen)?
Ich arbeite derzeit als Lehrassistentin an meiner Universität in einem Einführungskurs für Statistik (für Medizinstudenten). Offline gibt es viele Bücher mit Informationen, die dem Lehrer helfen sollen. Was mich jedoch interessiert, ist, ob Sie mich auf (gute) Ressourcen verweisen könnten , die online verfügbare Übungen (mit Lösungen) zu Statistiken bereitstellen? …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.