Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


2
Chinesischer Restaurantprozess (CRP)
Ich versuche, den chinesischen Restaurantprozess (CRP) und den gewichteten chinesischen Restaurantprozess (WCRP) zu verstehen, die in einem Forschungsbericht "Automatische Entdeckung kognitiver Fähigkeiten" beschrieben sind - Robert V. Lindsey, Mohammad Khajah, Michael C. Mozer zur Verbesserung der Vorhersage von Schüler lernen. In CRP wird bei allen Implementierungen (vgl. Unendliche Mischungsmodelle mit …

2
Akzeptanzrate für Metropolis-Hastings> 0,5
Wie kommt es, dass Metropolis-Hastings-Akzeptanzraten nahe 1 liegen (z. B. wenn eine unimodale Verteilung mit einer normalen Angebotsverteilung mit zu kleiner SD untersucht wird), nachdem das Einbrennen beendet ist? Ich sehe es in meinen eigenen MCMC-Ketten, aber ich verstehe nicht, wie es Sinn macht. Es scheint mir, dass sich die …


1
Warum werden die meisten meiner Punkte mit DBSCAN als Rauschen eingestuft?
Ich verwende mehrere Clustering-Algorithmen von sklearn, um einige Daten zu clustern, und kann anscheinend nicht herausfinden, was mit DBSCAN passiert. Meine Daten sind eine Dokument-Term-Matrix von TfidfVectorizer mit einigen hundert vorverarbeiteten Dokumenten. Code: tfv = TfidfVectorizer(stop_words=STOP_WORDS, tokenizer=StemTokenizer()) data = tfv.fit_transform(dataset) db = DBSCAN(eps=eps, min_samples=min_samples) result = db.fit_predict(data) svd = TruncatedSVD(n_components=2).fit_transform(data) …



2
Empfehlungen für nicht proportionale Gefahren
Dies ist ein Problem, das mich seit langem geplagt hat und in Lehrbüchern, Google oder Stack Exchange keine guten Antworten gefunden hat. Ich habe einen Datensatz von> 100.000 Patienten, für die vier Behandlungen verglichen werden. Die Forschungsfrage ist, ob das Überleben zwischen diesen Behandlungen unterschiedlich ist, nachdem eine Reihe klinischer …


1
Ist eine auf einem vollständigen (globalen) Regressionsmodell basierende Inferenz angemessen?
Ist eine Schlussfolgerung auf der Grundlage eines vollständigen Modells angemessen und wenn ja, unter welchen Umständen? Angenommen, Sie interessieren sich für die mögliche Beziehung zwischen einer Antwortvariablen und mehreren Kandidaten-Prädiktorvariablen und verwenden eine Form der Regression (z. B. ein verallgemeinertes lineares Modell), um dies zu beantworten. Ein Ansatz, um zu …

1
Überquert die Erwartung der ausreichenden Statistik den gesamten Raum in einer exponentiellen Familie?
Eine Exponentialfamilie wird unter Verwendung von zwei Bestandteilen definiert: - eine Basisdichte - eine Anzahl ausreichender Statistikenq0(x)q0(x)q_0(x)Si(x)Si(x)S_i(x) Die Familie besteht aus allen Wahrscheinlichkeitsdichten, die geschrieben werden können als: q(x|(λ)i)∝q0(x)exp(∑iλiSi(x))q(x|(λ)i)∝q0(x)exp⁡(∑iλiSi(x)) q(x| (\lambda)_i ) \propto q_0(x) \exp \left( \sum_i \lambda_i S_i(x) \right) Es ist bekannt, dass die Beziehung zwischen den Parametern und …

1
Wohnung vor in Bayesian? Konfidenzintervalle in der klassischen Statistik werden zu glaubwürdigen Intervallen?
Wir wissen, dass confidence intervalnicht für die Wahrscheinlichkeitsaussage verwendet werden kann, dies ist etwas, für das reserviert ist credible interval. Die am häufigsten verwendeten frequentistischen Techniken (z. B. Konfidenzintervalle für Mittelwerte und Proportionen) entsprechen jedoch den glaubwürdigen Bayes'schen Intervallen für einen bestimmten Prior. Ein häufiges Beispiel ist der Flat Prior. …


1
Wie man die Definition der empirischen Verteilungsfunktion versteht
Ich lese die All of Nonparametric Statistics von Larry Wasserman. Auf Seite 12 definiert er die empirische Verteilungsfunktion als: Die empirische Verteilungsfunktion F.n^Fn^\hat{F_n} ist die CDF, die Masse setzt 1n1n\frac{1}{n} an jedem Datenpunkt X.ichXiX_i. Formal, F.n^( x ) =1n∑i = 1nich(X.ich≤ x )Fn^(x)=1n∑i=1nI(Xi≤x)\hat{F_n}(x)=\frac{1}{n}\sum^{n}_{i=1}I(X_i\le x) wo ich(X.ich≤ x ) = {10i …

3
Schrittweise Erklärung der K-fachen Kreuzvalidierung mit Rastersuche zur Optimierung von Hyperparametern
Ich bin mir der Vorteile der k-fachen (und ausgelassenen) Kreuzvalidierung sowie der Vorteile der Aufteilung Ihres Trainingssatzes zur Erstellung eines dritten Holdout-Validierungssatzes bewusst, den Sie zur Bewertung verwenden Modellleistung basierend auf der Auswahl von Hyperparametern, sodass Sie diese optimieren und optimieren und die besten auswählen können, die schließlich am realen …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.