Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Berichtsergebnisse des linearen Mixed-Effects-Modells
Lineare Modelle mit gemischten Effekten werden in meiner Biologie nicht häufig verwendet, und ich muss den statistischen Test melden, den ich in einer Arbeit verwendet habe, die ich zu schreiben versuche. Ich weiß, dass in einigen Bereichen der Biowissenschaften das Bewusstsein für Mehrebenen-Modellierung zu spüren ist ( Eine Lösung für …

2
Varianz-Kovarianz-Matrixinterpretation
Angenommen, wir haben ein lineares Modell Model1und vcov(Model1)geben die folgende Matrix an: (Intercept) latitude sea.distance altitude (Intercept) 28.898100 -23.6439000 -34.1523000 0.50790600 latitude -23.643900 19.7032500 28.4602500 -0.42471450 sea.distance -34.152300 28.4602500 42.4714500 -0.62612550 altitude 0.507906 -0.4247145 -0.6261255 0.00928242 Was zeigt diese Matrix in diesem Beispiel tatsächlich an? Welche Annahmen können wir sicher …

2
Intelligence Squared Scoring und Gewinnerermittlung
Es gibt einen NPR-Podcast namens Intelligence Squared. Jede Folge ist eine Ausstrahlung einer Live-Debatte über umstrittene Aussagen wie "Die zweite Änderung ist nicht mehr relevant" oder "Affirmative Action auf dem College-Campus schadet mehr als nützt". Vier Vertreter debattieren - zwei für den Antrag und zwei dagegen. Um festzustellen, welche Seite …
12 bayesian  rating 

1
Wie führt man einen Bootstrap-Test durch, um die Mittelwerte zweier Stichproben zu vergleichen?
Ich habe zwei stark verzerrte Stichproben und versuche, mithilfe von Bootstrapping ihre Mittelwerte mithilfe der t-Statistik zu vergleichen. Wie ist die richtige Vorgehensweise dafür? Der Prozess, den ich benutze Ich bin besorgt über die Angemessenheit der Verwendung des Standardfehlers der ursprünglichen / beobachteten Daten im letzten Schritt, wenn ich weiß, …

1
Wie trainiere ich HMMs für die Klassifizierung?
Daher verstehe ich, dass der Standardansatz beim Trainieren von HMMs für die Klassifizierung wie folgt lautet: Teilen Sie Ihre Datensätze in die Datensätze für jede Klasse auf Trainiere ein HMM pro Klasse Vergleichen Sie im Testset die Wahrscheinlichkeit, mit der jedes Modell die einzelnen Fenster klassifiziert Aber wie trainiere ich …


3
Abweichung vom Boxplot ableiten
Ich habe mich gefragt, wie ich aus einem Boxplot die Varianz einer Variablen ableiten kann. Lässt sich zumindest ableiten, ob zwei Variablen unter Berücksichtigung ihres Boxplots dieselbe Varianz aufweisen?
12 variance  boxplot 

2
Überprüfung der Normalität von Residuen in verallgemeinerten linearen Modellen
In diesem Artikel werden verallgemeinerte lineare Modelle (sowohl binomiale als auch negative binomiale Fehlerverteilungen) zur Analyse von Daten verwendet. Aber dann gibt es im statistischen Analyseteil der Methoden diese Aussage: ... und zweitens durch Modellierung der Anwesenheitsdaten mithilfe logistischer Regressionsmodelle und der Futtersuchzeitdaten mithilfe eines verallgemeinerten linearen Modells (GLM). Eine …

1
Wenn die Verteilung der Teststatistik bimodal ist, hat der p-Wert dann eine Bedeutung?
Der P-Wert ist definiert als die Wahrscheinlichkeit, eine Teststatistik zu erhalten, die mindestens so extrem ist wie das, was beobachtet wird, vorausgesetzt, die Nullhypothese ist wahr. Mit anderen Worten, Aber was ist, wenn die Teststatistik in der Verteilung bimodal ist? Bedeutet p-Wert in diesem Zusammenhang etwas? Zum Beispiel werde ich …


4
Schätzung der Kerndichte unter Berücksichtigung von Unsicherheiten
Bei der Visualisierung eindimensionaler Daten wird häufig die Kernel Density Estimation-Technik verwendet, um falsch gewählte Behälterbreiten zu berücksichtigen. Gibt es eine Standardmethode zum Einbeziehen dieser Informationen, wenn mein eindimensionaler Datensatz Messunsicherheiten aufweist? Zum Beispiel (und verzeihen Sie mir, wenn ich kein Verständnis dafür habe), faltet KDE ein Gauß-Profil mit den …

1
Clopper-Pearson für Nicht-Mathematiker
Ich habe mich gefragt, ob mir jemand die Intuition jenseits des Clopper-Pearson CI für Proportionen erklären kann. Soweit ich weiß, enthält jedes CI eine Varianz. Für Anteile kann jedoch der Clopper-Pearson-CI berechnet werden, auch wenn mein Anteil 0 oder 1 (0% oder 100%) beträgt. Ich habe versucht, die Formeln zu …

2
Identifizierung nutzloser Fragen aus einem Fragebogen
Ich entwickle einen Fragebogen. Um seine Zuverlässigkeit und Gültigkeit zu verbessern, möchte ich statistische Methoden anwenden. Ich möchte Fragen streichen, deren Antworten immer gleich sind. Dies bedeutet, dass fast alle Teilnehmer die gleichen Antworten auf diese Fragen gaben. Jetzt sind meine Fragen: Was ist der Fachbegriff für solche nutzlosen Fragen, …

1
Probleme beim Finden eines guten Modells für Zähldaten mit gemischten Effekten - ZINB oder etwas anderes?
Ich habe einen sehr kleinen Datensatz zur Bienenfülle, den ich nur schwer analysieren kann. Es handelt sich um Zählungsdaten, und fast alle Zählungen erfolgen in einer Behandlung, wobei die meisten Nullen in der anderen Behandlung vorkommen. Es gibt auch einige sehr hohe Werte (jeweils einer an zwei der sechs Stellen), …

4
Können Sie verschiedene Clustering-Methoden in einem Datensatz ohne fundamentale Wahrheit durch Kreuzvalidierung vergleichen?
Derzeit versuche ich, einen Textdokumentdatensatz zu analysieren, der keine fundamentale Wahrheit enthält. Mir wurde gesagt, dass Sie die k-fache Kreuzvalidierung verwenden können, um verschiedene Clustering-Methoden zu vergleichen. Die Beispiele, die ich in der Vergangenheit gesehen habe, verwenden jedoch eine Grundwahrheit. Gibt es eine Möglichkeit, k-fach Mittel für diesen Datensatz zu …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.