Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Wie viele Proben benötige ich, wenn ich eine Wahrscheinlichkeit von 95% haben möchte, dass weniger als 1% der Objekte fehlerhaft sind?
Ich muss sicherstellen, dass meine XML-Sitemap weniger als Müll enthält (defekte Links). Die Liste der URLs liegt bei Hunderttausenden, und selbst wenn es möglich wäre, sie alle einzeln zu testen, würde ich es aus vielen Gründen lieber nicht tun:1 %1%.1\% 1 - Saved bandwidth 2 - Faster traffic for real …

2
GAMM mit null aufgeblasenen Daten
Ist es möglich, ein GAMM (Generalized Additive Mixed Model) für Daten ohne Inflation in R anzupassen? Wenn nicht, ist es möglich, ein GAM (Generalized Additive Model) für Daten ohne Inflation mit einer negativen Binomial- oder Quasi-Poisson-Verteilung in R anzupassen? (Ich fand COZIGAM :: zigam- und mgcv: ziP- Funktionen für die …

2
Sind die meisten veröffentlichten Korrelationen in den Sozialwissenschaften nicht vertrauenswürdig und was ist dagegen zu tun? [geschlossen]
Geschlossen . Diese Frage basiert auf Meinungen . Derzeit werden keine Antworten akzeptiert. Möchten Sie diese Frage verbessern? Aktualisieren Sie die Frage, damit sie durch Bearbeiten dieses Beitrags mit Fakten und Zitaten beantwortet werden kann . Geschlossen vor 2 Jahren . Trotz der wichtigen, aber klatschenden "gotcha" -istischen Bemühungen von …

1
Adaptives GAM glättet in mgcv
Simon Woods Buch über GAMs und sein zugehöriges R-Paket mgcv sind sowohl sehr detailliert als auch informativ, wenn es um GAM-Theorie und Modellanpassung an reale und simulierte Daten geht. Bei 1D-Glättungen gibt es wirklich nicht viel zu befürchten, außer zu entscheiden, ob zyklische oder adaptive Basisfunktionen implementiert werden sollen, was …
9 r  mgcv 



1
Warum in lateinischen Quadraten die Zeilen, Behandlungen und Spalten orthogonal sein sollen
Ich habe im Bereich der Geometrie immer "orthogonal" gehört (bitte beachten Sie auch, dass ich kein englischer Muttersprachler bin). Ich verstehe Folgendes für lateinische Quadrate (ein Zitat aus einem Lehrbuch) nicht: Jede Behandlung (ABCD) erscheint einmal in jeder Reihe. Daher sind die Behandlungen und Reihen orthogonal. ... Zeilen und Spalten …

4
Regularisierung: Warum mit 1 / 2m multiplizieren?
In den Vorlesungsnotizen der dritten Woche der Coursera Machine Learning-Klasse von Andrew Ng wird der Kostenfunktion ein Begriff hinzugefügt, um die Regularisierung zu implementieren: J.+( θ ) = J.( θ ) + λ2 m∑j = 1nθ2jJ.+(θ)=J.(θ)+λ2m∑j=1nθj2J^+(\theta) = J(\theta) + \frac{\lambda}{2m} \sum_{j=1}^n \theta_j^2 In den Vorlesungsunterlagen heißt es: Wir könnten auch …

4
Warum bedeutet die Tatsache, dass 1 Median niedriger als ein anderer Median ist, nicht, dass die meisten in Gruppe 1 kleiner sind als die meisten in Gruppe 2?
Ich glaubte, dass die folgenden Boxplots als "die meisten Männer sind schneller als die meisten Frauen" (in diesem Datensatz) interpretiert werden könnten, hauptsächlich weil die mittlere Männerzeit niedriger war als die mittlere Frauenzeit. Aber der EdX-Kurs zu R und Statistik- Quiz hat mir gesagt, dass das falsch ist. Bitte helfen …

1
P-Werte und Wahrscheinlichkeitsprinzip
Diese Frage stellte sich im Unterricht: Wenn wir p-Werte verwenden, um Hypothesen für ein Experiment zu bewerten, welchen Teil des Wahrscheinlichkeitsprinzips befolgen wir nicht: Suffizienz oder Konditionalität ? Meine Intuition wäre, Suffizienz zu sagen , da die Berechnung eines p-Werts auf unbeobachteten Ergebnissen eines Experiments beruht und Suffizienz sich mehr …

2
Kaplan-Meier-Kurven scheinen etwas anderes zu sagen als die Cox-Regression
In R mache ich eine Überlebensdatenanalyse von Krebspatienten. Ich habe sehr hilfreiche Artikel über Überlebensanalysen in CrossValidated und anderen Orten gelesen und denke, ich habe verstanden, wie man die Cox-Regressionsergebnisse interpretiert. Ein Ergebnis nervt mich jedoch immer noch ... Ich vergleiche das Überleben mit dem Geschlecht. Die Kaplan-Meier-Kurven sprechen eindeutig …



2
Umgekehrtes Geburtstagsproblem mit mehreren Kollisionen
Angenommen, Sie hatten ein außerirdisches Jahr mit einer unbekannten Länge N. Wenn Sie eine zufällige Stichprobe dieser Außerirdischen haben und einige von ihnen Geburtstage teilen, können Sie diese Daten verwenden, um die Länge des Jahres zu schätzen? In einer Stichprobe von 100 könnten Sie beispielsweise zwei Drillinge (dh zwei Geburtstage, …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.