Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Was verursacht ein U-förmiges Muster im räumlichen Korrelogramm?
Ich habe in meiner eigenen Arbeit dieses Muster bemerkt, als ich ein räumliches Korrelogramm in unterschiedlichen Abständen untersuchte und ein U-förmiges Muster in den Korrelationen auftauchte. Insbesondere nehmen starke positive Korrelationen in kleinen Entfernungsbehältern mit der Entfernung ab, erreichen dann eine Grube an einem bestimmten Punkt und klettern dann wieder …

1
Wie erstelle ich eine Precision-Recall-Kurve, wenn ich nur einen Wert für PR habe?
Ich habe eine Data Mining-Aufgabe, bei der ich ein inhaltsbasiertes Bildabrufsystem erstelle. Ich habe 20 Bilder von 5 Tieren. Also insgesamt 100 Bilder. Mein System gibt die 10 relevantesten Bilder an ein Eingabebild zurück. Jetzt muss ich die Leistung meines Systems mit einer Precision-Recall-Kurve bewerten. Ich verstehe jedoch das Konzept …



3
Entwicklung eines geeigneten Zeitreihenmodells zur Vorhersage des Umsatzes basierend auf dem Rekord des letzten Monats
Ich betreibe jetzt seit zwei Jahren in Folge ein Online-Geschäft, daher habe ich meine monatlichen Verkaufsdaten seit ungefähr zwei Jahren. Mein Geschäft für jeden Monat wird sicherlich von saisonalen Schwankungen (bessere Ergebnisse zu Weihnachten usw.) und wahrscheinlich einigen anderen Faktoren beeinflusst, die mir nicht bekannt sind. Um zukünftige Verkäufe besser …



2
MCMC-Methoden - Proben brennen?
Bei MCMC- Methoden lese ich immer wieder über die burn-inZeit oder die Anzahl der Proben "burn". Was ist das genau und warum wird es benötigt? Aktualisieren: Bleibt MCMC stabil, sobald es sich stabilisiert hat? Wie hängt der Zeitbegriff burn-inmit dem der Mischzeit zusammen?
12 sampling  mcmc 

4
PCA nur mit einer Distanzmatrix durchführen
Ich möchte einen massiven Datensatz gruppieren, für den ich nur die paarweisen Abstände habe. Ich habe einen k-medoids-Algorithmus implementiert, dessen Ausführung jedoch zu lange dauert. Daher möchte ich zunächst die Dimension meines Problems durch Anwendung von PCA reduzieren. Die einzige Möglichkeit, diese Methode durchzuführen, ist die Verwendung der Kovarianzmatrix, die …


1
Intuitive Beispiele für wichtige Stichproben
Mein Hintergrund ist Informatik. Ich bin ziemlich neu in Monte-Carlo-Stichprobenverfahren, und obwohl ich die Mathematik verstehe, fällt es mir schwer, intuitive Beispiele für wichtige Stichproben zu finden. Genauer gesagt, könnte jemand Beispiele nennen für: Eine ursprüngliche Verteilung, aus der man keine Stichprobe ziehen kann, die man aber schätzen kann eine …

2
Best Practices zum Erstellen von "ordentlichen Daten"
Hadley Wickham schrieb im vergangenen Jahr in JSS einen herausragenden Artikel mit dem Titel "Tidy Data" ( Link ) über Datenmanipulation und das Versetzen der Daten in einen "optimalen" Zustand, um eine Analyse durchzuführen. Ich habe mich jedoch gefragt, welche Best Practices für die Darstellung von Tabellendaten in einer Arbeitsumgebung …
12 dataset  tables 

3
Normale Annäherung an die Poisson-Verteilung
Hier in Wikipedia heißt es: Für ausreichend große Werte von λλλ (sagen wir λ>1000λ>1000λ>1000 ) ist die Normalverteilung mit dem Mittelwert λλλ und der Varianz λλλ (Standardabweichung ) eine hervorragende Annäherung an die Poisson-Verteilung. Wenn größer als ungefähr 10 ist, ist die Normalverteilung eine gute Annäherung, wenn eine geeignete Kontinuitätskorrektur …

2
Warum fand Thomas Bayes den Satz von Bayes so herausfordernd?
Dies ist eher eine Frage der Wissenschaftsgeschichte, aber ich hoffe, dass sie hier zum Thema gehört. Ich habe gelesen, dass es Thomas Bayes nur gelungen ist, den Satz von Bayes für den Sonderfall eines Uniformprior zu entdecken, und selbst dann hatte er anscheinend damit zu kämpfen. In Anbetracht dessen, wie …

1
Ist eine Vorverarbeitung vor der Vorhersage mit FinalModel von RandomForest mit Caret-Paket erforderlich?
Ich verwende das Caret-Paket zum Trainieren eines randomForest-Objekts mit 10x10CV. library(caret) tc <- trainControl("repeatedcv", number=10, repeats=10, classProbs=TRUE, savePred=T) RFFit <- train(Defect ~., data=trainingSet, method="rf", trControl=tc, preProc=c("center", "scale")) Danach teste ich den randomForest auf einem testSet (neue Daten) RF.testSet$Prediction <- predict(RFFit, newdata=testSet) Die Verwirrungsmatrix zeigt mir, dass das Modell nicht so …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.