Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

4
Ob Fälle, die von statistischer Software als Ausreißer gekennzeichnet wurden, gelöscht werden sollen, wenn mehrere Regressionen durchgeführt werden?
Ich führe mehrere Regressionsanalysen durch und bin nicht sicher, ob Ausreißer in meinen Daten gelöscht werden sollen. Die Daten, um die ich besorgt bin, werden in den SPSS-Boxplots als "Kreise" angezeigt, es gibt jedoch keine Sternchen (weshalb ich denke, dass sie nicht "so schlecht" sind). Die Fälle, um die ich …





2
Statistische Forensik: Benford und darüber hinaus
Welche umfassenden Methoden gibt es, um Betrug, Anomalien, Fudging usw. in wissenschaftlichen Werken von Dritten aufzuspüren? (Ich war durch die kürzliche Affäre mit Marc Hauser motiviert, dies zu erfragen .) Normalerweise wird für Wahl- und Rechnungslegungsbetrug eine Variante von Benfords Gesetz zitiert. Ich bin mir nicht sicher, wie dies zB …

5
Was ist falsch an diesem "naiven" Mischalgorithmus?
Dies ist eine Folgefrage zu einer Stackoverflow- Frage zum zufälligen Mischen eines Arrays . Es gibt etablierte Algorithmen (wie das Knuth-Fisher-Yates-Shuffle ), mit denen man ein Array mischen sollte, anstatt sich auf "naive" Ad-hoc-Implementierungen zu verlassen. Ich bin jetzt daran interessiert zu beweisen (oder zu widerlegen), dass mein naiver Algorithmus …


1
Erklärung von min_child_weight im xgboost-Algorithmus
Die Definition des Parameters min_child_weight in xgboost lautet wie folgt: Mindestinstanzgewicht (hessisch), das ein Kind benötigt. Wenn der Baumpartitionsschritt zu einem Blattknoten führt, dessen Instanzgewicht kleiner als min_child_weight ist, gibt der Erstellungsprozess die weitere Partitionierung auf. Im linearen Regressionsmodus entspricht dies einfach der minimalen Anzahl von Instanzen, die in jedem …

1
Was genau sind Aufmerksamkeitsmechanismen?
In den letzten Jahren wurden in verschiedenen Deep-Learning-Artikeln Aufmerksamkeitsmechanismen eingesetzt. Ilya Sutskever, Forschungsleiter bei Open AI, hat sie begeistert gelobt: https://towardsdatascience.com/the-fall-of-rnn-lstm-2d1594c74ce0 Eugenio Culurciello von der Purdue University hat gefordert, dass RNNs und LSTMs zugunsten rein auf Aufmerksamkeit basierender neuronaler Netze aufgegeben werden sollten: https://towardsdatascience.com/the-fall-of-rnn-lstm-2d1594c74ce0 Dies scheint übertrieben, aber es ist …


2
Warum gibt es zwei verschiedene Formulierungen / Notationen für logistische Verluste?
Ich habe zwei Arten von Formulierungen für logistische Verluste gesehen. Wir können leicht zeigen, dass sie identisch sind, der einzige Unterschied ist die Definition der Bezeichnung .yyy Formulierung / Notation 1, :y∈{0,+1}y∈{0,+1}y \in \{0, +1\} L(y,βTx)=−ylog(p)−(1−y)log(1−p)L(y,βTx)=−ylog⁡(p)−(1−y)log⁡(1−p) L(y,\beta^Tx)=-y\log(p)-(1-y)\log(1-p) Dabei ist p=11+exp(−βTx)p=11+exp⁡(−βTx)p=\frac 1 {1+\exp(-\beta^Tx)} , wobei die logistische Funktion eine reelle Zahl …

3
Ist ein hohes
Diese Frage wurde von Stack Overflow migriert, da sie bei Cross Validated beantwortet werden kann. Vor 3 Jahren migriert . In der Statistik machen wir lineare Regressionen, deren Anfang. Im Allgemeinen wissen wir, dass je höher besser ist. Aber gibt es jemals ein Szenario, in dem ein hohes ein unbrauchbares …


3
Koordinate vs. Gefälle
Ich habe mich gefragt, was die verschiedenen Anwendungsfälle für die beiden Algorithmen Koordinatensinkflug und Gradientensinkflug sind . Ich weiß, dass der Koordinatenabstieg Probleme mit nicht glatten Funktionen hat, aber er wird in gängigen Algorithmen wie SVM und LASSO verwendet. Gradientenabstieg wird jedoch meiner Meinung nach häufiger eingesetzt, insbesondere bei der …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.