Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

4
Warum ist ein Gefälle erforderlich?
Wenn wir die Kostenfunktion differenzieren und Parameter finden können, indem wir Gleichungen lösen, die durch partielle Differenzierung in Bezug auf jeden Parameter erhalten wurden, und herausfinden, wo die Kostenfunktion minimal ist. Ich denke auch, dass es möglich ist, mehrere Orte zu finden, an denen die Ableitungen Null sind, wodurch wir …


2
So verbessern Sie die Laufzeit für die R MICE-Datenimputation
Meine Frage kurz: Gibt es Methoden zur Verbesserung der Laufzeit von R MICE (Datenimputation)? Ich arbeite mit einem Datensatz (30 Variablen, 1,3 Millionen Zeilen), der (ziemlich zufällig) fehlende Daten enthält. Etwa 8% der Beobachtungen in etwa 15 von 30 Variablen enthalten NAs. Um die fehlenden Daten zu unterstellen, führe ich …


2
Power of Lady Verkostung Tee Experiment
In dem bekannten Experiment Fisher die beobachtbare ist die Anzahl der korrigierten erraten cup mit zwei Arten von Cup A und B . Normalerweise ist es interessant, den kritischen Bereich zu berechnen, um die Nullhypothese (die Dame schätzt zufällig) angesichts der Größe des Tests α abzulehnen . Dies ist mit …

1
Intuitive Erklärung von Logloss
In mehreren Kaggle-Wettbewerben basierte die Wertung auf "logloss". Dies bezieht sich auf einen Klassifizierungsfehler. Hier ist eine technische Antwort, aber ich suche nach einer intuitiven Antwort. Die Antworten auf diese Frage zur Mahalanobis-Entfernung haben mir sehr gut gefallen , aber PCA ist kein logarithmischer Verlust. Ich kann den Wert verwenden, …


2
Sind Baumschätzer IMMER voreingenommen?
Ich mache Hausaufgaben zu Entscheidungsbäumen und eine der Fragen, die ich beantworten muss, lautet: "Warum sind Schätzer aus voreingenommenen Bäumen aufgebaut und wie hilft das Absacken, ihre Varianz zu verringern?". Jetzt weiß ich, dass überangepasste Modelle tendenziell eine sehr geringe Verzerrung aufweisen, da sie versuchen, alle Datenpunkte anzupassen. Und ich …
9 cart  bias 

1
Was bedeutet es, über ein Zufallsmaß zu integrieren?
Ich schaue mir derzeit eine Arbeit des Dirichlet-Prozess-Zufallseffektmodells an und die Modellspezifikation lautet wie folgt: wobeider Skalierungsparameter unddas Basismaß ist. Später in diesem Artikel wird vorgeschlagen, eine Funktion über das Basismaßz. B. Ist das Basismaß im Dirichlet-Prozess ein PDF oder ein PDF? Was passiert, wenn das Basismaß ein Gaußscher ist?yichψichG= …

2
Wie ändert sich die Kosinusähnlichkeit nach einer linearen Transformation?
Gibt es eine mathematische Beziehung zwischen: die Kosinusähnlichkeit sim( A , B )sim⁡(A,B)\operatorname{sim}(A, B) zweier Vektoren EINAA und B.BB und die Kosinusähnlichkeit sim( M.EIN , M.B )sim⁡(MA,MB)\operatorname{sim}(MA, MB) von EINAA und B.BB , ungleichmäßig skaliert über eine gegebene Matrix M.MM ? Hier ist M.MM eine gegebene Diagonalmatrix mit ungleichen Elementen …

1
Was zeigt eine keilartige Form des PCA-Diagramms an?
In ihrer Arbeit über Autoencoder für die Textklassifizierung demonstrierten Hinton und Salakhutdinov die Darstellung der zweidimensionalen LSA (die eng mit PCA verwandt ist) : . Durch Anwenden von PCA auf absolut unterschiedliche, leicht hochdimensionale Daten erhielt ich ein ähnlich aussehendes Diagramm: (außer in diesem Fall wollte ich wirklich wissen, ob …

1
Was ist ein gutes modernes Buch / eine gute Ressource für fortgeschrittene Experimente?
Ich suche nach Ressourcen (muss kein einziges Buch sein), die einige der schwierigeren Fälle von experimentellem Design und statistischer Analyse abdecken. Einige der Fälle, die ich behandeln möchte: 1. Fälle, in denen sich Randomisierungseinheiten von Analyseeinheiten unterscheiden Beispiel: Ich betreibe eine E-Commerce-Plattform mit M Verkäufern und N Käufern. Ich möchte …

2
Vergleich zwischen Bayes-Schätzern
Betrachten Sie den quadratischen Verlust , wobei vorher gegeben ist, wobei . Sei die Wahrscheinlichkeit. Finden Sie den Bayes-Schätzer .L(θ,δ)=(θ−δ)2L(θ,δ)=(θ−δ)2L(\theta,\delta)=(\theta-\delta)^2π(θ)π(θ)\pi(\theta)π(θ)∼U(0,1/2)π(θ)∼U(0,1/2)\pi(\theta)\sim U(0,1/2)f(x|θ)=θxθ−1I[0,1](x),θ>0f(x|θ)=θxθ−1I[0,1](x),θ>0f(x|\theta)=\theta x^{\theta-1}\mathbb{I}_{[0,1]}(x), \theta>0δπδπ\delta^\pi Betrachten Sie den gewichteten quadratischen Verlust wobei mit dem vorherigen . Sei die Wahrscheinlichkeit. Finden Sie den Bayes-Schätzer .Lw(θ,δ)=w(θ)(θ−δ)2Lw(θ,δ)=w(θ)(θ−δ)2L_w(\theta,\delta)=w(\theta)(\theta-\delta)^2w(θ)=I(−∞,1/2)w(θ)=I(−∞,1/2)w(\theta)=\mathbb{I}_{(-\infty,1/2)}π1(θ)=I[0,1](θ)π1(θ)=I[0,1](θ)\pi_1(\theta)=\mathbb{I}_{[0,1]}(\theta)f(x|θ)=θxθ−1I[0,1](x),θ>0f(x|θ)=θxθ−1I[0,1](x),θ>0f(x|\theta)=\theta x^{\theta-1}\mathbb{I}_{[0,1]}(x), \theta>0δπ1δ1π\delta^\pi_1 Vergleiche undδπδπ\delta^\piδπ1δ1π\delta^\pi_1 Zuerst bemerkte ich, dass …

1
Wann ist es in Ordnung zu schreiben, dass wir eine Normalverteilung einer empirischen Messung angenommen haben?
In der Lehre angewandter Disziplinen wie der Medizin ist verankert, dass Messungen bio-medizinischer Mengen in der Bevölkerung einer normalen "Glockenkurve" folgen. Eine Google-Suche der Zeichenfolge "Wir haben eine Normalverteilung angenommen" liefert Ergebnisse! Sie klingen wie "angesichts der geringen Anzahl extremer Datenpunkte haben wir in einer Studie zum Klimawandel eine Normalverteilung …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.