Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Ausfallwahrscheinlichkeit
Eine Struktur versagt, wenn sie einer Last ausgesetzt wird, die größer ist als ihr eigener Widerstand: failure := load > resistance Wir können davon ausgehen, dass die Last und der Widerstand unabhängig sind. Ist es richtig zu sagen, dass mit Hilfe von Wahrscheinlichkeitsdichtefunktionen (pdf) und kumulativen Dichtefunktionen (cdf) der Last …

1
Was sind einige der möglichen Konsequenzen des Hinzufügens von Junk-Steuerelementen in Ihrer Regression?
Angenommen, ich führe eine Regression durch, bei der meine abhängige Variable Mord ist und meine interessierende Variable der Zugang zu gewalttätigen Videospielen ist. Nehmen wir an, ich werfe auch das Spülbecken in Bezug auf meine Kontrollvariablen ein - ich habe 38 demografische Kontrollen, 30 kriminologische Kontrollen, die relevant sein können …

3
Dirichlet-konjugierte Update-Ableitung
Ich versuche, die Aktualisierungsgleichungen für das Konjugat an die Dirichlet-Verteilung abzuleiten, wie hier beschrieben: /mathpro/20399/conjugate-prior-of-the-dirichlet-distribution Die von mir berechnete Parameteraktualisierungsgleichung stimmt jedoch nicht mit der dort vorgeschlagenen überein. Meine Ableitung ist unten dargestellt: where, f(θ|α)=Dir(θ|α)=1B(α)exp(ϕ(α)Tu(θ))f(θ|α)=Dir(θ|α)=1B(α)exp⁡(ϕ(α)Tu(θ))\begin{align} f({\theta}|{\alpha}) &= Dir({\theta}|{\alpha})\\ &=\frac{1}{B({\alpha})}\exp(\phi({\alpha})^{T}u({\theta})) \end{align}ϕ(α)Tu(θ)B(α)=[α1−1,⋯,αK−1]=[ln(θ1),⋯,ln(θK)]T=∏Ki=1Γ(αi)Γ(∑Ki=1αi)ϕ(α)T=[α1−1,⋯,αK−1]u(θ)=[ln⁡(θ1),⋯,ln⁡(θK)]TB(α)=∏i=1KΓ(αi)Γ(∑i=1Kαi)\begin{align} \phi({\alpha})^{T} &= [\alpha_1-1,\cdots,\alpha_K-1]\\ u({\theta}) &= [\ln(\theta_1),\cdots,\ln(\theta_K)]^{T}\\ B({\alpha}) &= \frac{\prod_{i=1}^{K}\Gamma(\alpha_i)}{\Gamma\left(\sum_{i=1}^{K}\alpha_i\right)} \end{align} …

1
Bayesianische vs. Frequentist-Berechnungsschritte
Dieser Artikel enthält ein Beispiel für Bayesianische vs. Frequentistische Philosophien. Ein altes Medikament behandelt erfolgreich 70% der Patienten. Um ein neues Medikament zu testen, geben Forscher es 100 Patienten, von denen sich 83 erholen. Wie sicher sollten wir auf der Grundlage dieser Beweise sein, dass das neue Medikament schlechter als, …

2
Wo ist der erklärende Effekt der gemeinsamen Varianz zwischen Kovariaten in Regressionsverfahren zu berücksichtigen?
Im Anschluss an die hervorragenden Antworten für: Ist die Reihenfolge der erklärenden Variablen bei der Berechnung ihrer Regressionskoeffizienten von Bedeutung? (Was ich aus pädagogischer Sicht als unglaublich nützlich empfunden habe) Ich habe mich gefragt, wie genau es gelingt, Regressionskoeffizienten bereitzustellen, wenn wir mit hohen kollinearen Daten arbeiten (abgesehen von dem …


2
Plotten zur Überprüfung der Homoskedastizitätsannahme für ANOVA mit wiederholten Messungen in R.
Ich habe mit der aov()Funktion eine ANOVA mit wiederholten Messungen innerhalb der Probanden durchgeführt . Meine abhängige Variable ist nicht normal verteilt, daher bin ich sehr daran interessiert, Annahme-Tests für meine Analyse durchzuführen. Es scheint, dass das bloße Aufrufen plot()der Ausgabe bei wiederholten Messungen nicht funktioniert. Daher habe ich die …


2
Mittelwert aus zwei Normalverteilungen
Angenommen, ich habe zwei normale Messverteilungen mit verschiedenen Instrumenten. Was ist die beste Strategie zur Berechnung des gewichteten Mittelwerts zweier Verteilungen, wenn die Fehlerverteilungen beider Instrumente unbekannt sind? Ist es möglich?

1
Wie man den Mittelwert und die Varianz von a ableitet
Wie kann ich den Mittelwert und die Varianz eines verkürzten Poisson ableiten? Hier ist der Grenzwert, so dass nur Werte zulässig sind, die streng größer als sind, dh die Wahrscheinlichkeitsmassenfunktion istkkkkkkkkk pj=q−1kλje−λ/j!,j=k+1,k+2,…pj=qk- -1λje- -λ/.j!,j=k+1,k+2,…p_j = q_k^{-1} \lambda^j e^{-\lambda}/j!, \qquad j=k+1, k+2, \dots wobei eine ganze Zahl ist, ein Parameter ist …

1
Ethik der Veröffentlichung einer kovariaten Matrix
Ich plane, eine Arbeit mit einem Strukturgleichungsmodell einzureichen, das auf einen Datensatz angewendet wird, der mit Messungen von schizophrenen Patienten erstellt wurde. Im Geiste der Förderung einer offenen Forschungskultur habe ich erwogen, den Lesern Zugang zur Kovarianztabelle zu gewähren, damit das Papier als didaktisches Instrument weiter verwendet werden kann und …



1
Wie ist die Determinante von
Ich arbeite an einem Problem (und habe tatsächlich die Antwort), aber ich weiß nicht, warum dies die Antwort ist. Kann jemand diese Gleichheit erklären? Es hat mit der Determinante der partitionierten Matrix zu tun(X′X).(X′X).(X'X). Lassen X=[x0,x1,…,xk−1,xk]=[W,xk]X=[x0,x1,…,xk−1,xk]=[W,xk]X=[x_0, x_1, \ldots,x_{k-1},x_k]=[W,x_k] und lass rank(X)=k+1rank⁡(X)=k+1\operatorname{rank}(X)=k+1 a.) zeigen das |X′X|=|W′W|(x′kxk−x′kW(W′W)−1W′xk)|X′X|=|W′W|(xk′xk−xk′W(W′W)−1W′xk)|X'X|=|W'W|(x_k'x_k-x_k'W(W'W)^{-1}W'x_k) was durch die partitionierte Matrix …

1
Grundlegendes zur Bagged Logistic Regression (und einer Python-Implementierung)
Ich versuche, einen akademischen Artikel zu verstehen, den ich über die logistische Regression für Marketing-Zuschreibungen lese - http://www.turn.com.akadns.net/sites/default/files/whitepapers/TURN_Tech_WP_Data-driven_Multi-touch_Attribution_Models.pdf Insbesondere dieser Absatz: Schritt 1. Für einen bestimmten Datensatz einen Anteil (ps) aller Stichprobenbeobachtungen und einen Anteil (pc) aller Kovariaten abtasten. Passen Sie ein logistisches Regressionsmodell an die abgetasteten Kovariaten und die …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.