Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


1
Was sind Startwerte in der Funktion glm ()?
Was sind Parameter start, etastart, mustartin der GLM () Funktion ? Ich habe in den Dokumenten und im Internet gesucht, aber keine klare Erklärung gefunden, was dies bedeutet. Es ähnelt den bayesianischen "Anfangswerten" für die Ketten, aber ich bezweifle, dass dies zusammenhängt, da die Funktion glm () in R eine …

3
Varianz-Kovarianz-Matrix der Fehler in der linearen Regression
Wie wird die Var / Cov-Fehlermatrix in der Praxis von statistischen Analysepaketen berechnet? Diese Idee ist mir theoretisch klar. Aber nicht in der Praxis. Ich meine, wenn ich einen Vektor von Zufallsvariablen , verstehe ich, dass die Varianz / Kovarianz-Matrix erhält das externe Produkt der vom Mittelwert abweichenden Vektoren: .X=(X1,X2,…,Xn)⊤X=(X1,X2,…,Xn)⊤\textbf{X}=(X_{1}, …

1
Startwert vor jedem Codeblock oder einmal pro Projekt setzen?
Es ist Standardempfehlung, einen zufälligen Startwert festzulegen, damit die Ergebnisse reproduziert werden können. Da der Startwert jedoch beim Zeichnen von Pseudozufallszahlen vorgerückt wird, können sich die Ergebnisse ändern, wenn ein Code eine zusätzliche Zahl zeichnet. Auf den ersten Blick scheint die Versionskontrolle eine Lösung dafür zu sein, da Sie zumindest …

1
Was ist die optimale Distanzfunktion für Personen, wenn Attribute nominal sind?
Ich weiß nicht, welche Distanzfunktion zwischen Individuen bei nominalen (ungeordneten kategorialen) Attributen verwendet werden soll. Ich habe ein Lehrbuch gelesen und sie schlagen die Simple Matching- Funktion vor, aber einige Bücher schlagen vor, dass ich die nominalen in binäre Attribute ändern und den Jaccard- Koeffizienten verwenden sollte. Was ist jedoch, …

1
Was tun, wenn die Probenkovarianzmatrix nicht invertierbar ist?
Ich arbeite an einigen Clustering-Techniken, bei denen ich für einen bestimmten Cluster von d-dimensionalen Vektoren eine multivariate Normalverteilung annehme und den d-dimensionalen Mittelwertvektor der Stichprobe und die Kovarianzmatrix der Stichprobe berechne. Wenn ich dann versuche zu entscheiden, ob ein neuer, unsichtbarer, d-dimensionaler Vektor zu diesem Cluster gehört, überprüfe ich seine …

1
Wie finde ich die Varianz zwischen mehrdimensionalen Punkten?
Angenommen, ich habe eine Matrix X, die n mal p ist, dh n Beobachtungen mit jeder Beobachtung im p-dimensionalen Raum. Wie finde ich die Varianz dieser n Beobachtungen? In dem Fall, in dem p = 1 ist, muss ich nur die reguläre Varianzformel verwenden. Was ist mit den Fällen, in …
12 variance 


1
Finden der angepassten und vorhergesagten Werte für ein statistisches Modell
Angenommen, ich habe die folgenden Daten und führe ein Regressionsmodell aus: df=data.frame(income=c(5,3,47,8,6,5), won=c(0,0,1,1,1,0), age=c(18,18,23,50,19,39), home=c(0,0,1,0,0,1)) Einerseits führe ich ein lineares Modell aus, um das Einkommen vorherzusagen: md1 = lm(income ~ age + home + home, data=df) Zweitens führe ich ein Logit-Modell aus, um die gewonnene Variable vorherzusagen: md2 = glm(factor(won) …
12 r 


1
Berechnung der kanonischen Verknüpfungsfunktion in GLM
Ich dachte, dass die kanonische Verknüpfungsfunktion aus dem natürlichen Parameter der Exponentialfamilie stammt. Angenommen, betrachten Sie die Familie then ist die kanonische Verknüpfungsfunktion. Nehmen wir als Beispiel die Bernoulli-Verteilung , wir haben Die kanonische Verknüpfungsfunktiong(⋅)g(⋅)g(\cdot)f(y,θ,ψ)=exp{yθ−b(θ)a(ψ)−c(y,ψ)}f(y,θ,ψ)=exp⁡{yθ−b(θ)a(ψ)−c(y,ψ)} f(y,\theta,\psi)=\exp\left\{\frac{y\theta-b(\theta)}{a(\psi)}-c(y,\psi)\right\} θ=θ(μ)θ=θ(μ)\theta=\theta(\mu)P(Y=y)=μy(1−μ)1−y=exp{ylogμ1−μ+log(1−μ)}P(Y=y)=μy(1−μ)1−y=exp⁡{ylog⁡μ1−μ+log⁡(1−μ)} P(Y=y)=\mu^{y}(1-\mu)^{1-y}=\exp\left\{y\log\frac{\mu}{1-\mu}+\log{(1-\mu)}\right\} g(μ)=logμ1−μg(μ)=log⁡μ1−μg(\mu)=\log\frac{\mu}{1-\mu} Aber wenn ich diese Folie sehe , behauptet sie, dass obwohl …

5
Wie lässt sich die „Rundung“ der SE-Mitarbeiter messen?
Stack Exchange ist, wie wir alle wissen, eine Sammlung von Q & A-Sites mit diversifizierten Themen. Angenommen, jede Site ist unabhängig voneinander, wie kann man angesichts der Statistiken eines Benutzers seine "Rundung" im Vergleich zum nächsten berechnen? Was ist das statistische Tool, das ich verwenden sollte? Um ehrlich zu sein, …




Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.