Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

4
Welche Vorteile hat die Poisson-Regression in diesem Fall gegenüber der linearen Regression?
Ich habe einen Datensatz erhalten, der die Anzahl der Auszeichnungen enthält, die von Schülern einer High School erhalten wurden. Zu den Prädiktoren für die Anzahl der Auszeichnungen gehören die Art des Programms, in dem der Schüler eingeschrieben war, und die Punktzahl für die Abschlussprüfung in Mathematik. Ich habe mich gefragt, …

2
Interpretation des Ergebnisses der k-Mittel-Clusterbildung in R.
Ich habe die kmeansAnweisung von R verwendet, um den k-means-Algorithmus für Andersons Iris-Datensatz durchzuführen. Ich habe eine Frage zu einigen Parametern, die ich erhalten habe. Die Ergebnisse sind: Cluster means: Sepal.Length Sepal.Width Petal.Length Petal.Width 1 5.006000 3.428000 1.462000 0.246000 Wofür steht in diesem Fall "Cluster"? Es ist der Mittelwert der …


2
Wie kombiniere ich Ergebnisse logistischer Regression und zufälliger Gesamtstruktur?
Ich bin neu im maschinellen Lernen. Ich habe logistische Regression und zufällige Gesamtstruktur auf denselben Datensatz angewendet. Ich erhalte also eine variable Wichtigkeit (absoluter Koeffizient für die logistische Regression und variable Wichtigkeit für zufällige Wälder). Ich denke, die beiden zu kombinieren, um eine endgültige variable Bedeutung zu erhalten. Kann jemand …

1
Kernelised k Nächster Nachbar
Ich bin neu in Kerneln und habe beim Versuch, kNN zu kerneln, einen Haken bekommen. Vorbereitungen Ich verwende einen Polynomkern: K(x,y)=(1+⟨x,y⟩)dK(x,y)=(1+⟨x,y⟩)dK(\mathbf{x},\mathbf{y}) = (1 + \langle \mathbf{x},\mathbf{y} \rangle)^d Ihr typischer euklidischer kNN verwendet die folgende Abstandsmetrik: d(x,y)=||x−y||d(x,y)=||x−y||d(\mathbf{x}, \mathbf{y}) = \vert\vert \mathbf{x} - \mathbf{y} \vert\vert Lassen Sie \ mathbf {x} in einen …

1
Vorhersage des geordneten Logits in R.
Ich versuche eine geordnete Logit-Regression durchzuführen. Ich führe das Modell so aus (nur ein dummes kleines Modell, das die Anzahl der Unternehmen auf einem Markt anhand von Einkommens- und Bevölkerungsmaßen schätzt). Meine Frage betrifft Vorhersagen. nfirm.opr<-polr(y~pop0+inc0, Hess = TRUE) pr_out<-predict(nfirm.opr) Wenn ich "Vorhersagen" ausführe (mit denen ich versuche, das vorhergesagte …

1
Dichte von Y = log (X) für Gamma-verteiltes X.
Diese Frage steht in engem Zusammenhang mit diesem Beitrag Angenommen, ich habe eine Zufallsvariable und definiere Y = log ( X ) . Ich möchte die Wahrscheinlichkeitsdichtefunktion von Y finden .X∼Gamma(k,θ)X∼Gamma(k,θ)X \sim \text{Gamma}(k, \theta)Y=log(X)Y=log⁡(X)Y = \log(X)YYY Ich hatte ursprünglich gedacht, ich würde einfach die kumulative Verteilungsfunktion X definieren, eine Änderung …

2
Sind PCA-Lösungen einzigartig?
Wenn ich PCA für einen bestimmten Datensatz ausführe, ist die mir gegebene Lösung einzigartig? Das heißt, ich erhalte einen Satz von 2D-Koordinaten, basierend auf Zwischenpunktabständen. Ist es möglich, mindestens eine weitere Anordnung der Punkte zu finden, die diese Einschränkungen erfüllen würden? Wenn die Antwort ja ist, wie kann ich eine …
12 pca 



1
Was sind
Ich habe in letzter Zeit viele Artikel über spärliche Darstellungen gesehen, und die meisten von ihnen verwenden die ℓpℓp\ell_p Norm und führen einige Minimierungen durch. Meine Frage ist, was ist die ℓpℓp\ell_p Norm und die ℓp,qℓp,q\ell_{p, q} Mischnorm? Und wie sind sie für die Regularisierung relevant? Vielen Dank



1
Multivariate Normalverteilung des Regressionskoeffizienten?
Beim Lesen eines Lehrbuchs über Regression stieß ich auf folgenden Absatz: Die Schätzung der kleinsten Quadrate eines Vektors linearer Regressionskoeffizienten ( ) istββ\beta β^=(XtX)−1Xtyβ^=(XtX)−1Xty \hat{\beta} = (X^{t}X)^{-1}{X^t}y Dies ist, wenn es als Funktion der Daten (unter Berücksichtigung der Prädiktoren X als Konstanten), eine lineare Kombination der Daten. Mit dem zentralen …

3
Beziehung zwischen zwei Zeitreihen: ARIMA
Was ist angesichts der folgenden zwei Zeitreihen ( x , y ; siehe unten) die beste Methode, um die Beziehung zwischen den langfristigen Trends in diesen Daten zu modellieren? Beide Zeitreihen haben signifikante Durbin-Watson-Tests, wenn sie als Funktion der Zeit modelliert werden, und beide sind nicht stationär (wie ich den …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.