Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Warum können zentrierende unabhängige Variablen die Haupteffekte mit Mäßigung verändern?
Ich habe eine Frage zu multipler Regression und Interaktion, die von diesem CV-Thread inspiriert wurde: Interaktionsbegriff unter Verwendung von hierarchischen Regressionsanalysen mit zentrierten Variablen? Welche Variablen sollten wir zentrieren? Bei der Überprüfung auf einen Moderationseffekt zentriere ich meine unabhängigen Variablen und multipliziere die zentrierten Variablen, um meinen Interaktionsterm zu berechnen. …

1
Unterschied zwischen Standard- und sphärischen k-Means-Algorithmen
Ich würde gerne verstehen, was der Hauptunterschied in der Implementierung zwischen Standard- und sphärischen K-Mittel-Clustering-Algorithmen ist. In jedem Schritt berechnet k-means die Abstände zwischen Elementvektoren und Cluster-Schwerpunkten und ordnet das Dokument diesem Cluster zu, dessen Schwerpunkt der nächste ist. Dann werden alle Zentroide neu berechnet. Im sphärischen k-Mittel sind alle …



3
Wie gehe ich bei der Variablenauswahl mit Multikollinearität um?
Ich habe einen Datensatz mit 9 kontinuierlichen unabhängigen Variablen. Ich versuche, unter diesen Variablen auszuwählen, um ein Modell an eine einzelne prozentuale (abhängige) Variable anzupassen Score. Leider weiß ich, dass es ernsthafte Kollinearität zwischen mehreren Variablen geben wird. Ich habe versucht, die stepAIC()Funktion in R für die Variablenauswahl zu verwenden, …


3
Was ist der Unterschied zwischen Konfidenzintervallen und Hypothesentests?
Ich habe über Kontroversen in Bezug auf Hypothesentests mit einigen Kommentatoren gelesen, die vorschlagen, dass Hypothesentests nicht verwendet werden sollten. Einige Kommentatoren schlagen vor, stattdessen Konfidenzintervalle zu verwenden. Was ist der Unterschied zwischen Konfidenzintervallen und Hypothesentests? Erklärung mit Verweis und Beispielen wäre wünschenswert.

2
Warum wird RSS Chi-Quadrat-mal np verteilt?
Ich möchte , verstehen , warum unter dem OLS - Modell, die RSS (Restsumme der Quadrate) verteilt wird ( die Anzahl der Parameter in dem Modell ist, die Anzahl der Beobachtungen).χ2⋅(n−p)χ2⋅(n−p)\chi^2\cdot (n-p)pppnnn Ich entschuldige mich dafür, dass ich eine so grundlegende Frage gestellt habe, aber ich kann die Antwort anscheinend …


4
So reduzieren Sie die Dimensionalität in R
Ich habe eine Matrix, in der a (i, j) angibt, wie oft ich Seite j angesehen habe. Es gibt 27.000 Einzelpersonen und 95.000 Seiten. Ich möchte eine Handvoll "Dimensionen" oder "Aspekte" im Bereich von Seiten haben, die Gruppen von Seiten entsprechen, die oft zusammen betrachtet werden. Mein letztendliches Ziel ist …

5
Warum ist die mittlere Funktion im Gaußschen Prozess nicht von Interesse?
Ich habe gerade angefangen, über GPs zu lesen, und analog zur regulären Gaußschen Verteilung ist sie durch eine mittlere Funktion und die Kovarianzfunktion oder den Kernel gekennzeichnet. Ich war auf einem Vortrag und der Sprecher sagte, dass die Mittelwertfunktion normalerweise ziemlich uninteressant ist und der gesamte Inferenzaufwand für die Schätzung …

8
Auf der Suche nach einem guten und vollständigen Wahrscheinlichkeits- und Statistikbuch
Ich hatte nie die Gelegenheit, einen Statistikkurs einer mathematischen Fakultät zu besuchen. Ich bin auf der Suche nach einem vollständigen und autarken Wahrscheinlichkeitstheorie- und Statistikbuch. Mit vollständig meine ich, dass es alle Beweise enthält und nicht nur Ergebnisse angibt. Mit autark meine ich, dass ich kein anderes Buch lesen muss, …


4
Wie führt man einen Student-T-Test durch, bei dem nur Stichprobengröße, Stichprobenmittelwert und Bevölkerungsmittelwert bekannt sind?
Der Test des Schülers erfordert die Standardabweichung der Stichprobe . Wie berechne ich jedoch für wenn nur die Stichprobengröße und der Stichprobenmittelwert bekannt sind?s stttssssss Wenn beispielsweise die Stichprobengröße und der Durchschnittswert beträgt , werde ich versuchen, eine Liste mit identischen Stichproben mit jeweils Werten zu erstellen . Erwartungsgemäß beträgt …

2
Ist eine Standardisierung vor Lasso wirklich notwendig?
Ich habe vor etwas wie LassoRegression drei Hauptgründe für die Standardisierung von Variablen gelesen : 1) Interpretierbarkeit von Koeffizienten. 2) Fähigkeit, die Wichtigkeit des Koeffizienten nach der relativen Größe der Schätzungen des Nachschrumpfungskoeffizienten zu ordnen. 3) Keine Notwendigkeit zum Abfangen. Aber ich wundere mich über den wichtigsten Punkt. Haben wir …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.