Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Was bedeutet "alle anderen gleich" bei multipler Regression?
Wenn wir mehrere Regressionen durchführen und sagen, dass wir die durchschnittliche Änderung in der Variablen auf eine Änderung in einer Variablen untersuchen und alle anderen Variablen konstant halten, bei welchen Werten halten wir die anderen Variablen konstant? Ihr gemeiner? Null? Irgendein Wert?yyyxxx Ich bin geneigt zu glauben, dass es irgendeinen …


3
Vorteile der Verwendung von QQ-Plots gegenüber Histogrammen
In diesem Kommentar schrieb Nick Cox: Klasseneinteilung ist eine alte Methode. Während Histogramme nützlich sein können, macht es eine moderne Statistiksoftware einfach und ratsam, Verteilungen an die Rohdaten anzupassen. Binning wirft nur Details weg, die entscheidend dafür sind, welche Verteilungen plausibel sind. Der Kontext dieses Kommentars schlägt die Verwendung von …

4
Stouffers Z-Score-Methode: Was ist, wenn wir anstelle von ?
Ich führe unabhängige statistische Tests mit derselben Nullhypothese durch und möchte die Ergebnisse zu einem Wert kombinieren . Es scheint, dass es zwei "akzeptierte" Methoden gibt: die Fisher-Methode und die Stouffer-Methode .pNNNppp Meine Frage betrifft die Methode von Stouffer. Für jeden einzelnen Test ich einen z-Score . Unter einer Nullhypothese …

3
Warum wird der Erwartungsmaximierungsalgorithmus verwendet?
Nach dem, was ich noch nicht weiß, kann der EM-Algorithmus verwendet werden, um die maximale Wahrscheinlichkeit zu ermitteln, wenn die partiellen Ableitungen in Bezug auf die Parameter der Wahrscheinlichkeit auf Null gesetzt werden. Dies ergibt einen Satz von Gleichungen, die nicht analytisch gelöst werden können. Aber wird der EM-Algorithmus benötigt, …


2
Wie funktioniert das Bootstrapping in R?
Ich habe mir das Boot-Paket in R angeschaut und obwohl ich eine Reihe guter Grundlagen für die Verwendung gefunden habe, muss ich noch etwas finden, das genau beschreibt, was "hinter den Kulissen" passiert. In diesem Beispiel wird beispielsweise gezeigt , wie Standard-Regressionskoeffizienten als Ausgangspunkt für eine Bootstrap-Regression verwendet werden. Es …

2
Warum PCA von Daten mittels SVD der Daten?
In dieser Frage geht es um eine effiziente Methode zur Berechnung von Hauptkomponenten. Viele Texte zur linearen PCA befürworten die Verwendung der Singulärwertzerlegung der fallweisen Daten . Das heißt, wenn wir Daten und wollen die Variablen (seine ersetzen Spalten ) von Hauptkomponenten, wir tun SVD: X = U S V …

1
Gibt es einen Grund, ein bestimmtes Maß an Multikollinearität zu bevorzugen?
Bei der Arbeit mit vielen Eingabevariablen geht es uns häufig um Multikollinearität . Es gibt eine Reihe von Maßstäben für Multikollinearität, mit denen Multikollinearität erkannt, überlegt und / oder kommuniziert wird. Einige allgemeine Empfehlungen sind: Das Mehrfache für eine bestimmte Variable R2jRj2R^2_j Die Toleranz für eine bestimmte Variable 1 - …


2
Regression für ein Modell der Form
Ich habe einen Datensatz, bei dem es sich um Statistiken aus einem Webdiskussionsforum handelt. Ich schaue auf die Verteilung der Anzahl der Antworten, die ein Thema haben soll. Insbesondere habe ich ein Dataset erstellt, das eine Liste der Themenantworten und anschließend die Anzahl der Themen mit dieser Anzahl von Antworten …




2
Vorspannungskorrektur in der gewichteten Varianz
Für die ungewichtete Varianz existiert die vorspannungskorrigierte Stichprobenvarianz, wenn der Mittelwert aus denselben Daten geschätzt wurde: Var(X):=1Var ( X) : = 1n∑ich( xich- μ )2Var(X): =1n∑ich(xich-μ)2\text{Var}(X):=\frac{1}{n}\sum_i(x_i - \mu)^2Var ( X) : = 1n - 1∑ich( xich- E[ X] )2Var(X): =1n-1∑ich(xich-E[X])2\text{Var}(X):=\frac{1}{n-1}\sum_i(x_i - E[X])^2 Ich beschäftige mich mit dem gewichteten Mittelwert und …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.