Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
R-Quadrat im linearen Modell versus Abweichung im verallgemeinerten linearen Modell?
Hier ist mein Kontext für diese Frage: Soweit ich weiß, können wir keine gewöhnliche Regression der kleinsten Quadrate in R ausführen, wenn wir gewichtete Daten und das surveyPaket verwenden. Hier müssen wir verwenden svyglm(), die stattdessen ein verallgemeinertes lineares Modell ausführt (was das gleiche sein kann? Ich bin hier in …

3
Die Summe zweier unabhängiger Gamma-Zufallsvariablen
Laut Wikipedia-Artikel über die Gamma-Verteilung : Wenn X∼Gamma(a,θ)X∼Gamma(a,θ)X\sim\mathrm{Gamma}(a,\theta) und Y∼Gamma(b,θ)Y∼Gamma(b,θ)Y\sim\mathrm{Gamma}(b,\theta) , wobei XXX und YYY unabhängige Zufallsvariablen, dann X+Y∼Gamma(a+b,θ)X+Y∼Gamma(a+b,θ)X+Y\sim \mathrm{Gamma}(a+b, \theta) . Aber ich sehe keinen Beweis. Kann mich bitte jemand auf seinen Beweis hinweisen? Edit: Vielen Dank an Zen, und auch ich fand die Antwort als Beispiel auf der …

3
F-Statistik, F-kritischer Wert und P-Wert
Ich bin sehr neu in diesem Bereich und habe Schwierigkeiten, das Konzept der Zurückweisung der Nullhypothese auf der Grundlage der Ergebnisse aus der ANOVA-Tabelle zu verstehen. In welcher Beziehung stehen das berechnete F und der kritische Wert zum p-Wert? Und wenn das berechnete F größer als 1 ist, bedeutet dies …
13 anova 


2
Was ist los mit Autokorrelation?
Um das vorwegzunehmen, ich habe einen ziemlich tiefen mathematischen Hintergrund, aber ich habe mich nie wirklich mit Zeitreihen oder statistischer Modellierung beschäftigt. Also musst du nicht sehr sanft zu mir sein :) Ich lese dieses Papier über die Modellierung des Energieverbrauchs in Gewerbegebäuden, und der Autor behauptet: [Das Vorhandensein von …




1
Algebra der LDA. Fisher Diskriminanzstärke einer variablen und linearen Diskriminanzanalyse
Offenbar, Die Fisher-Analyse zielt darauf ab, gleichzeitig die Trennung zwischen den Klassen zu maximieren und gleichzeitig die Streuung innerhalb der Klassen zu minimieren. Ein nützliches Maß für das Unterscheidungsvermögen einer Variablen ist daher die Diagonalengröße: Bii/WiiBii/WiiB_{ii}/W_{ii} . http://root.cern.ch/root/htmldoc/TMVA__MethodFisher.html Ich verstehe, dass die Größe ( p x p) der Matrizen zwischen …

2
Wie weit bringt mich das Selbststudium?
Ich habe noch nie an einem offiziellen oder strukturierten Kurs zur Datenanalyse oder zum maschinellen Lernen (mit Ausnahme der neuesten Online-Angebote) teilgenommen und das meiste gelernt, was ich aus dem Lesen und Ausprobieren weiß. Ich weiß, dass ich weit davon entfernt bin, einen Job zu bekommen. Meine Frage ist nicht, …


3
PCA zu hochdimensionalen Textdaten vor der zufälligen Waldklassifikation?
Ist es sinnvoll, PCA durchzuführen, bevor eine zufällige Waldklassifizierung durchgeführt wird? Ich habe es mit hochdimensionalen Textdaten zu tun, und ich möchte eine Feature-Reduzierung durchführen, um den Fluch der Dimensionalität zu vermeiden. Ist Random Forests nicht bereits auf eine Art von Dimensionsreduzierung eingestellt?

4
Umgang mit Krawatten, Gewichten und Abstimmungen in kNN
Ich programmiere einen kNN-Algorithmus und möchte Folgendes wissen: Unentschieden: Was passiert, wenn bei der Mehrheitsabstimmung kein eindeutiger Gewinner feststeht? ZB sind alle k nächsten Nachbarn aus verschiedenen Klassen, oder für k = 4 gibt es 2 Nachbarn aus Klasse A und 2 Nachbarn aus Klasse B? Was passiert, wenn es …

2
Mathematik hinter Klassifikations- und Regressionsbäumen
Kann jemand helfen, einige der Mathematik hinter der Klassifizierung in CART zu erklären? Ich möchte verstehen, wie zwei Hauptphasen ablaufen. Zum Beispiel habe ich einen CART-Klassifikator für ein Dataset trainiert und ein Test-Dataset verwendet, um die prädiktive Leistung zu kennzeichnen, aber: Wie wird die ursprüngliche Wurzel des Baumes gewählt? Warum …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.