Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

4
Was ist der geeignetere Weg, um ein Hold-out-Set zu erstellen: einige Themen zu entfernen oder einige Beobachtungen von jedem Thema zu entfernen?
Ich habe einen Datensatz mit 26 Funktionen und 31000 Zeilen. Es ist der Datensatz von 38 Probanden. Es ist für ein biometrisches System. Ich möchte also in der Lage sein, Themen zu identifizieren. Ich weiß, dass ich einige Werte entfernen muss, um einen Testsatz zu haben. Was ist besser und …


2
Grafische Intuition der Statistik auf einer Mannigfaltigkeit
In diesem Beitrag können Sie die Erklärung lesen: Modelle werden normalerweise durch Punkte θθ\theta auf einer endlich dimensionalen Mannigfaltigkeit dargestellt. Über Differentialgeometrie und Statistik von Michael K. Murray und John W. Rice werden diese Konzepte in lesbarer Prosa erklärt, wobei die mathematischen Ausdrücke ignoriert werden. Leider gibt es nur sehr …


1
Warum senkt eine große Auswahl an K meine Kreuzvalidierungsbewertung?
Beim Herumspielen mit dem Boston Housing Dataset und RandomForestRegressor(mit Standardparametern) beim Scikit-Lernen fiel mir etwas Seltsames auf: Der durchschnittliche Kreuzvalidierungswert nahm ab, als ich die Anzahl der Falten über 10 erhöhte. Meine Kreuzvalidierungsstrategie lautete wie folgt: cv_met = ShuffleSplit(n_splits=k, test_size=1/k) scores = cross_val_score(est, X, y, cv=cv_met) ... wo num_cvswar abwechslungsreich. …

3
Was sind die Vorteile eines exponentiellen Zufallsgenerators nach der Methode von Ahrens und Dieter (1972) anstelle einer inversen Transformation?
Meine Frage ist inspiriert R ‚s built-in exponentiellem Zufallszahlengenerator, die Funktion rexp(). Bei dem Versuch, exponentiell verteilte Zufallszahlen zu generieren, empfehlen viele Lehrbücher die inverse Transformationsmethode, wie auf dieser Wikipedia-Seite beschrieben . Mir ist bewusst, dass es andere Methoden gibt, um diese Aufgabe zu erfüllen. Insbesondere verwendet der Quellcode von …

1
Mclust Modellauswahl
Das R-Paket mclustverwendet BIC als Kriterium für die Auswahl des Clustermodells. Nach meinem Verständnis sollte ein Modell mit dem niedrigsten BIC gegenüber anderen Modellen ausgewählt werden (wenn Sie sich nur für BIC interessieren). Wenn jedoch alle BIC-Werte negativ sind, Mclustwird standardmäßig das Modell mit dem höchsten BIC-Wert verwendet. Mein allgemeines …

2
Beta-Verteilung beim Werfen einer Münze
Kruschkes Bayesianisches Buch sagt über die Verwendung einer Beta-Distribution zum Werfen einer Münze: Wenn wir zum Beispiel kein anderes Vorwissen haben als das Wissen, dass die Münze eine Kopf- und eine Schwanzseite hat, bedeutet dies, dass wir zuvor einen Kopf und einen Schwanz beobachtet haben, was a = 1 und …


3
Soll ich für meinen Poisson GLM einen Offset verwenden?
Ich forsche, um Unterschiede in der Fischdichte und im Fischartenreichtum zu untersuchen, wenn ich zwei verschiedene visuelle Unterwasserzählungsmethoden verwende. Meine Daten waren ursprünglich Zähldaten, aber normalerweise wird dies in Fischdichte geändert, aber ich habe mich immer noch für die Verwendung eines Poisson GLM entschieden, was hoffentlich richtig ist. model1 <- …

2
Verwenden Sie den Pearson-Korrelationskoeffizienten als Optimierungsziel beim maschinellen Lernen
Beim maschinellen Lernen (für Regressionsprobleme) sehe ich häufig, dass der mittlere quadratische Fehler (MSE) oder der mittlere absolute Fehler (MAE) als Fehlerfunktion zum Minimieren verwendet werden (plus Regularisierungsterm). Ich frage mich, ob es Situationen gibt, in denen die Verwendung des Korrelationskoeffizienten angemessener wäre. Wenn eine solche Situation vorliegt, dann: In …

3
Was sind Beispiele aus der Praxis für „nicht parametrische statistische Modelle“?
Ich lese hier den Wikipedia-Artikel über statistische Modelle und bin etwas ratlos über die Bedeutung von "nichtparametrischen statistischen Modellen", insbesondere: Ein statistisches Modell ist nichtparametrisch, wenn der Parametersatz unendlich dimensional ist. Ein statistisches Modell ist semiparametrisch, wenn es sowohl endlichdimensionale als auch unendlichdimensionale Parameter aufweist. Wenn d die Dimension von …



2
Inkrementelles Lernen für Klassifikationsmodelle in R.
Angenommen, ich habe einen Klassifizierer (es kann sich um einen der Standardklassifizierer wie Entscheidungsbaum, zufällige Gesamtstruktur, logistische Regression usw. handeln) zur Betrugserkennung mit dem folgenden Code library(randomForest) rfFit = randomForest(Y ~ ., data = myData, ntree = 400) # A very basic classifier Say, Y is a binary outcome - …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.