Ich habe einen Datensatz mit 26 Funktionen und 31000 Zeilen. Es ist der Datensatz von 38 Probanden. Es ist für ein biometrisches System. Ich möchte also in der Lage sein, Themen zu identifizieren. Ich weiß, dass ich einige Werte entfernen muss, um einen Testsatz zu haben. Was ist besser und …
Ich versuche zu verstehen, warum sich die Summe von zwei (oder mehr) lognormalen Zufallsvariablen einer lognormalen Verteilung nähert, wenn Sie die Anzahl der Beobachtungen erhöhen. Ich habe online gesucht und keine diesbezüglichen Ergebnisse gefunden. Wenn und Y unabhängige lognormale Variablen sind, ist X × Y aufgrund der Eigenschaften von Exponenten …
In diesem Beitrag können Sie die Erklärung lesen: Modelle werden normalerweise durch Punkte θθ\theta auf einer endlich dimensionalen Mannigfaltigkeit dargestellt. Über Differentialgeometrie und Statistik von Michael K. Murray und John W. Rice werden diese Konzepte in lesbarer Prosa erklärt, wobei die mathematischen Ausdrücke ignoriert werden. Leider gibt es nur sehr …
Gibt es einen Beweis dafür, dass das CLT keine charakteristischen Funktionen verwendet, eine einfachere Methode? Vielleicht Tikhomirov oder Steins Methoden? Etwas Eigenständiges, das Sie einem Universitätsstudenten erklären können (erstes Jahr Mathematik oder Physik) und das weniger als eine Seite umfasst?
Beim Herumspielen mit dem Boston Housing Dataset und RandomForestRegressor(mit Standardparametern) beim Scikit-Lernen fiel mir etwas Seltsames auf: Der durchschnittliche Kreuzvalidierungswert nahm ab, als ich die Anzahl der Falten über 10 erhöhte. Meine Kreuzvalidierungsstrategie lautete wie folgt: cv_met = ShuffleSplit(n_splits=k, test_size=1/k) scores = cross_val_score(est, X, y, cv=cv_met) ... wo num_cvswar abwechslungsreich. …
Meine Frage ist inspiriert R ‚s built-in exponentiellem Zufallszahlengenerator, die Funktion rexp(). Bei dem Versuch, exponentiell verteilte Zufallszahlen zu generieren, empfehlen viele Lehrbücher die inverse Transformationsmethode, wie auf dieser Wikipedia-Seite beschrieben . Mir ist bewusst, dass es andere Methoden gibt, um diese Aufgabe zu erfüllen. Insbesondere verwendet der Quellcode von …
Das R-Paket mclustverwendet BIC als Kriterium für die Auswahl des Clustermodells. Nach meinem Verständnis sollte ein Modell mit dem niedrigsten BIC gegenüber anderen Modellen ausgewählt werden (wenn Sie sich nur für BIC interessieren). Wenn jedoch alle BIC-Werte negativ sind, Mclustwird standardmäßig das Modell mit dem höchsten BIC-Wert verwendet. Mein allgemeines …
Kruschkes Bayesianisches Buch sagt über die Verwendung einer Beta-Distribution zum Werfen einer Münze: Wenn wir zum Beispiel kein anderes Vorwissen haben als das Wissen, dass die Münze eine Kopf- und eine Schwanzseite hat, bedeutet dies, dass wir zuvor einen Kopf und einen Schwanz beobachtet haben, was a = 1 und …
Ich habe eine Verteilung der Gehälter und möchte den Unterschied in den Mitteln für Männer und Frauen vergleichen. Ich weiß, dass es den Schüler-T-Test zum Vergleichen von zwei Mitteln gibt, aber nachdem ich ANOVA vorgeschlagen hatte, erhielt ich einige Kritik, dass ANOVA zum Vergleichen von mehr als zwei Mitteln dient. …
Ich forsche, um Unterschiede in der Fischdichte und im Fischartenreichtum zu untersuchen, wenn ich zwei verschiedene visuelle Unterwasserzählungsmethoden verwende. Meine Daten waren ursprünglich Zähldaten, aber normalerweise wird dies in Fischdichte geändert, aber ich habe mich immer noch für die Verwendung eines Poisson GLM entschieden, was hoffentlich richtig ist. model1 <- …
Beim maschinellen Lernen (für Regressionsprobleme) sehe ich häufig, dass der mittlere quadratische Fehler (MSE) oder der mittlere absolute Fehler (MAE) als Fehlerfunktion zum Minimieren verwendet werden (plus Regularisierungsterm). Ich frage mich, ob es Situationen gibt, in denen die Verwendung des Korrelationskoeffizienten angemessener wäre. Wenn eine solche Situation vorliegt, dann: In …
Ich lese hier den Wikipedia-Artikel über statistische Modelle und bin etwas ratlos über die Bedeutung von "nichtparametrischen statistischen Modellen", insbesondere: Ein statistisches Modell ist nichtparametrisch, wenn der Parametersatz unendlich dimensional ist. Ein statistisches Modell ist semiparametrisch, wenn es sowohl endlichdimensionale als auch unendlichdimensionale Parameter aufweist. Wenn d die Dimension von …
Was ist der richtige Weg, um einen Unterschied im Differenzmodell mit individuellen Level-Panel-Daten anzugeben? Hier ist das Setup: Angenommen, ich habe Panel-Daten auf Einzelebene, die seit mehreren Jahren in Städten eingebettet sind, und die Behandlung variiert je nach Stadtjahr. Formal lassen das Ergebnis für einzelne sein i in der Stadt …
Ich arbeite derzeit daran, ein Vorhersagemodell für ein binäres Ergebnis in einem Datensatz mit ~ 300 Variablen und 800 Beobachtungen zu erstellen. Ich habe auf dieser Website viel über die Probleme gelesen, die mit der schrittweisen Regression verbunden sind, und warum man sie nicht verwendet. Ich habe die LASSO-Regression und …
Angenommen, ich habe einen Klassifizierer (es kann sich um einen der Standardklassifizierer wie Entscheidungsbaum, zufällige Gesamtstruktur, logistische Regression usw. handeln) zur Betrugserkennung mit dem folgenden Code library(randomForest) rfFit = randomForest(Y ~ ., data = myData, ntree = 400) # A very basic classifier Say, Y is a binary outcome - …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.