Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Was bedeutet Regularisierungspfad bei LASSO oder verwandten Sparsity-Problemen?
Wenn wir unterschiedliche Werte des Parameters auswählen , können wir Lösungen mit unterschiedlichen Sparsity-Levels erhalten. Bedeutet dies, dass der Regularisierungspfad die Auswahl der Koordinate ist, die eine schnellere Konvergenz erzielen könnte? Ich bin ein wenig verwirrt, obwohl ich oft von Sparsamkeit gehört habe. Könnten Sie bitte eine einfache Beschreibung der …

2
Gibt es einen Test / eine Technik / eine Methode zum Vergleichen der Zerlegung von Hauptkomponenten zwischen Proben?
Gibt es eine methodische Möglichkeit, die Richtungen, Größen usw. der PCA-Ergebnisse für verschiedene Proben aus derselben Population zu vergleichen? Ich lasse die Art des Tests absichtlich vage, weil ich all die verschiedenen Möglichkeiten hören möchte ... zB könnte es einen Test geben (und ich spekuliere hier), der die Größen der …

1
Kreuzvalidierung mit nichtparametrischen Glättungsregressionen
Wenn ich Regressionsmodelle verwende, bin ich misstrauisch, wenn ich auf Annahmen einer linearen Assoziation zurückgreife. stattdessen mag ich die funktionale Form von Beziehungen zwischen abhängigen und erklärenden Variablen Regression nichtparametrischer Glättung zu erforschen (zB verallgemeinerten Additivmodell , Lowess / Lowess , Linie Glätter läuft , etc.) , bevor ein parametrisches …

3
Verwenden von k-means mit anderen Metriken
Mir ist also klar, dass dies schon einmal gefragt wurde: z. B. Was sind die Anwendungsfälle im Zusammenhang mit der Clusteranalyse verschiedener Entfernungsmetriken? aber ich habe festgestellt, dass die Antworten etwas widersprüchlich zu dem sind, was in der Literatur vorgeschlagen wird. Kürzlich habe ich zwei Artikel gelesen, in denen die …



1
Wahrscheinlichkeit und Schätzungen für gemischte Effekte Logistische Regression
Lassen Sie uns zunächst einige Daten für eine logistische Regression mit festen und zufälligen Teilen simulieren: set.seed(1) n <- 100 x <- runif(n) z <- sample(c(0,1), n, replace=TRUE) b <- rnorm(2) beta <- c(0.4, 0.8) X <- model.matrix(~x) Z <- cbind(z, 1-z) eta <- X%*%beta + Z%*%b pr <- 1/(1+exp(-eta)) …

1
AB-Test vs. Test der Nullhypothese
Ich versuche den Unterschied zwischen zu verstehen Testen der Nullhypothese (dh Testen, dass die Wahrscheinlichkeit eines "Ziels" für 2 verschiedene Populationen gleich ist, ähnlich wie bei prop.test in R) ein A / B-Test unter Verwendung einer Bayes'schen Formel wie hier beschrieben: http://www.evanmiller.org/bayesian-ab-testing.html Ist da ein Unterschied? Ist man vorzuziehen? Das …


1
Lineare Diskriminanzanalyse und nicht normalverteilte Daten
Wenn ich das richtig verstehe, setzt eine lineare Diskriminanzanalyse (LDA) normalverteilte Daten, unabhängige Merkmale und identische Kovarianzen für jede Klasse für das Optimalitätskriterium voraus. Ist es nicht schon eine Verletzung, da der Mittelwert und die Varianz aus den Trainingsdaten geschätzt werden? Ich fand ein Zitat in einem Artikel (Li, Tao, …

5
Konfidenzintervall für eine zufällige Menge?
Angenommen, ist ein unbekannter Vektor, und man beobachtet . Ich möchte Konfidenzintervalle für die Zufallsmenge berechnen , die nur auf dem beobachteten und dem bekannten Parameter basiert . Das heißt, für ein gegebenes finden Sie so, dass .a⃗ a→\vec{a}pppb⃗ ∼N(a⃗ ,I)b→∼N(a→,I)\vec{b} \sim \mathcal{N}\left(\vec{a}, I\right)b⃗ ⊤a⃗ b→⊤a→\vec{b}^{\top} \vec{a}b⃗ b→\vec{b}pppα∈(0,1)α∈(0,1)\alpha \in (0,1)c(b⃗ …

1
Verringert sich die Bevölkerung der blauäugigen Marsmenschen?
Nehmen wir an, wir wollen die Hypothese testen, dass der Anteil der blauäugigen Marsmenschen im Laufe des 20. Jahrhunderts abgenommen hat. Leider schwankt die Marsbevölkerung stark, so dass jedes Jahrzehnt ein großer Unterschied in der Gesamtbevölkerung besteht [Update: Betrachten Sie die Marsbevölkerung als konstant bei einer Milliarde Marsmenschen. Die folgenden …

1
Verwenden der richtigen Bewertungsregel, um die Klassenmitgliedschaft anhand der logistischen Regression zu bestimmen
Ich verwende die logistische Regression, um die Wahrscheinlichkeit des Eintretens eines Ereignisses vorherzusagen. Letztendlich werden diese Wahrscheinlichkeiten in eine Produktionsumgebung gestellt, in der wir uns so weit wie möglich darauf konzentrieren, unsere "Ja" -Vorhersagen zu treffen. Es ist daher nützlich, eine Vorstellung davon zu haben, welche endgültigen "Treffer" oder "Nicht-Treffer" …

2
unter einem Gaußschen
Diese Frage geht aus der folgenden Frage hervor. /math/360275/e1-1x2-under-a-normal-distribution Grundsätzlich ist was das unter einem allgemeinen GaußschenN(μ,σ2). Ich habe versucht,1 neu zuschreibenE.( 11 + x2)E(11+x2)E\left(\frac{1}{1+x^2}\right)N.( μ , σ2)N(μ,σ2)\mathcal{N}(\mu,\sigma^2) als Skalar Mischung von Gaußfunktionen (& agr;∫N(x|0,τ-1)Ga(τ|1/2,1/2)dτ). Dies kam auch zum Stillstand, es sei denn, Sie haben einen Trick unter Ihrem Gürtel.11 …

1
wobei
Ich versuche, die Erwartung für beliebiges c &lt; 0 zu berechnen (für c &gt; 0 ist die Erwartung unendlich), wenn X logarithmisch verteilt ist, dh log ( X ) ∼ N ( μ , σ ) .E.[ ec X.]]E[ecX]E[e^{cX}]c &lt; 0c&lt;0c<0c &gt; 0c&gt;0c>0X.XXLog( X.) ∼ N.( μ , σ)log⁡(X)∼N(μ,σ)\log(X) \sim …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.