Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Führen Sie eine lineare Regression durch, erzwingen Sie jedoch, dass die Lösung bestimmte Datenpunkte durchläuft
Ich weiß, wie man eine lineare Regression auf einer Menge von Punkten durchführt. Das heißt, ich kann ein Polynom meiner Wahl an einen gegebenen Datensatz anpassen (im LSE-Sinne). Was ich jedoch nicht weiß, ist, wie ich meine Lösung zwingen kann, bestimmte Punkte meiner Wahl durchzugehen. Ich habe dies schon einmal …

1
Differenzielle Entropie
Die Differentialentropie des Gaußschen RV beträgt log2(σ2πe−−−√)log2⁡(σ2πe)\log_2(\sigma \sqrt{2\pi e}). Dies ist abhängig vonσσ\sigma, der Standardabweichung. Wenn wir die Zufallsvariable so normalisieren, dass sie eine Einheitsvarianz aufweist, fällt ihre Differentialentropie ab. Für mich ist dies kontraintuitiv, da die Komplexität der Kolmogorov-Normalisierungskonstante im Vergleich zur Verringerung der Entropie sehr gering sein sollte. …

2
Bedingte Erwartung einer exponentiellen Zufallsvariablen
Für eine Zufallsvariable ist X∼Exp(λ)X∼Exp(λ)X\sim \text{Exp}(\lambda) ( E[X]=1λE[X]=1λ\mathbb{E}[X] = \frac{1}{\lambda} ) Ich fühle intuitiv, dassE[X|X>x]E[X|X>x]\mathbb{E}[X|X > x]sollte gleichx+E[X]x+E[X]x + \mathbb{E}[X]da durch die memorylose Eigenschaft die Verteilung vonX|X>xX|X>xX|X > xist dasselbe wieXXXjedoch umnach rechts verschobenxxx. Ich bemühe mich jedoch, die memorylose Eigenschaft zu verwenden, um einen konkreten Beweis zu liefern. Jede …


3
Nicht negative Lasso-Implementierung in R
Ich suche Open Source oder eine vorhandene Bibliothek, die ich nutzen kann. Soweit ich weiß, ist das glmnet-Paket nicht sehr einfach zu erweitern, um den nicht negativen Fall abzudecken. Ich kann mich irren, jeder mit irgendwelchen Ideen sehr geschätzt. Mit nicht negativ meine ich, dass alle Koeffizienten positiv sein müssen …
13 r  lasso 

3
Wie kann man mit instabilen
Beta-Stabilität in linearer Regression mit hoher Multi-Kollinearität? Nehmen wir an, in einer linearen Regression haben die Variablen und x 2 eine hohe Multi-Kollinearität (die Korrelation liegt bei 0,9).x1x1x_1x2x2x_2 Wir sind besorgt über die Stabilität des Koeffizienten, daher müssen wir die Multikollinearität behandeln.ββ\beta Die Lehrbuchlösung wäre, einfach eine der Variablen wegzuwerfen. …

4
Was tun, wenn die Mittelwerte zweier Stichproben erheblich voneinander abweichen, der Unterschied jedoch zu gering ist, um eine Rolle zu spielen?
Ich habe zwei Proben ( n≈70n≈70n \approx 70 in beiden Fällen). Die Mittel unterscheiden sich um etwa das Doppelte der gepoolten Standardabweichung. dev. Der resultierende TTT Wert ist ungefähr 10. Obwohl es gut zu wissen ist, dass ich schlüssig gezeigt habe, dass die Mittelwerte nicht gleich sind, scheint dies von …



2
Ermitteln der besten Funktionen in Interaktionsmodellen
Ich habe eine Liste von Proteinen mit ihren Merkmalswerten. Eine Beispieltabelle sieht folgendermaßen aus: ...............Feature1...Feature2...Feature3...Feature4 Protein1 Protein2 Protein3 Protein4 Zeilen sind Proteine ​​und Spalten sind Merkmale. Ich habe auch eine Liste von Proteinen, die ebenfalls interagieren. beispielsweise Protein3, Protein4 Protein1, Protein2 Protein4, Protein1 Problem : Für eine vorläufige Analyse möchte …

2
Warum sollte für die hierarchische logistische Regression eine Beta-Verteilung für den Bernoulli-Parameter verwendet werden?
Ich lese gerade Kruschkes hervorragendes Buch "Doing Bayesian Data Analysis". Das Kapitel über hierarchische logistische Regression (Kapitel 20) ist jedoch etwas verwirrend. Abbildung 20.2 beschreibt eine hierarchische logistische Regression, bei der der Bernoulli-Parameter als lineare Funktion der durch eine Sigmoidfunktion transformierten Koeffizienten definiert ist. Dies scheint die Art und Weise …

2
Problem mit e1071 libsvm?
Ich habe einen Datensatz mit zwei überlappenden Klassen, sieben Punkte in jeder Klasse, Punkte liegen im zweidimensionalen Raum. In R rufe ich svmdas e1071Paket auf, um eine separate Hyperebene für diese Klassen zu erstellen. Ich benutze den folgenden Befehl: svm(x, y, scale = FALSE, type = 'C-classification', kernel = 'linear', …

1
Halton-Sequenz gegen Sobol-Sequenz?
Aus einer Antwort in einer früheren Frage ging ich auf die Halton-Sequenz ein, um eine Reihe von Vektoren zu erstellen, die einen einheitlichen Probenraum ziemlich gleichmäßig abdecken. Auf der Wikipedia-Seite wird jedoch erwähnt, dass besonders höhere Primzahlen zu Beginn der Serie häufig stark korrelieren. Dies scheint für jedes Paar hoher …



Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.