Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Quantifizierung der Abhängigkeit von Cauchy-Zufallsvariablen
Gegeben zwei Cauchy-Zufallsvariablen θ1∼ C a u c h y (x( 1 )0,γ( 1 ))θ1∼C.einuchy(x0(1),γ(1))\theta_1 \sim \mathrm{Cauchy}(x_0^{(1)}, \gamma^{(1)}) und θ2∼ C a u c h y (x( 2 )0,γ( 2 ))θ2∼C.einuchy(x0(2),γ(2))\theta_2 \sim \mathrm{Cauchy}(x_0^{(2)}, \gamma^{(2)}). Das ist nicht unabhängig. Die Abhängigkeitsstruktur von Zufallsvariablen kann häufig mit ihrer Kovarianz oder ihrem Korrelationskoeffizienten …

1
Modellierung von Zeitreihensensordaten mit maschinellen Lerntechniken?
Ich arbeite an Luftqualitätssensoren, von denen einige elektrochemische Gassensoren sind. Als Hintergrund werden diese Sensoren durch eine Potentiostatschaltung stimuliert, die eine Vorspannung anlegt und dann den Strom misst, der durch den Sensor fließt (typischerweise in der Größenordnung von Nano-Ampere). Die Strommenge, die durch den Sensor fließt, hängt von der Konzentration …

2
KNN-Parametereinstellung mit Kreuzvalidierung: Punkteziehung
Ich versuche, die KNN-Methode für die binäre Klassifizierung zu verwenden. Wenn ich versuche, den besten 'k'-Parameter zu finden (die Anzahl der Nachbarn, die der Algorithmus betrachtet), trainiere ich ein Modell in meinem Trainingssatz und überprüfe seine Genauigkeit in einem separaten Validierungssatz, den ich mit meinen Daten erhalten habe. Dieser Validierungssatz …

1
Ableiten der wichtigsten Merkmale
Gegeben eine Menge von Instanzen. Für jede Instanz habe ich einen Merkmalsvektor bestehend ausnnnmmm (numerische) Merkmale (x1x1x_1, x2x2x_2, ...,xmxmx_m), n >> m. Außerdem habe ich für jeden Fall eine numerische Punktzahlyyy(beobachtbar). Ich würde gerne: Finden Sie heraus, welche Teilmenge von Merkmalen oder eine lineare Kombination davon die Ergebnisse am besten …


1
Effizienter Schätzer aus unzureichender Statistik
Angenommen, ich habe eine Statistik und weiß mit Sicherheit, dass es nicht ausreicht, einen Parameter zu schätzen .T(X)T(X)T(X)θθ\theta Ist es immer noch möglich, einen Schätzer , der effizient ist (unter konvexem Verlust), oder gibt es einen Satz (so etwas wie ein umgekehrter Rao-Blackwell), der besagt, dass dies unmöglich ist?θ^(T(X))θ^(T(X))\hat\theta(T(X)) Sie …

2
Unkorrelation + Gelenknormalität = Unabhängigkeit. Warum? Intuition und Mechanik
Zwei Variablen, die nicht korreliert sind, sind nicht unbedingt unabhängig, wie einfach durch die Tatsache veranschaulicht wird, dass und nicht korreliert, aber nicht unabhängig sind. Es wird jedoch garantiert, dass zwei Variablen, die nicht korreliert UND gemeinsam normalverteilt sind, unabhängig sind. Kann jemand intuitiv erklären, warum dies wahr ist? Was …

3
Wie kann eine robuste Schrittfunktion an eine Zeitreihe angepasst werden?
Ich habe eine etwas laute Zeitreihe, die auf verschiedenen Ebenen schwebt. Zum Beispiel die folgenden Daten: Ich habe die durchgezogenen Liniendaten zur Verfügung und möchte eine Schätzung für die gestrichelte Linie erhalten. Es sollte stückweise konstant sein. Welche Algorithmen sollten Sie hier ausprobieren? Meine bisherigen Ideen drehen sich um 0-Grad-P-Splines …

1
Ermitteln der Verteilung des Stichprobenbereichs für eine Beta-Population
Lassen X1,X2,…,XnX1,X2,…,XnX_1,X_2,\ldots,X_n Zufällige Variablen mit Dichte sein f(x)=2(1−x)10&lt;x&lt;1f(x)=2(1−x)10&lt;x&lt;1f(x)=2(1-x)\mathbf1_{0<x<1} Ich versuche, die Verteilung des Stichprobenbereichs abzuleiten .R=X(n)−X(1)R=X(n)−X(1)R=X_{(n)}-X_{(1)} Die übliche Art, wie ich diese Probleme mache, besteht darin, zuerst die Verbindungsdichte von unter Verwendung von und dann die Verteilung von als Grenzdichte zu ermitteln. Dies ist im Allgemeinen recht einfach, da wir …

2
Ich habe meine lineare Regression reguliert, was nun?
Ich habe die Regressionsparameter eines linearen Regressionsmodells mit LASSO geschätzt, einige Variablen mithilfe der Kreuzvalidierung auf Null gesendet und jetzt ein endgültiges Modell erhalten. Es ist bekannt, dass das Regularisieren eine Verzerrung der aktiven Variablen hervorruft, aber es ist ein guter Preis, um falsche Variablen loszuwerden. Was mache ich jetzt, …

2
Ist es möglich, Vorhersagen zu kombinieren, um die Gesamtqualität der Vorhersagen zu verbessern?
Dies ist ein binäres Klassifizierungsproblem. Die Metrik, die minimiert wird, ist der Protokollverlust (oder die Kreuzentropie). Ich habe auch eine Genauigkeitsnummer, nur zu meiner Information. Es ist ein großer, sehr ausgewogener Datensatz. Sehr naive Vorhersagetechniken erzielen eine Genauigkeit von etwa 50% und einen logarithmischen Verlust von 0,693. Das Beste, was …

2
großer Unterschied zwischen den Schätzungen der binomialen Regression bei Einbeziehung des Zufallseffekts und der Nicht-Regression
Ich versuche, die durchschnittliche Punktzahl für zwei Gruppen von Studenten zu schätzen. Ich benutze ein binomiales Regressionsmodell. Dies total_ansist die Gesamtfrage, die sie beantwortet haben und die für verschiedene Schüler unterschiedlich sein kann. Modell 1 schätzt direkt model &lt;- glm(cbind(total_correct, total_ans-total_correct) ~ student_type,family= binomial, data = df) Call: glm(formula = …

1
Wie heißt diese Parameterschätzungsstrategie?
Sei eine Zufallsstichprobe aus einer Normalverteilung mit Mittelwert und Varianz . Betrachten Sie das Problem der Schätzung von .X1,X2,…,XnX1,X2,…,XnX_1, X_2, \ldots, X_nμμ\muσ2σ2\sigma^2P(X&gt;100)P(X&gt;100)P(X > 100) Eine Möglichkeit, dies zu erreichen, besteht darin, zu berechnen . Dieser "Plug-in" -Schätzer ist konsistent und seine Vorspannung und MSE sind einfach zu berechnen.n−1∑ni=11(Xi&gt;100)n−1∑i=1n1(Xi&gt;100)n^{-1}\sum_{i=1}^n \mathbb{1}(X_i > …

1
Multi-Agent-Schauspieler-Kritiker MADDPG-Algorithmus Verwirrung
Ich versuche, das Papier von openAI mit dem Titel Multi-Agent Actor-Critic für gemischte kooperativ-wettbewerbsorientierte Umgebungen zu verstehen In dem Papier erwähnen sie, dass sie das Problem der Nichtstationarität der Umwelt bekämpfen, indem sie Stichproben aus Teilrichtlinien ziehen: Ich bin verwirrt über: (1) wie Subsampling das Problem der Nichtstationarität lösen würde …

1
Die grundlegende Logik zum Erstellen eines Konfidenzintervalls
Betrachten Sie ein Modell mit einem interessierenden Parameter. θθ\thetaund sein Punktschätzer, θ^θ^\hat\theta. Nehmen Sie der Einfachheit halber an θ^∼N(θ,σ2/n)θ^∼N(θ,σ2/n)\hat\theta\sim N(\theta,\sigma^2/n)(In zahlreichen Fällen könnte dies asymptotisch gerechtfertigt sein). Es gibt zwei Möglichkeiten, ein Intervall zu erstellen, das so kurz wie möglich ist(1−α)(1−α)(1-\alpha) Level-Konfidenzintervall. Für jeden wahren Wert θθ\thetaIch möchte das kürzestmögliche …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.