Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Wann entspricht die LSQ-Linie (Least Square Regression) der LAD-Linie (Least Absolute Deviation)?
Ich habe die folgende Frage zur Hand. Angenommen, repräsentieren eine Reihe von bi-variablen Beobachtungen auf so dassUnter welchen Bedingungen ist die Regressionslinie für das kleinste Quadrat von auf identisch mit der Linie für die geringste absolute Abweichung?(x1,y1) , (x2,y2) , ⋯ , (x10,y10)(x1,y1),(x2,y2),⋯,(x10,y10)(x_1,y_1),(x_2,y_2),\cdots,(x_{10},y_{10})( X., Y.)(X.,Y.)(X,Y)x2=x3= ⋯ =x10≠x1.x2=x3=⋯=x10≠x1.x_2=x_3=\cdots =x_{10}\ne x_1.Y.Y.YX.X.X Ich …

2
Die Score-Funktion von Fisher hat den Mittelwert Null - was bedeutet das überhaupt?
Ich versuche, der prinzipiellen Überprüfung der Wahrscheinlichkeitstheorie zu folgen . Sie definieren Fisher’s score functionals Die erste Ableitung der Log-Likelihood-Funktion und sie sagen, dass die Punktzahl ein Zufallsvektor ist. ZB für die geometrische Verteilung: u(π) = n(1π- -y¯1 - π)u(π)=n(1π- -y¯1- -π) u(\pi) = n\left(\frac{1}{\pi} - \frac{\bar{y}}{1-\pi} \right) Und ich …

2
Multivariates Zeitreihen-Clustering
Ich sammle eine Gruppe multivariater Zeitsequenzen. Zum Beispiel gibt es 2000 Zeitreihen. Jede Zeitreihe hat 12 Dimensionen. Gibt es systematische Modelle / Algorithmen, die multivariate Zeitreihen gruppieren können? Zum Beispiel möchte ich einige Zeitreihen identifizieren, die sich stark von anderen unterscheiden. Darüber hinaus kann ich für die Online-Überwachung diesen Algorithmus …

2
Was ist die richtige Analyse für diese Art von Frage? (Bedingte logistische Regression?)
Was ist angesichts des folgenden Experiments die richtige statistische Methode, um die folgende Frage zu beantworten: Eine Teilnehmerin erhält nacheinander Bilder und muss nach jedem Bild antworten, ob sie ein Objekt oder ein Gesicht gesehen hat. In jedem Versuch (Bildpräsentation) wird das präsentierte Bild (entweder 1 von 210 einzelnen Gesichtern …


2
Poisson xgboost mit Exposition
Ich habe versucht, eine zählabhängige Variable mit ungleichmäßiger Belichtung zu modellieren. Klassische glms würden log (Belichtung) als Offset verwenden, auch gbm, aber xgboost erlaubt bis jetzt keinen Offset ... Der Versuch, einen Nachteil in diesem Beispiel in crossvalidated ( Wohin geht der Offset in Poisson / negative binomiale Regression? ) …

1
Intuition zur t-SNE-Visualisierungstechnik
Ich erzeugte eine t-SNE-Visualisierung eines Datensatzes (ungefähr 10 standardisierte (Mittelwert = 0, sd = 1) numerische Merkmale) und kam zu einem folgenden zweidimensionalen Diagramm. Ich habe keine gute Vorstellung davon, warum die Punkte in bogenförmigen Gruppen ausgerichtet sind, siehe zum Beispiel den rechten unteren Teil des beigefügten Bildes (oder den …





1
Gibt es einen aussagekräftigen Ansatz für die Durchführung einer Netzwerk-Metaanalyse diagnostischer Testgenauigkeitsstudien?
Hintergrund: Ich arbeite an einer systematischen Überprüfung, die mehrere Bildgebungsmodalitäten für Erkrankungen der Herzkranzgefäße umfasst, aber das Evidenznetzwerk ist ziemlich groß, einschließlich verschiedener Modalitäten, die häufig in einem umfangreichen Netzwerk miteinander verglichen werden. Die Netzwerk-Metaanalyse ist ein etablierter Ansatz für randomisierte kontrollierte Studien. In WinBUGS, Stata, R und SAS stehen …

1
Bootstrapping einer Stichprobe aus einer endlichen Population
Kann mich jemand auf eine theoretische Referenz zum Bootstrapping einer Stichprobe verweisen, die einer Population bekannter Größe entnommen wurde? Ich bin es gewohnt, Bootstrap zu verwenden, um Konfidenzintervalle einer Stichprobe zu berechnen, wenn die Populationsgröße als viel größer als die Stichprobe angesehen wird (daher sollte eine zufällige Auswahl mit Wiederholung …


2
k-means ++ Algorithmus und Ausreißer
Es ist bekannt, dass der k-means-Algorithmus bei Ausreißern leidet. k-means ++ ist eine effektive Methode zur Initalisierung von Clusterzentren. Ich habe die PPT von den Gründern der Methode, Sergei Vassilvitskii und David Arthur http://theory.stanford.edu/~sergei/slides/BATS-Means.pdf (Folie 28) , durchlaufen, was zeigt, dass die Cluster-Center-Initialisierung ist nicht vom Ausreißer betroffen, wie unten …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.