Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Was ist der Unterschied zwischen den verschiedenen Arten von Residuen in der Überlebensanalyse (Cox-Regression)?
Ich bin ziemlich neu in der Überlebensanalyse. Mir wurde geraten, im Rahmen einer Modelldiagnose nach Schönfeld-Residuen zu suchen, um festzustellen, ob die Proportional-Hazard-Annahme erfüllt ist. Beim Nachschlagen habe ich Hinweise auf viele verschiedene Arten von Residuen gesehen, darunter: Cox-Snell Abweichung Martingal Ergebnis Schönfeld Was sind die Unterschiede zwischen diesen Residuen …

1
Protokollwahrscheinlichkeiten in Bezug auf den Softmax-Klassifikator
In diesem https://cs231n.github.io/neural-networks-case-study/ wird erwähnt, warum "der Softmax-Klassifizierer jedes Element von ff so interpretiert, dass es die (nicht normalisierten) Protokollwahrscheinlichkeiten der drei Klassen enthält". Ich verstehe, warum es nicht normalisiert ist, aber nicht, warum es protokolliert wird. Was bedeutet eine Log-Wahrscheinlichkeit? Warum nicht einfach nicht normalisierte Wahrscheinlichkeiten sagen?

1
Wie man beweist, ob der Mittelwert einer Wahrscheinlichkeitsdichtefunktion existiert
Es ist bekannt, dass bei einer reellen Zufallsvariablen mit pdf der Mittelwert von (falls vorhanden) durch XXXfffXXXE[X]=∫Rxf(x)dx.E[X]=∫Rxf(x)dx.\begin{equation} \mathbb{E}[X]=\int_{\mathbb{R}}x\,f(x)\,\mathrm{d}x\,. \end{equation} Allgemeine Frage: Wenn man das obige Integral nicht in geschlossener Form lösen kann, sondern einfach feststellen möchte, ob der Mittelwert existiert und endlich ist, gibt es eine Möglichkeit, dies zu beweisen? …

1
Haben die Determinanten von Kovarianz- und Korrelationsmatrizen und / oder ihre Umkehrungen nützliche Interpretationen?
Als ich vor einigen Jahren lernte, Kovarianz- und Korrelationsmatrizen und ihre Inversen in VB und T-SQL zu berechnen, stellte ich fest, dass die verschiedenen Einträge interessante Eigenschaften haben, die sie in den richtigen Data Mining-Szenarien nützlich machen können. Ein offensichtliches Beispiel ist das Vorhandensein von Varianzen auf den Diagonalen von …

4
Kann eine baumbasierte Regression schlechter abschneiden als eine einfache lineare Regression?
Hallo, ich studiere Regressionstechniken. Meine Daten haben 15 Funktionen und 60 Millionen Beispiele (Regressionsaufgabe). Als ich viele bekannte Regressionstechniken ausprobierte (gradientenverstärkter Baum, Entscheidungsbaumregression, AdaBoostRegressor usw.), lief die lineare Regression hervorragend. Unter diesen Algorithmen fast am besten bewertet. Was kann der Grund dafür sein? Da meine Daten so viele Beispiele enthalten, …

1
Was ist eine dichte Vorhersage beim Deep Learning?
Ich verwende TensorFlows vorab trainiertes Modell des Convolutional Neural Network. https://github.com/tensorflow/models/blob/master/slim/nets/resnet_v2.py#L130 Ich habe folgenden Satz gefunden: Für dichte Vorhersageaufgaben empfehlen wir jedoch, Eingaben mit räumlichen Dimensionen zu verwenden, die ein Vielfaches von 32 plus 1 sind, z. B. [321, 321]. Weiß jemand, was dichte Vorhersage in dieser Literatur ist?



2
Optimieren Sie SVM, um falsch negative Ergebnisse bei der binären Klassifizierung zu vermeiden
Ich trainiere einen binären SVM-Klassifikator mit Scikit Learn. Aufgrund der Art meines Problems muss ich falsche Negative vermeiden. Da nichts umsonst ist, kann ich eine höhere Rate an falsch positiven Ergebnissen erzielen, um die Anzahl der falsch negativen Ergebnisse zu verringern. Wie können wir das machen (idealerweise mit Scikit lernen)? …



1
Techniken zur Erkennung von Überanpassungen
Ich hatte ein Vorstellungsgespräch für eine Stelle in Data Science. Während des Interviews wurde ich gefragt, was ich tun soll, um sicherzustellen, dass das Modell nicht überpasst. Meine erste Antwort war die Verwendung einer Kreuzvalidierung, um die Leistung des Modells zu bewerten. Der Interviewer sagte jedoch, dass selbst eine Kreuzvalidierung …

2
Ist der Zufallszustand ein zu stimmender Parameter?
Ein Problem, das in meinen Experimenten häufig auftritt, ist die unterschiedliche Leistung des Modells, wenn der Zufallsstatus für den Algorithmus geändert wird. Die Frage ist also einfach: Soll ich den Zufallszustand als Hyperparameter verwenden? Warum ist das so? Wenn mein Modell andere Modelle mit unterschiedlichen Zufallszuständen übertrifft, sollte ich das …

1
Moment / mgf Kosinus der Richtungsvektoren?
Kann jemand vorschlagen, wie ich das zweite Moment (oder die gesamte Momenterzeugungsfunktion) des Kosinus von zwei Gaußschen Zufallsvektoren berechnen kann, die jeweils als unabhängig voneinander verteilt sind? IE, Moment für die folgende Zufallsvariablex,yx,yx,yN(0,Σ)N(0,Σ)\mathcal N (0,\Sigma) ⟨x,y⟩∥x∥∥y∥⟨x,y⟩‖x‖‖y‖\frac{\langle x, y\rangle}{\|x\|\|y\|} Die nächste Frage ist die Momenterzeugungsfunktion des inneren Produkts zweier Gaußscher Zufallsvektoren, …

2
Trainingsdaten sind unausgewogen - aber sollte mein Validierungssatz auch sein?
Ich habe Daten beschriftet, die aus 10000 positiven und 50000 negativen Beispielen bestehen, was insgesamt 60000 Beispiele ergibt. Offensichtlich sind diese Daten unausgewogen. Nehmen wir nun an, ich möchte meinen Validierungssatz erstellen und dazu 10% meiner Daten verwenden. Meine Frage lautet wie folgt: Sollte ich sicherstellen, dass mein Validierungssatz AUCH …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.