Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


1
Ist in einer zufälligen Gesamtstruktur% IncMSE größer besser oder schlechter?
Nachdem ich in R ein (Regressions-) Zufallsgesamtstrukturmodell erstellt habe, rf$importancewerden mir durch den Aufruf zwei Kennzahlen für jede Prädiktorvariable %IncMSEund angezeigt IncNodePurity. Ist die Interpretation, dass Prädiktorvariablen mit kleineren %IncMSEWerten vorliegen, wichtiger als Prädiktorvariablen mit größeren %IncMSEWerten? Wie wäre es mit für IncNodePurity?

2
Warum genau werden die beobachteten Fisher-Informationen verwendet?
In der Standard - Maximalwahrscheinlichkeitseinstellung (iid Stichprobe aus einer Verteilung mit der Dichte f y ( y | θ 0Y1,…,YnY1,…,YnY_{1}, \ldots, Y_{n}fy(y|θ0fy(y|θ0f_{y}(y|\theta_{0} )) und im Fall eines korrekt spezifizierten Modells wird die Fisher-Information durch gegeben I(θ)=−Eθ0[∂2θ2lnfy(θ)]I(θ)=−Eθ0[∂2θ2ln⁡fy(θ)]I(\theta) = -\mathbb{E}_{\theta_{0}}\left[\frac{\partial^{2}}{\theta^{2}}\ln f_{y}(\theta) \right] wobei die Erwartung in Bezug auf die wahre Dichte genommen …


1
Meldevarianz der wiederholten k-fachen Kreuzvalidierung
Ich habe eine wiederholte k-fache Kreuzvalidierung verwendet und den Mittelwert (der Bewertungsmetrik, z. B. Sensitivität, Spezifität) angegeben, der als Gesamtmittelwert über die Falten verschiedener Läufe der Kreuzvalidierung berechnet wurde. Ich bin mir jedoch nicht sicher, wie ich die Varianz melden soll. Ich habe hier viele Fragen zur wiederholten Kreuzvalidierung gefunden, …



2
Wie ist der Matthews-Korrelationskoeffizient (MCC) zu interpretieren?
Die Antwort auf die Frage Beziehung zwischen den Korrelationskoeffizienten phi, Matthews und Pearson? zeigt, dass die drei Koeffizientenmethoden alle äquivalent sind. Ich komme nicht aus der Statistik, also sollte es eine leichte Frage sein. Das Matthews-Papier (www.sciencedirect.com/science/article/pii/0005279575901099) beschreibt Folgendes: "A correlation of: C = 1 indicates perfect agreement, C = …

1
Was ist das richtige Assoziationsmaß einer Variablen mit einer PCA-Komponente (auf einem Biplot / Ladeplot)?
Ich benutze FactoMineR, um meinen Messdatensatz auf die latenten Variablen zu reduzieren. Die variable Karte oben ist für mich klar zu interpretieren, aber ich bin verwirrt , wenn es um den Zusammenhang zwischen den Variablen und Komponente 1. Mit Blick auf der variablen Karte kommt, ddpund covist sehr nah an …

1
Was ist falsch an dieser Illustration der posterioren Verteilung?
Das folgende Bild zeigt, wie die hintere Wahrscheinlichkeitsverteilung eine Kombination aus der vorherigen und der Wahrscheinlichkeitsverteilung ist. Mir wurde gesagt, dass mit dem Bild etwas nicht stimmt, nämlich dass die posteriore Verteilung aufgrund der Wahrscheinlichkeitsfunktion nicht die Form haben kann, die sie hat. Aber ich habe Mühe darüber nachzudenken, was …

2
Wie führe ich eine ordinale logistische Regressionsanalyse in R mit beiden numerischen / kategorialen Werten durch?
Basisdaten : Ich habe ~ 1.000 Personen, die mit Bewertungen gekennzeichnet sind: "1", "[gut]" 2 "," [mittel] oder "3" [schlecht] - dies sind die Werte, die ich für die Zukunft der Menschen vorhersagen möchte . Zusätzlich habe ich einige demografische Informationen: Geschlecht (kategorial: M / W), Alter (numerisch: 17-80) und …

4
Was sind die Unterschiede zwischen den Begriffen "Zeitreihenanalyse" und "Längsschnittdatenanalyse"?
Wenn es um longitudinale Daten geht, können wir uns wiederholt auf Daten beziehen, die im Laufe der Zeit von demselben Subjekt / derselben Lerneinheit gesammelt wurden, so dass es Korrelationen für die Beobachtungen innerhalb desselben Subjekts gibt, dh Ähnlichkeit innerhalb des Subjekts. Wenn wir über Zeitreihendaten sprechen, beziehen wir uns …

2
Polynomkontraste für die Regression
Ich kann die Verwendung von Polynomkontrasten bei der Regressionsanpassung nicht verstehen. Insbesondere beziehe ich mich auf eine Codierung, die verwendet wird R, um eine Intervallvariable (Ordinalvariable mit gleichmäßig verteilten Pegeln) auszudrücken, die auf dieser Seite beschrieben wird . Wenn ich im Beispiel dieser Seite richtig verstanden habe, passt R ein …

3
Warum brauchen wir Autoencoder?
Vor kurzem habe ich Autoencoder studiert. Wenn ich richtig verstanden habe, ist ein Autoencoder ein neuronales Netzwerk, bei dem die Eingangsschicht mit der Ausgangsschicht identisch ist. Das neuronale Netzwerk versucht also, die Ausgabe unter Verwendung der Eingabe als goldenen Standard vorherzusagen. Was ist der Nutzen dieses Modells? Was sind die …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.