Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Ist es notwendig, Zeitreihendaten bei Verwendung von Methoden des maschinellen Lernens zu verschlechtern und zu dezyklisieren?
Zum Beispiel: Ich möchte zukünftige Werte einer Zeitreihe basierend auf früheren Werten mehrerer Zeitreihen unter Verwendung einer ANN und / oder SVM vorhersagen. Eingaben sind verzögerte Werte aus jeder Zeitreihe, und die Ausgaben sind Prognosen mit einem Schritt voraus (Prognosen mit weiteren Horizonten werden erstellt, indem die Vorhersagen unter Verwendung …

4
Mittlerer quadratischer Fehler oder mittlerer quadratischer Fehler
Als nicht-englischer Muttersprachler habe ich mich gefragt, welchen quadratischen oder quadratischen Ausdruck ich verwenden soll. Zum Beispiel im mittleren quadratischen Fehler oder im mittleren quadratischen Fehler. Laut Internet scheinen beide Formen undeutlich verwendet zu werden. Ist ein Ausdruck quadratischer als der andere?

1
Techniken zum inkrementellen Online-Lernen von Klassifikatoren für Stream-Daten
Welche Techniken könnten gut sein, um diesem abstrakten Problem zu begegnen? Sie haben einen Datenstrom eines kontinuierlichen Signals als einen von einem physischen Sensor. Dieses Signal hat reale (diskretisierte) Werte, kein Attribut; Suchtmerkmale (z. B. Leistung, Autokorrelation, Entropie) können extrahiert werden. Sie können einem Fenster des Signals eine Bezeichnung aus …

1
Wie funktioniert die Imputationsfunktion der Mäuse?
Ich habe mich gefragt, ob jemand Erfahrung mit der Mäusefunktion hat, wie in Mäusen beschrieben: Multivariate Imputation durch verkettete Gleichungen in R (JSS 2011 45 (3))? Ich habe einen Datensatz mit einer Reihe von Variablen, von denen jede einen unterschiedlichen Grad an fehlenden Daten aufweist. Meine Hauptfrage lautet: Angenommen, ich …

2
Akzeptanzverhältnis im Metropolis-Hastings-Algorithmus
Im Metropolis-Hastings-Algorithmus zum Abtasten einer Zielverteilung gilt Folgendes: iπiπi\pi_{i} sei die Zieldichte im Zustand ,iii jπjπj\pi_j ist die im vorgeschlagenen Zustand ,jjj j ihijhijh_{ij} ist die Vorschlagsdichte für den Übergang in den Zustand gegebenem aktuellen Zustand ,jjjiii j iaijaija_{ij} ist die Akzeptanzwahrscheinlichkeit des vorgeschlagenen Zustands bei aktuellem Zustand .jjjiii Dann …


4
Beste Methode zur Umwandlung einer Sequenz mit geringer Diskrepanz in eine Normalverteilung?
Ich verwende seit einiger Zeit Sequenzen mit geringer Diskrepanz für Gleichverteilungen, da ich ihre Eigenschaften als nützlich empfunden habe (hauptsächlich in Computergrafiken wegen ihres zufälligen Erscheinungsbilds und ihrer Fähigkeit, [0,1] inkrementell dicht zu bedecken). Zum Beispiel zufällige Werte oben, Halton-Sequenzwerte unten: Ich habe überlegt, sie für eine Finanzanalyseplanung zu verwenden, …


5
ANCOVA in R schlägt unterschiedliche Abschnitte vor, aber die 95% CIs überlappen sich… wie ist das möglich?
Wir haben einen Datensatz mit zwei Kovariaten und einer kategorialen Gruppierungsvariablen und möchten wissen, ob es signifikante Unterschiede zwischen der Steigung oder dem Achsenabschnitt zwischen den Kovariaten gibt, die den verschiedenen Gruppierungsvariablen zugeordnet sind. Wir haben anova () und lm () verwendet, um die Anpassungen von drei verschiedenen Modellen zu …

2
Funktionieren Sequenzen mit geringer Diskrepanz in diskreten Räumen?
Sequenzen mit geringer Diskrepanz in einem realen Raum ( ) scheinen ein wirklich hervorragendes Werkzeug zu sein, um einen Probenraum gleichmäßig abzutasten. Soweit ich das beurteilen kann, lassen sie sich gut auf jeden realen Raum verallgemeinern, wenn Sie eine geeignete Karte verwenden (z. B. lineare Karte). [ 0 , 1 …
9 sampling 


3
Wie werden Hauptkomponenten als Prädiktoren in GLM verwendet?
Wie würde ich die Ausgabe einer Hauptkomponentenanalyse (PCA) in einem verallgemeinerten linearen Modell (GLM) verwenden, vorausgesetzt, die PCA wird für die Variablenauswahl für das GLM verwendet? Erläuterung: Ich möchte PCA verwenden, um die Verwendung korrelierter Variablen im GLM zu vermeiden. PCA gibt mir jedoch Ausgaben wie .2*variable1+.5*variable3usw. Ich bin es …




Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.