Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Haben negative Wahrscheinlichkeiten / Wahrscheinlichkeitsamplituden Anwendungen außerhalb der Quantenmechanik?
Die Quantenmechanik hat die Wahrscheinlichkeitstheorie auf negative / imaginäre Zahlen verallgemeinert, hauptsächlich, um Interferenzmuster, Wellen / Teilchen-Dualität und im Allgemeinen seltsame Dinge wie diese zu erklären. Es kann jedoch abstrakter gesehen werden als eine nichtkommutative Verallgemeinerung der Bayes'schen Wahrscheinlichkeit (Zitat von Terrence Tao). Ich bin neugierig auf diese Dinge, aber …

9
Software-Tools für Statistik und Data Mining für den Umgang mit großen Datenmengen
Derzeit muss ich ungefähr 20 Millionen Datensätze analysieren und Vorhersagemodelle erstellen. Bisher habe ich Statistica, SPSS, RapidMiner und R ausprobiert. Unter diesen scheint Statistica am besten für das Data Mining geeignet zu sein, und die RapidMiner-Benutzeroberfläche ist ebenfalls sehr praktisch, aber es scheint, dass Statistica, RapidMiner und SPSS nur für …

2
Geht die Korrelation von einer Stationarität der Daten aus?
Die Inter-Market-Analyse ist eine Methode zur Modellierung des Marktverhaltens durch Auffinden von Beziehungen zwischen verschiedenen Märkten. Häufig wird eine Korrelation zwischen zwei Märkten berechnet, z. B. S & P 500 und 30-jährigen US-Treasuries. Diese Berechnungen basieren zumeist auf Preisdaten, was für jedermann offensichtlich ist, dass sie nicht zur Definition von …


5
Kann man aus statistischer Sicht mit einer Beobachtungsstudie auf die Kausalität schließen, indem man die Neigungsbewertungen verwendet?
Frage: Kann man aus der Sicht eines Statistikers (oder eines Praktikers) die Kausalität mit Hilfe von Neigungsbewertungen anhand einer Beobachtungsstudie ( kein Experiment ) ableiten ? Bitte, wollen Sie keinen Flammenkrieg oder eine fanatische Debatte beginnen. Hintergrund: In unserem stat-Promotionsprogramm haben wir nur durch Arbeitsgruppen und einige Themensitzungen auf kausale …



4
Wie ist es möglich, dass der Validierungsverlust zunimmt und gleichzeitig die Validierungsgenauigkeit zunimmt?
Ich trainiere ein einfaches neuronales Netzwerk mit dem CIFAR10-Datensatz. Nach einiger Zeit begann der Validierungsverlust zuzunehmen, während die Validierungsgenauigkeit ebenfalls zunahm. Der Testverlust und die Testgenauigkeit verbessern sich weiter. Wie ist das möglich? Es scheint, dass die Genauigkeit sinken sollte, wenn der Validierungsverlust zunimmt. PS: Es gibt mehrere ähnliche Fragen, …




6
Warum führen kleinere Gewichte zu einfacheren Regularisierungsmodellen?
Ich habe Andrew Ngs Maschinelles Lernen-Kurs vor ungefähr einem Jahr abgeschlossen und schreibe jetzt meine High-School-Mathematikerkunde über die Funktionsweise der logistischen Regression und Techniken zur Leistungsoptimierung. Eine dieser Techniken ist natürlich die Regularisierung. Ziel der Regularisierung ist es, eine Überanpassung zu verhindern, indem die Kostenfunktion um das Ziel der Modellvereinfachung …

1
predict () -Funktion für ältere Mixed-Effects-Modelle
Das Problem: Ich habe in anderen Posts gelesen , predictdie für lmerModelle mit gemischten Effekten {lme4} in [R] nicht verfügbar sind . Ich habe versucht, dieses Thema mit einem Spielzeugdatensatz zu untersuchen ... Hintergrund: Der Datensatz ist aus dieser Quelle angepasst und als ... require(gsheet) data <- read.csv(text = gsheet2text('https://docs.google.com/spreadsheets/d/1QgtDcGJebyfW7TJsB8n6rAmsyAnlz1xkT3RuPFICTdk/edit?usp=sharing', …

4
Ensemble verschiedener Arten von Regressoren, die Scikit-Learn (oder ein anderes Python-Framework) verwenden
Ich versuche die Regressionsaufgabe zu lösen. Ich habe herausgefunden, dass 3 Modelle für verschiedene Teilmengen von Daten gut funktionieren: LassoLARS, SVR und Gradient Tree Boosting. Mir ist aufgefallen, dass ich, wenn ich mit all diesen drei Modellen Vorhersagen mache und dann eine Tabelle mit den tatsächlichen Ergebnissen meiner drei Modelle …

2
Wie werden beim Clustering sowohl binäre als auch kontinuierliche Variablen zusammen verwendet?
Ich muss in k-means binäre Variablen (Werte 0 & 1) verwenden. K-means arbeitet aber nur mit stetigen Variablen. Ich weiß, dass einige Leute diese binären Variablen immer noch in k-means verwenden, ohne die Tatsache zu ignorieren, dass k-means nur für kontinuierliche Variablen ausgelegt ist. Das ist für mich inakzeptabel. Fragen: …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.