Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


2
Was ist eine stationäre Zeitreihe? Was sind einige Beispiele?
In meiner ökonometrischen Klasse definierte mein Lehrer eine stationäre Zeitreihe folgendermaßen: "Eine Zeitreihe ist lose gesagt stationär, wenn sich ihre stochasitischen Eigenschaften und ihre zeitliche Abhängigkeitsstruktur im Laufe der Zeit nicht ändern." Ich bin verwirrt, was einige Beispiele wären. Wäre die Temperatur im Laufe der Jahre stationär, vorausgesetzt, es gibt …



2
Funktioniert die Varianz nur bei normalverteilten Daten (als Maß für die Streuung)?
Es heißt in Wikipedia Die Rolle der Normalverteilung im zentralen Grenzwertsatz ist teilweise für die Prävalenz der Varianz in Wahrscheinlichkeit und Statistik verantwortlich. Ich verstehe dies als Wenn wir Varianz / SD als Maß für die Streuung verwenden, suchen wir tatsächlich nach dem "Skalierungsparameter" einer Normalverteilung, da eine zufällige Zufallsvariable …

2
Zweck der L2-Normalisierung für das Triplett-Netzwerk
Triplett-basiertes Fernstudium zur Gesichtserkennung scheint sehr effektiv zu sein. Ich bin neugierig auf einen bestimmten Aspekt des Papiers. Um eine Einbettung für ein Gesicht zu finden, normalisieren die Autoren die verborgenen Einheiten mithilfe der L2-Normalisierung, wodurch die Darstellung auf einer Hypersphäre eingeschränkt wird. Warum ist das hilfreich oder notwendig?

1
Optimierung durch Stichproben
Im Internet habe ich vereinzelte Hinweise auf die Idee gesehen, eine Zielfunktion neu zu skalieren und diese als PDF zum Zwecke der Optimierung zu verwenden. (Auf dieser Website zum Beispiel: Werden Optimierungstechniken Stichprobenverfahren zugeordnet? ) Kann mich jemand auf einen Ort verweisen, an dem ich mehr über diese Methode erfahren …

1
Reduzierung der nichtlinearen Dimensionalität: geometrische / topologische Algorithmen im Vergleich zu Autoencodern
Soweit ich weiß, gibt es drei Hauptansätze zur Reduzierung der nichtlinearen Dimensionalität: Vielfältiges Lernen (geometrische / topologische Algorithmen wie ISOMAP, LLE, LTSA) Autoencoder Dinge, die nicht in die ersten beiden Kategorien passen (wahrscheinlichkeitsinspiriertes t-SNE, Kernel-PCA usw.) Was sind die Vor- und Nachteile der ersten beiden Ansätze? Kann man denken, dass …


1
"Glätte" einer Statistik für Bootstrapping?
Ich habe mich gefragt, ob jemand erklären kann, was damit gemeint ist, dass eine Statistik nicht „glatt“ ist. Zum Beispiel in 2.6.2 p. 41 von Davison und Hinkley sprechen sie über Statistiken, die "auf ungleichmäßige oder instabile Weise von der Stichprobe abhängen, so dass die Standarderweiterungstheorie nicht anwendbar ist". Es …
7 bootstrap 



3
Welche Rolle spielt Feature Engineering bei der statistischen Inferenz?
Dies kann eine dumme Frage sein. Ich bin ein frischgebackener Hochschulabsolvent, der im Bereich der prädiktiven Modellierung arbeitet und feststellt, dass die Durchführung von Feature-Engineering einen hohen Stellenwert hat. In den meisten meiner akademischen Ausbildungen in Statistik wurde Feature Engineering und dergleichen (abgesehen von Argumenten gegen das Diskretisieren / Binning …

1
Mathematische Begründung für die Verwendung wiederkehrender neuronaler Netze über Feed-Forward-Netze
Ich habe mich gefragt und versucht zu verstehen, ob es einen mathematischen Grund für die Überlegenheit von RNNs gegenüber Feed-Forward-Netzwerken beim Umgang mit sequentiellen Daten gibt. Zum Beispiel beim Modellieren von Zeitreihen, HMMs usw. Angenommen, die Länge der Sequenz ist fest, aber sehr groß. Intuitiv ist klar, dass RNNs die …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.