Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Dynamische Empfehlungssysteme
Ein Empfehlungssystem würde die Korrelation zwischen Bewertungen verschiedener Benutzer messen und Empfehlungen für einen bestimmten Benutzer über die Elemente abgeben, die für ihn von Interesse sein könnten. Der Geschmack ändert sich jedoch mit der Zeit, sodass alte Bewertungen möglicherweise nicht die aktuellen Vorlieben widerspiegeln und umgekehrt. Vielleicht haben Sie einmal …



1
Warum sollten wir das Konvergenzverhalten verschiedener Schätzer in verschiedenen Topologien diskutieren?
Im ersten Kapitel des Buches Algebraische Geometrie und Statistische Lerntheorie, das sich mit der Konvergenz von Schätzungen in verschiedenen Funktionsräumen befasst, wird erwähnt, dass die Bayes'sche Schätzung der Schwartz-Verteilungstopologie entspricht, während die Maximum-Likelihood-Schätzung der Sup-Norm-Topologie entspricht (auf Seite 7): Zum Beispiel Sup-Norm, LpLpL^p -Norm, schwache Topologie des Hilbert-Raums , Schwartz-Verteilungstopologie …

3
Kann jemand bitte das dynamische Zeitverzerren erklären, um die Ähnlichkeit von Zeitreihen zu bestimmen?
Ich versuche, das dynamische Zeitverzerrungsmaß zu erfassen, um Zeitreihen miteinander zu vergleichen. Ich habe drei Zeitreihendatensätze wie diesen: T1 <- structure(c(0.000213652387565, 0.000535045478866, 0, 0, 0.000219346347883, 0.000359669104424, 0.000269469145783, 0.00016051364366, 0.000181950509461, 0.000385579332948, 0.00078170803205, 0.000747244535774, 0, 0.000622858922454, 0.000689084895259, 0.000487983408564, 0.000224744353298, 0.000416449765747, 0.000308388157895, 0.000198906016907, 0.000179549331179, 9.06289650172e-05, 0.000253506844685, 0.000582896161212, 0.000386473429952, 0.000179839942451, 0, 0.000275608635737, 0.000622665006227, 0.00036075036075, …

1
Eingeschränkte Optimierungsbibliothek für Gleichheits- und Ungleichheitsbeschränkungen
Gibt es Empfehlungen für die Auswahl einer eingeschränkten Optimierungsbibliothek, die für meine Optimierungsfunktion geeignet ist? Ich minimiere ai) nichtlineare Funktion mit linearen Gleichungs- und Ungleichungsbeschränkungen, und ii) habe den Gradienten und den Hessischen Wert der Funktion zur Verfügung. Wenn es hilft, ist die Funktion, die ich minimiere, die Kullback-Liebler-Divergenz . …

1
Momentgebundene Funktion
Diese Frage ergibt sich aus der hier gestellten Frage nach gebundenen Momenterzeugungsfunktionen (MGFs). Angenommen, ist eine begrenzte Zufallsvariable mit dem Mittelwert Null, die Werte in annimmt und es sei sein MGF. Aus einer Schranke, die in einem Beweis von Höffdings Ungleichung verwendet wird , haben wir wobei die rechte Seite …


4
"Moderation" versus "Interaktion"?
Ich bin auf diese beiden Begriffe gestoßen, die in vielen Zusammenhängen synonym verwendet werden. Grundsätzlich ist ein Moderator (M) ein Faktor, der sich auf die Beziehung zwischen X und Y auswirkt. Die Moderationsanalyse wird normalerweise mithilfe eines Regressionsmodells durchgeführt. Zum Beispiel kann das Geschlecht (M) die Beziehung zwischen "Produktforschung" (X) …

2
In welcher Beziehung steht ARMA / ARIMA zur Modellierung gemischter Effekte?
Bei der Paneldatenanalyse habe ich mehrstufige Modelle mit zufälligen / gemischten Effekten verwendet, um mit Autokorrelationsproblemen umzugehen (dh Beobachtungen werden im Laufe der Zeit in Gruppen zusammengefasst), wobei andere Parameter hinzugefügt wurden, um bestimmte Zeitangaben und Schocks von Interesse zu berücksichtigen . ARMA / ARIMA scheint darauf ausgelegt zu sein, …

3
Was bedeutet abgeschnittene Verteilung?
In einem Forschungsartikel über die Sensitivitätsanalyse eines gewöhnlichen Differentialgleichungsmodells eines dynamischen Systems hat der Autor die Verteilung eines Modellparameters als Normalverteilung (Mittelwert = 1e-4, Standard = 3e-5) angegeben, die auf den Bereich [0,5e abgeschnitten ist -4 1,5e-4]. Anschließend verwendet er Stichproben aus dieser abgeschnittenen Verteilung für Simulationen des Modells. Was …


1
Unterschreitet die Maximierung der Genauigkeit bei über- / unterabgetasteten unsymmetrischen Klassen die Minimierung der Fehlklassifizierungskosten?
Zunächst möchte ich einige gängige Layouts beschreiben, die in Data Mining-Büchern verwendet werden, um den Umgang mit unsymmetrischen Datasets zu erläutern . Normalerweise heißt der Hauptabschnitt Unbalanced Datasets und deckt diese beiden Unterabschnitte ab: Cost-Sensitive Classification und Sampling Techniques. Es scheint, dass Sie bei einem Problem mit einer seltenen Klasse …



Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.