Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

5
Kernel SVM: Ich möchte ein intuitives Verständnis der Abbildung auf einen höherdimensionalen Merkmalsraum und wie dies eine lineare Trennung ermöglicht
Ich versuche die Intuition hinter den SVMs des Kernels zu verstehen. Jetzt verstehe ich, wie linear SVM funktioniert, wobei eine Entscheidungslinie erstellt wird, die die Daten so gut wie möglich aufteilt. Ich verstehe auch das Prinzip der Portierung von Daten in einen höherdimensionalen Raum und wie dies das Finden einer …

2
Sampling aus der von Mises-Fisher-Distribution in Python?
Ich suche nach einer einfachen Möglichkeit, eine multivariate von Mises-Fisher-Distribution in Python abzutasten. Ich habe im Statistikmodul in Scipy und im Numpy-Modul nachgesehen, aber nur die univariate von Mises-Verteilung gefunden. Gibt es einen Code zur Verfügung? Habe ich noch nicht gefunden. Anscheinend hat Wood (1994) einen Algorithmus zum Abtasten von …

2
Daten transformieren: Alle Variablen oder nur die nicht normalen?
In Andy Fields Discovering Statistics Using SPSS gibt er an, dass alle Variablen transformiert werden müssen. In der Veröffentlichung: "Untersuchung räumlich unterschiedlicher Zusammenhänge zwischen Landnutzung und Wasserqualität mittels geografisch gewichteter Regression I: Modelldesign und Bewertung" heißt es jedoch ausdrücklich, dass nur die nicht normalen Variablen transformiert wurden. Ist diese Analyse …

3
Wie kann ich programmgesteuert Segmente einer Datenreihe erkennen, um sie an verschiedene Kurven anzupassen?
Gibt es dokumentierte Algorithmen, um Abschnitte eines bestimmten Datensatzes in verschiedene Kurven mit der besten Anpassung zu unterteilen? Zum Beispiel würden die meisten Menschen, die diese Datentabelle betrachten, sie leicht in drei Teile aufteilen: ein sinusförmiges Segment, ein lineares Segment und das inverse exponentielle Segment. Tatsächlich habe ich dieses mit …

1
Ich habe eine Linie, die am besten passt. Ich benötige Datenpunkte, die meine Best-Fit-Linie nicht ändern
Ich halte einen Vortrag über das Anpassen von Linien. Ich habe eine einfache lineare Funktion, y=1x+by=1x+by=1x+b . Ich versuche, verstreute Datenpunkte zu erhalten, die ich in ein Streudiagramm einfügen kann, damit meine Best-Fit-Linie der gleichen Gleichung entspricht. Ich würde diese Technik gerne in R oder Excel lernen - je nachdem, …

3
Annahmen zur Ableitung des OLS-Schätzers
Kann mir jemand kurz erklären, warum jede der sechs Annahmen benötigt wird, um den OLS-Schätzer zu berechnen? Ich habe nur über Multikollinearität herausgefunden - wenn es existiert, können wir die (X'X) -Matrix nicht invertieren und wiederum den Gesamtschätzer schätzen. Was ist mit den anderen (z. B. Linearität, mittlere Nullfehler usw.)?

3
Scharnierverlust im Vergleich zu Logistikverlust - Vor- und Nachteilen / Einschränkungen
Der Scharnierverlust kann mit und der logarithmische Verlust mit log ( 1 + exp ( - y i w T x i ) ) definiert werden.max(0,1−yiwTxi)max(0,1−yiwTxi)\text{max}(0, 1-y_i\mathbf{w}^T\mathbf{x}_i)log(1+exp(−yiwTxi))log(1+exp⁡(−yiwTxi))\text{log}(1 + \exp(-y_i\mathbf{w}^T\mathbf{x}_i)) Ich habe folgende Fragen: Gibt es Nachteile des Scharnierverlusts (z. B. empfindlich gegenüber Ausreißern, wie in http://www.unc.edu/~yfliu/papers/rsvm.pdf erwähnt )? Was sind …

4
Konfidenzintervalle bei sehr großen Stichproben
Meine Frage könnte wie folgt umformuliert werden: "Wie kann ein Stichprobenfehler mithilfe von Big Data bewertet werden?", Insbesondere für eine Zeitschriftenveröffentlichung. Hier ist ein Beispiel, um eine Herausforderung zu veranschaulichen. Aus einem sehr großen Datensatz (> 100000 eindeutige Patienten und deren verschriebene Medikamente aus 100 Krankenhäusern) wollte ich einen Anteil …

3
Splines gegen Gaußsche Prozessregression
Ich weiß, dass die Gaußsche Prozessregression (GPR) eine Alternative zur Verwendung von Splines zur Anpassung flexibler nichtlinearer Modelle ist. Ich würde gerne wissen, in welchen Situationen eine besser geeignet ist als die andere, insbesondere im Rahmen der Bayes'schen Regression. Ich habe bereits nachgesehen. Was sind die Vor- / Nachteile der …

1
Warum bedeutet das Hinzufügen eines Verzögerungseffekts eine Abweichung in einem Bayes'schen hierarchischen Modell?
Hintergrund: Ich arbeite gerade daran, verschiedene Bayesianische Hierarchiemodelle zu vergleichen. Die Daten sind numerische Maße für das Wohlbefinden des Teilnehmers i und die Zeit j . Ich habe ungefähr 1000 Teilnehmer und 5 bis 10 Beobachtungen pro Teilnehmer.yich jyichjy_{ij}ichichijjj Wie bei den meisten longitudinalen Datensätzen erwarte ich eine Form der …

1
Warum lösen Modelle mit gemischten Effekten die Abhängigkeit auf?
Angenommen, wir sind daran interessiert, wie sich die Noten der Schülerprüfungen auf die Anzahl der Stunden auswirken, die diese Schüler studieren. Um diese Beziehung zu untersuchen, könnten wir die folgende lineare Regression durchführen: exam.gradesi=a+β1×hours.studiedi+eiexam.gradesi=a+β1×hours.studiedi+ei \text{exam.grades}_i = a + \beta_1 \times \text{hours.studied}_i + e_i Wenn wir jedoch Schüler aus mehreren verschiedenen …

2
Unterschiedliche Ergebnisse von randomForest über caret und das Basispaket randomForest
Ich bin etwas verwirrt: Wie können sich die Ergebnisse eines trainierten Modells per Caret vom Modell in der Originalverpackung unterscheiden? Ich habe gelesen, ob vor der Vorhersage mit FinalModel von RandomForest mit Caret-Paket eine Vorverarbeitung erforderlich ist. aber ich benutze hier keine vorverarbeitung. Ich habe verschiedene Zufallswälder trainiert, indem ich …

1
Der Unterschied zwischen logistischer Regression und Support Vector Machines?
Ich weiß, dass die logistische Regression eine Hyperebene findet, die die Trainingsmuster trennt. Ich weiß auch, dass Support-Vektor-Maschinen die Hyperebene mit der maximalen Marge finden. Meine Frage: Ist der Unterschied zwischen logistischer Regression (LR) und Support Vector Machines (SVM), dass LR eine Hyperebene findet, die die Trainingsmuster trennt, während SVM …

2
GLM: Überprüfung der Verteilungs- und Link-Funktion
Ich habe ein verallgemeinertes lineares Modell, das eine Gaußsche Verteilungs- und Protokollverknüpfungsfunktion anwendet. Nach dem Anpassen des Modells überprüfe ich die Residuen: QQ-Diagramm, Residuen gegen vorhergesagte Werte, Histogramm der Residuen (unter Berücksichtigung der gebotenen Vorsicht). Alles sieht gut aus. Dies scheint mir nahezulegen, dass die Wahl einer Gaußschen Verteilung durchaus …

1
Wann würden wir Tantiles und das Medial anstelle von Quantiles und dem Median verwenden?
Ich kann auf Wikipedia oder Wolfram Mathworld keine Definitionen für Tantile oder Medial finden, aber die folgende Erklärung findet sich in Bílková, D. und Mala, I. (2012), " Anwendung der L-Moment-Methode bei der Modellierung der Einkommensverteilung in der Tschechischen Republik ", Austrian Journal of Statistics , 41 (2), 125–132. Das …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.