Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Warum enthält eine ausreichende Statistik alle Informationen, die zur Berechnung einer Schätzung des Parameters erforderlich sind?
Ich habe gerade angefangen, Statistik zu studieren, und ich kann nicht intuitiv verstehen, wie ausreichend ist. Genauer gesagt kann ich nicht nachvollziehen, wie die folgenden beiden Absätze gleichwertig sind: Grob gesagt ist eine ausreichende Statistik eine Funktion T (X), deren Wert alle Informationen enthält, die benötigt werden, um eine Schätzung …


2
Warum unterscheidet sich GLM von einem LM mit transformierter Variable?
Wie in diesem Kurshandbuch (Seite 1) erläutert , kann ein lineares Modell in folgender Form geschrieben werden: y=β1x1+⋯+βpxp+εi,y=β1x1+⋯+βpxp+εi, y = \beta_1 x_{1} + \cdots + \beta_p x_{p} + \varepsilon_i, Dabei ist die Antwortvariable und die erklärende Variable .yyyxixix_{i}ithithi^{th} Mit dem Ziel, Testannahmen zu erfüllen, kann man häufig die Antwortvariable transformieren. …

1
Was ist der typische Bereich möglicher Werte für den Schrumpfungsparameter bei einer bestraften Regression?
Bei der Lasso oder Ridge-Regression muss ein Schrumpfungsparameter angegeben werden, der häufig als oder . Dieser Wert wird häufig über eine Kreuzvalidierung ausgewählt, indem eine Reihe verschiedener Werte in den Trainingsdaten überprüft wird und ermittelt wird, welche die besten Werte ergeben, z. B. in den Testdaten. Welchen Wertebereich sollte man …


1
Hat die Protokollwahrscheinlichkeit in GLM die Konvergenz zu globalen Maxima garantiert?
Meine Fragen sind: Werden generalisierte lineare Modelle (GLMs) garantiert zu einem globalen Maximum konvergieren? Wenn ja warum? Welche Einschränkungen gibt es für die Verbindungsfunktion, um die Konvexität sicherzustellen? Mein Verständnis von GLMs ist, dass sie eine hochgradig nichtlineare Wahrscheinlichkeitsfunktion maximieren. Daher würde ich mir vorstellen, dass es mehrere lokale Maxima …

2
Was sind die Stationaritätsanforderungen für die Verwendung der Regression mit ARIMA-Fehlern zur Inferenz?
Was sind die Stationaritätsanforderungen für die Verwendung der Regression mit ARIMA-Fehlern (dynamische Regression) zur Inferenz? Insbesondere habe ich eine instationäre kontinuierliche Ergebnisvariable , eine instationäre kontinuierliche Prädiktorvariable und eine Scheinvariablen-Behandlungsserie . Ich würde gerne wissen, ob die Behandlung mit einer Änderung der Ergebnisvariablen korreliert war, die mehr als zwei Standardfehler …

2
Was sind "Koeffizienten linearer Diskriminanten" in LDA?
In verwende Rich die ldaFunktion aus der Bibliothek, MASSum die Klassifizierung durchzuführen. Wie ich LDA verstehe, wird dem Eingang die Bezeichnung zugewiesen , die maximiert , richtig?xxxyyyp(y|x)p(y|x)p(y|x) Aber wenn ich das Modell , in das verstehe ich die Ausgabe von nicht ganz , x=(Lag1,Lag2)x=(Lag1,Lag2)x=(Lag1,Lag2)y= D i r e c t …



3
Verändert das Hinzufügen weiterer Variablen zu einer multivariablen Regression die Koeffizienten vorhandener Variablen?
Angenommen, ich habe eine multivariable (mehrere unabhängige Variablen) Regression, die aus 3 Variablen besteht. Jede dieser Variablen hat einen bestimmten Koeffizienten. Wenn ich mich entscheide, eine vierte Variable einzuführen und die Regression erneut auszuführen, ändern sich dann die Koeffizienten der drei ursprünglichen Variablen? Im weiteren Sinne: Wird bei einer multivariablen …

3
Verwenden des R-Vorhersagepakets mit fehlenden Werten und / oder unregelmäßigen Zeitreihen
Ich bin beeindruckt vom R- forecastPaket, sowie zB dem zooPaket für unregelmäßige Zeitreihen und Interpolation fehlender Werte. Meine Anwendung liegt im Bereich der Callcenter-Verkehrsprognose, daher fehlen (fast) immer Daten an den Wochenenden, die gut verarbeitet werden können zoo. Außerdem können einige diskrete Punkte fehlen, ich benutze einfach Rs NAdafür. Die …

2
PCA und k-fache Kreuzvalidierung in Caret-Packung in R
Ich habe mir gerade einen Vortrag aus dem Kurs über maschinelles Lernen auf Coursera noch einmal angesehen. In dem Abschnitt, in dem der Professor PCA für die Vorverarbeitung von Daten in beaufsichtigten Lernanwendungen bespricht, sagt er, dass PCA nur für die Trainingsdaten durchgeführt werden sollte und dann das Mapping verwendet …

2
Wenn jemand sagt, Restabweichung / df sollte ~ 1 für ein Poisson-Modell, wie ungefähr ist ungefähr?
Ich habe oft gesehen, wie man überprüft, ob eine Poisson-Modellanpassung übermäßig verteilt ist oder nicht, indem man die verbleibende Abweichung durch die Freiheitsgrade dividiert. Das resultierende Verhältnis sollte "ungefähr 1" sein. Die Frage ist, um welchen Bereich es sich bei "ungefähren Werten" handelt - welches Verhältnis sollte Alarme auslösen, um …

8
Irgendwelche Vorschläge für ein gutes Einführungslehrbuch in die Statistik?
Ich hoffe, dass Sie mir einige Vorschläge geben können. Ich unterrichte an einem sehr unterschiedlichen (aus Minderheiten bestehenden) College und die Studenten sind größtenteils Psychologiestudenten. Die meisten Schüler sind frisch von der High School, aber einige von ihnen sind älter und kehren über 40 zurück. Die meisten Schüler haben Motivationsprobleme …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.