Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Wie wählt man Variablen in einem Regressionsmodell aus?
Der traditionelle Ansatz zur Variablenauswahl besteht darin, Variablen zu finden, die am meisten zur Vorhersage einer neuen Reaktion beitragen. Kürzlich habe ich von einer Alternative dazu erfahren. Bei der Modellierung von Variablen, die die Wirkung einer Behandlung bestimmen - wie zum Beispiel in einer klinischen Studie mit einem Arzneimittel - …

3
Auswählen von Alternativen zur Poisson-Regression für überdisperse Zähldaten
Ich analysiere derzeit Daten aus einer Reihe von Verhaltensexperimenten, die alle das folgende Maß verwenden. Die Teilnehmer dieses Experiments werden gebeten, Hinweise auszuwählen, mit deren Hilfe (fiktive) andere Personen eine Reihe von 10 Anagrammen lösen können. Die Teilnehmer werden glauben gemacht, dass diese anderen Menschen entweder Geld gewinnen oder verlieren …

3
Wie lässt sich Unsicherheit am besten kommunizieren?
Ein großes Problem bei der Übermittlung der Ergebnisse statistischer Berechnungen an die Medien und die Öffentlichkeit ist die Art und Weise, wie wir Unsicherheit kommunizieren. Sicherlich scheinen die meisten Massenmedien eine harte und schnelle Nummer zu mögen, obwohl Zahlen, außer in einer relativ geringen Anzahl von Fällen, immer eine gewisse …



2
Wann sollte man Bootstrap vs. Bayes'sche Technik anwenden?
Ich habe ein ziemlich kompliziertes Problem mit der Entscheidungsanalyse, das Zuverlässigkeitstests beinhaltet, und der logische Ansatz (für mich) scheint die Verwendung von MCMC zur Unterstützung einer Bayes'schen Analyse zu beinhalten. Es wurde jedoch vorgeschlagen, einen Bootstrapping-Ansatz zu verwenden. Könnte jemand eine Referenz (oder drei) vorschlagen, die die Verwendung einer der …

2
Korrelierende Volume-Zeitreihen
Betrachten Sie das folgende Diagramm: Die rote Linie (linke Achse) beschreibt das Handelsvolumen einer bestimmten Aktie. Die blaue Linie (rechte Achse) beschreibt das Twitter-Nachrichtenvolumen für diese Aktie. Zum Beispiel wurden am 9. Mai (05-09) ungefähr 1.100 Millionen Trades und 4.000 Tweets getätigt. Ich möchte berechnen, ob es eine Korrelation zwischen …

1
Schätzung der Verteilung anhand von Daten
Ich habe eine Stichprobe von Daten, die Rvon generiert wurden rnorm(50,0,1), daher nehmen die Daten offensichtlich eine normale Verteilung an. Allerdings Rnicht „kennt“ diese verteilungs Informationen über die Daten. Gibt es eine Methode R, mit der sich abschätzen lässt, von welcher Verteilung meine Stichprobe stammt? Wenn nicht, werde ich die …
12 r  distributions 


3
Wie sind die Verteilungen im positiven k-dimensionalen Quadranten mit parametrisierbarer Kovarianzmatrix?
Nach der Frage von zzk zu seinem Problem mit negativen Simulationen frage ich mich, welche Verteilungsfamilien für den positiven k-dimensionalen Quadranten parametrisiert sind, für den die Kovarianzmatrix kann.Rk+R+k\mathbb{R}_+^kΣΣ\Sigma Wie mit zzk besprochen, funktioniert das Anwenden der linearen Transformation ab einer Verteilung auf nicht.Rk+R+k\mathbb{R}_+^kX⟶Σ1/2(X−μ)+μX⟶Σ1/2(X−μ)+μX \longrightarrow\Sigma^{1/2} (X-\mu) + \mu

2
Hierarchisches Bayes'sches Modell (?)
Bitte entschuldigen Sie, dass ich den statistischen Jargon abgeschlachtet habe :) Ich habe hier einige Fragen zu Werbung und Klickraten gefunden. Aber keiner von ihnen hat mir sehr geholfen, meine hierarchische Situation zu verstehen. Es gibt eine verwandte Frage. Handelt es sich bei diesen äquivalenten Darstellungen um dasselbe hierarchische Bayes'sche …

1
Python-Pakete für die Arbeit mit Gaußschen Mischungsmodellen (GMMs)
Für die Arbeit mit GMMs (Gaussian Mixture Models) in Python stehen anscheinend mehrere Optionen zur Verfügung. Auf den ersten Blick gibt es zumindest: PyMix - http://www.pymix.org/pymix/index.php Tools zur Gemischmodellierung PyEM - http://www.ar.media.kyoto-u.ac.jp/members/david/softwares/em/ ist Teil der Scipy-Toolbox und scheint sich auf das GMM- Update zu konzentrieren: Jetzt bekannt als sklearn.mixture . …

2
Analyse der logistischen Regressionskoeffizienten
Hier ist eine Liste der logistischen Regressionskoeffizienten (der erste ist ein Achsenabschnitt) -1059.61966694592 -1.23890500515482 -8.57185269220438 -7.50413155570413 0 1.03152408392552 1.19874787949191 -4.88083274930613 -5.77172565873336 -1.00610998453393 Ich finde es seltsam, wie niedrig der Achsenabschnitt ist und ich einen Koeffizienten habe, der eigentlich gleich 0 ist. Ich bin mir nicht ganz sicher, wie ich das …


2
Statistischer Test für einen signifikant weiter von der Grundgesamtheit entfernten Wert bedeutet: Ist es ein Z-Test oder ein T-Test?
Wie wichtig ist ein Wert im Vergleich zu einer Werteliste? In den meisten Fällen wird bei statistischen Tests ein Probensatz mit einer Population verglichen. In meinem Fall wird die Stichprobe mit einem Wert erstellt und mit der Grundgesamtheit verglichen. Ich bin ein Dilettant im Testen statistischer Hypothesen, der mit dem …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.