Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren




1
Filtern eines Datenrahmens
Lernen Sie immer noch die Grundfunktionen in R. Die Teilmengenfunktion scheint nur eine Bedingung basierend auf einer einzelnen Spalte mit oder ohne mehrere Bedingungen zu filtern. Wie kann ich einfach Daten aus einem Datenrahmen filtern? wenn Sie mit mehreren Bedingungen versehen sind Wenn die Bedingung auf die verfügbaren Spalten angewendet …
12 r 

2
Akinator.com und Naive Bayes Klassifikator
Kontext: Ich bin ein Programmierer mit etwas (halb vergessener) Erfahrung in der Statistik von Uni-Kursen. Kürzlich bin ich auf http://akinator.com gestoßen und habe einige Zeit damit verbracht, es zum Scheitern zu bringen. Und wer war das nicht? :) Ich habe beschlossen, herauszufinden, wie es funktionieren könnte. Nachdem ich verwandte Blog-Beiträge …

3
SVM-Regression verstehen: objektive Funktion und „Ebenheit“
SVMs zur Klassifizierung machen für mich intuitiv Sinn: Ich verstehe, wie minimierend ||θ||2||θ||2||\theta||^2 ergibt den maximalen Spielraum. Ich verstehe dieses Ziel jedoch nicht im Kontext der Regression. Verschiedene Texte ( hier und hier ) beschreiben dies als Maximierung der "Ebenheit". Warum sollten wir das tun wollen? Was entspricht in der …
12 regression  svm 

2
Wie kann ein MCMC-Hypothesentest an einem Mixed-Effect-Regressionsmodell mit zufälligen Steigungen durchgeführt werden?
Die Bibliothek languageR bietet eine Methode (pvals.fnc) zum Testen der MCMC-Signifikanz der festen Effekte in einem Regressionsmodell für gemischte Effekte unter Verwendung von lmer. Pvals.fnc gibt jedoch einen Fehler aus, wenn das lmer-Modell zufällige Steigungen enthält. Gibt es eine Möglichkeit, einen MCMC-Hypothesentest für solche Modelle durchzuführen? Wenn das so ist, …

3
Faktorwerte aus diskreten, ordinalen Antworten
Gibt es eine prinzipielle Möglichkeit, Faktorwerte zu schätzen, wenn Sie ordinale, diskrete Variablen haben? Ich habe ordinale, diskrete Variablen. Wenn ich davon ausgehe, dass jeder Antwort eine kontinuierliche, normalverteilte Variable zugrunde liegt, kann ich eine n × n polychrone Korrelationsmatrix berechnen. Ich kann dann eine Faktoranalyse für diese Matrix ausführen …


8
Was macht ein Statistiker?
Wenn ich meinen nicht-statistischen Freunden erzähle, dass ich ein Doktorand in Statistik bin, sagen sie natürlich: "Oh, also wollen Sie Professor werden?". Ich sage nein, ich plane tatsächlich, in der Industrie zu arbeiten. Dann antworten sie mit "und machen was?". Ich habe keine gute Antwort auf diese Frage gefunden. Ich …
12 careers 


3
Wie berechnet man die Erwartung von
Wenn XiXiX_i exponentiell verteilt ist (i=1,...,n)(i=1,...,n)(i=1,...,n) mit dem Parameter λλ\lambda und XiXiX_i ‚s ist voneinander unabhängig, was die Erwartung (∑i=1nXi)2(∑i=1nXi)2 \left(\sum_{i=1}^n {X_i} \right)^2 in Bezug auf nnn undλλ\lambda und möglicherweise andere Konstanten? Hinweis: Diese Frage wurde unter /math//q/12068/4051 mathematisch beantwortet . Die Leser würden es sich auch ansehen.

3
Verwendung von CDF- und PDF-Statistiken zur Analyse
Dies mag eine zu allgemeine Frage sein, aber ich hoffe, dass ich hier Hilfe finden kann. Ich beginne einen RA-Job an meiner Universität und mein Thema wird sich mit Internet-Verkehrsanalyse befassen. Ich bin ziemlich neu in der Welt der Analyse, aber ich denke, in der Welt der Forschung ist dies …


5
Bessere Klassifizierung des Ausfalls bei der logistischen Regression
Vollständige Offenlegung: Dies sind Hausaufgaben. Ich habe einen Link zum Datensatz hinzugefügt ( http://www.bertelsen.ca/R/logistic-regression.sav ) Mein Ziel ist es, die Vorhersage der Kreditausfälle in diesem Datensatz zu maximieren. Jedes Modell, das ich mir bisher ausgedacht habe, sagt> 90% der Nichtausfälle voraus, aber <40% der Ausfälle, wodurch die Klassifizierungseffizienz insgesamt ~ …
12 r  logistic  spss  self-study 

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.