Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


2
Aufteilen von Bäumen in R: party vs. rpart
Es ist schon eine Weile her, dass ich mir das Teilen von Bäumen angesehen habe. Als ich das letzte Mal so etwas gemacht habe, mag ich Party in R (erstellt von Hothorn). Die Idee der bedingten Folgerung durch Stichproben ist für mich sinnvoll. Aber rpart hatte auch Anklang. In der …
15 r  cart  rpart  partitioning 

1
Wie sollten Entscheidungsbaumaufteilungen implementiert werden, wenn kontinuierliche Variablen vorhergesagt werden?
Eigentlich schreibe ich eine Implementierung von Random Forests, aber ich glaube, die Frage ist spezifisch für Entscheidungsbäume (unabhängig von RFs). Der Kontext ist also, dass ich einen Knoten in einem Entscheidungsbaum erstelle und sowohl die Vorhersage- als auch die Zielvariable kontinuierlich sind. Der Knoten hat einen aufgeteilten Schwellenwert, um Daten …

3
Was ist ein guter Ansatz, um R in einem Computerraum zu unterrichten?
Es gab mehrere gute Fragen und Antworten zu Einführungsbüchern oder Lernansätzen, z . B. hier und hier . Aber ich habe ein etwas anderes Problem - die beste Möglichkeit, eine einstündige Sitzung (oder mehrere solcher Sitzungen) in einem Computerraum durchzuführen, damit die Leute mit R beginnen und sich mit dem …
15 r  teaching 


3
Wann sollte man GMM in Betracht ziehen?
Eines der Dinge, die die Ökonometrie einzigartig machen, ist die Verwendung der Technik der verallgemeinerten Methode der Momente. Welche Arten von Problemen machen GMM geeigneter als andere Schätztechniken? Was bringt Ihnen die Verwendung von GMM in Bezug auf Effizienz oder verminderte Verzerrung oder spezifischere Parameterschätzung? Was verlieren Sie dagegen, wenn …



4
Was ist die Korrelation, wenn die Standardabweichung einer Variablen 0 ist?
Soweit ich weiß, können wir eine Korrelation erhalten, indem wir die Kovarianz mithilfe der Gleichung normalisieren ρich , j= c o v ( Xich, Xj)σichσjρich,j=cÖv(Xich,Xj)σichσj\rho_{i,j}=\frac{cov(X_i, X_j)}{\sigma_i \sigma_j} Dabei ist die Standardabweichung von . Xiσich= E[ ( Xich- μich)2]-----------√σich=E[(Xich-μich)2]\sigma_i=\sqrt{E[(X_i-\mu_i)^2]}XichXichX_i Meine Sorge ist, was ist, wenn die Standardabweichung gleich Null ist? Gibt …


2
Eine zunehmende Anzahl von Merkmalen führt zu einer Verringerung der Genauigkeit, jedoch zu einer Erhöhung des Vorlaufs / Rückrufs
Ich bin neu im maschinellen Lernen. Im Moment benutze ich einen Naive Bayes (NB) Klassifikator, um kleine Texte in 3 Klassen mit NLTK und Python als positiv, negativ oder neutral zu klassifizieren. Nach einigen Tests mit einem Datensatz von 300.000 Instanzen (16.924 positive, 7.477 negative und 275.599 neutrale) stellte ich …


4
Klassisches lineares Modell - Modellauswahl
Ich habe ein klassisches lineares Modell mit 5 möglichen Regressoren. Sie sind nicht miteinander korreliert und weisen eine relativ geringe Korrelation mit der Antwort auf. Ich bin zu einem Modell gekommen, bei dem 3 der Regressoren signifikante Koeffizienten für ihre t-Statistik haben (p <0,05). Wenn Sie eine oder beide der …


5
Was ist eine gute Ressource, die einen Vergleich der Vor- und Nachteile verschiedener Klassifikatoren beinhaltet?
Was ist der beste 2-Klassen-Klassifikator? Ja, ich denke, das ist die Millionen-Dollar-Frage, und ja, mir ist das No-Free-Lunch-Theorem bekannt , und ich habe auch die vorherigen Fragen gelesen: Was ist der beste 2-Klassen-Klassifikator für Ihre Anwendung? und schlechtester Klassifikator Dennoch bin ich daran interessiert, mehr zu diesem Thema zu lesen. …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.