Ich arbeite mit einem Datensatz mit N rund 200.000. In Regressionen sehe ich sehr kleine Signifikanzwerte << 0.001, die mit sehr kleinen Effektgrößen verbunden sind, z. B. r = 0.028. Was ich gerne wissen würde, gibt es eine grundsätzliche Möglichkeit, eine angemessene Signifikanzschwelle in Bezug auf die Stichprobengröße zu bestimmen? …
Es ist schon eine Weile her, dass ich mir das Teilen von Bäumen angesehen habe. Als ich das letzte Mal so etwas gemacht habe, mag ich Party in R (erstellt von Hothorn). Die Idee der bedingten Folgerung durch Stichproben ist für mich sinnvoll. Aber rpart hatte auch Anklang. In der …
Eigentlich schreibe ich eine Implementierung von Random Forests, aber ich glaube, die Frage ist spezifisch für Entscheidungsbäume (unabhängig von RFs). Der Kontext ist also, dass ich einen Knoten in einem Entscheidungsbaum erstelle und sowohl die Vorhersage- als auch die Zielvariable kontinuierlich sind. Der Knoten hat einen aufgeteilten Schwellenwert, um Daten …
Es gab mehrere gute Fragen und Antworten zu Einführungsbüchern oder Lernansätzen, z . B. hier und hier . Aber ich habe ein etwas anderes Problem - die beste Möglichkeit, eine einstündige Sitzung (oder mehrere solcher Sitzungen) in einem Computerraum durchzuführen, damit die Leute mit R beginnen und sich mit dem …
Hat jemand einen Verweis auf eine Zusammenfassung von Laufzeitanalysen für gängige Algorithmen für maschinelles Lernen (verschiedene Varianten von NN, SVM usw.)?
Eines der Dinge, die die Ökonometrie einzigartig machen, ist die Verwendung der Technik der verallgemeinerten Methode der Momente. Welche Arten von Problemen machen GMM geeigneter als andere Schätztechniken? Was bringt Ihnen die Verwendung von GMM in Bezug auf Effizienz oder verminderte Verzerrung oder spezifischere Parameterschätzung? Was verlieren Sie dagegen, wenn …
Angenommen, ich habe eine große Menge von Werten, die sich manchmal wiederholen. Ich möchte die Gesamtzahl der eindeutigen Werte in der großen Menge schätzen .SSS Wenn ich eine zufällige Stichprobe von nehme - Werte und bestimmen , dass es enthält T u eindeutige Werte, kann ich dies die Anzahl der …
Die Frage, die ich stellen möchte, lautet: Wie ändert sich der Anteil der Stichproben innerhalb von 1 SD des Mittelwerts einer Normalverteilung, wenn die Anzahl der Variablen zunimmt? (Fast) jeder weiß, dass in einer eindimensionalen Normalverteilung 68% der Proben innerhalb einer Standardabweichung vom Mittelwert gefunden werden können. Was ist mit …
Soweit ich weiß, können wir eine Korrelation erhalten, indem wir die Kovarianz mithilfe der Gleichung normalisieren ρich , j= c o v ( Xich, Xj)σichσjρich,j=cÖv(Xich,Xj)σichσj\rho_{i,j}=\frac{cov(X_i, X_j)}{\sigma_i \sigma_j} Dabei ist die Standardabweichung von . Xiσich= E[ ( Xich- μich)2]-----------√σich=E[(Xich-μich)2]\sigma_i=\sqrt{E[(X_i-\mu_i)^2]}XichXichX_i Meine Sorge ist, was ist, wenn die Standardabweichung gleich Null ist? Gibt …
Ich hoffe, dies ist der richtige Ort, um dies zu veröffentlichen. Ich habe darüber nachgedacht, es bei Skeptikern zu veröffentlichen, aber ich denke, sie würden nur sagen, dass die Studie statistisch falsch war. Ich bin gespannt auf die Kehrseite der Frage, wie man es richtig macht. Auf der Website Quantified …
Ich bin neu im maschinellen Lernen. Im Moment benutze ich einen Naive Bayes (NB) Klassifikator, um kleine Texte in 3 Klassen mit NLTK und Python als positiv, negativ oder neutral zu klassifizieren. Nach einigen Tests mit einem Datensatz von 300.000 Instanzen (16.924 positive, 7.477 negative und 275.599 neutrale) stellte ich …
Ich habe einen Datensatz, bei dem jeder Datensatz aus verschiedenen Kennzahlen besteht. Für jede Kennzahl habe ich einen Richtwert. Ich würde gerne wissen, wie nahe die einzelnen Daten am Benchmarkwert liegen.nnn Ich dachte daran, die gewichtete euklidische Distanz wie folgt zu verwenden: dx , b= ( ∑ni = 1wich( xich- …
Ich habe ein klassisches lineares Modell mit 5 möglichen Regressoren. Sie sind nicht miteinander korreliert und weisen eine relativ geringe Korrelation mit der Antwort auf. Ich bin zu einem Modell gekommen, bei dem 3 der Regressoren signifikante Koeffizienten für ihre t-Statistik haben (p <0,05). Wenn Sie eine oder beide der …
Betrachten Sie eine einfache Zeitreihe: > tp <- seq_len(10) > tp [1] 1 2 3 4 5 6 7 8 9 10 Für diese Zeitreihe können wir eine Adjazenzmatrix berechnen, die die zeitlichen Verknüpfungen zwischen Stichproben darstellt. Bei der Berechnung dieser Matrix wird zum Zeitpunkt 0 eine imaginäre Stelle hinzugefügt, …
Was ist der beste 2-Klassen-Klassifikator? Ja, ich denke, das ist die Millionen-Dollar-Frage, und ja, mir ist das No-Free-Lunch-Theorem bekannt , und ich habe auch die vorherigen Fragen gelesen: Was ist der beste 2-Klassen-Klassifikator für Ihre Anwendung? und schlechtester Klassifikator Dennoch bin ich daran interessiert, mehr zu diesem Thema zu lesen. …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.