Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Verständnis des Konfidenzbandes aus einer Polynomregression
Ich versuche, das Ergebnis zu verstehen, das ich in meiner Grafik unten sehe. Normalerweise verwende ich Excel und erhalte eine lineare Regressionslinie, aber im folgenden Fall verwende ich R und erhalte eine polynomielle Regression mit dem Befehl: ggplot(visual1, aes(ISSUE_DATE,COUNTED)) + geom_point() + geom_smooth() Meine Fragen beschränken sich also auf Folgendes: …

4
Kann die Random Forest-Methodik auf lineare Regressionen angewendet werden?
Random Forests erstellen ein Ensemble von Entscheidungsbäumen, wobei jeder Baum mithilfe eines Bootstrap-Beispiels der ursprünglichen Trainingsdaten (Beispiel für Eingabevariablen und Beobachtungen) erstellt wird. Kann ein ähnlicher Prozess für die lineare Regression angewendet werden? Erstellen Sie k lineare Regressionsmodelle mit einer zufälligen Bootstrap-Stichprobe für jede der k Regressionen Was sind die …

3
Ist p = 5,0% signifikant?
Heute wurde ich gefragt, ob ein p-Wert von 0,05 (genau) als signifikant angesehen wird (gegebenes Alpha = 5%) oder nicht. Ich kannte die Antwort nicht und Google stellte beide Antworten auf: (a) Das Ergebnis ist signifikant, wenn p weniger als 5% und (b) wenn p weniger als 5% oder gleich …


1
Wie kann man die Korrelation zwischen Ordnungszahl und stetiger Variable richtig einschätzen?
Ich möchte die Korrelation schätzen zwischen: Eine Ordnungsvariable: Die Probanden werden gebeten, ihre Präferenz für 6 Obstsorten auf einer Skala von 1 bis 5 zu bewerten (von sehr widerlich bis sehr schmackhaft). Im Durchschnitt verwenden die Probanden nur 3 Punkte der Skala. Eine kontinuierliche Variable: Dieselben Probanden werden gebeten, diese …

3
Regressionsbaumalgorithmus mit linearen Regressionsmodellen in jedem Blatt
Kurzversion: Ich suche ein R-Paket, das Entscheidungsbäume erstellen kann, während jedes Blatt im Entscheidungsbaum ein vollständiges lineares Regressionsmodell ist. AFAIK, die Bibliothek rparterstellt Entscheidungsbäume, in denen die abhängige Variable in jedem Blatt konstant ist. Gibt es eine andere Bibliothek (oder eine rpartEinstellung, die mir nicht bekannt ist), die solche Bäume …
14 r  regression  rpart  cart 



1
Die beste Möglichkeit, Beziehungen aus einem multiplen linearen Modell visuell darzustellen
Ich habe ein lineares Modell mit ungefähr 6 Prädiktoren und werde die Schätzungen, F-Werte, p-Werte usw. präsentieren. Ich habe mich jedoch gefragt, was das beste visuelle Diagramm wäre, um den individuellen Effekt eines einzelnen Prädiktors darzustellen die Antwortvariable? Streudiagramm? Bedingte Handlung? Effektplot? etc? Wie würde ich diese Handlung interpretieren? Ich …



2
Warum wird k-means nicht mit Gradientenabstieg optimiert?
Ich weiß, dass k-means normalerweise mit Expectation Maximization optimiert wird . Wir könnten jedoch die Verlustfunktion genauso optimieren wie alle anderen! Ich habe einige Artikel gefunden, die tatsächlich eine stochastische Gradientenabnahme für großräumige k-Mittelwerte verwenden, aber ich konnte meine Frage nicht beantworten. Weiß jemand, warum das so ist? Liegt es …

1
Beta-Distribution passend für Scipy
Laut Wikipedia hat die Beta-Wahrscheinlichkeitsverteilung zwei Formparameter: und .αα\alphaββ\beta Wenn ich scipy.stats.beta.fit(x)in Python anrufe, wo xsich eine Reihe von Zahlen im Bereich , werden 4 Werte zurückgegeben. Das kommt mir komisch vor.[0,1][0,1][0,1] Nach dem googeln habe ich festgestellt, dass einer der Rückgabewerte 'location' sein muss, da die dritte Variable 0 …

1
Wann muss die Verzögerung der abhängigen Variablen in ein Regressionsmodell einbezogen werden und welche Verzögerung?
Die Daten, die wir als abhängige Variable verwenden möchten, sehen folgendermaßen aus (es handelt sich um Zähldaten). Wir befürchten, dass die Regression, da sie eine zyklische Komponente und eine Trendstruktur aufweist, irgendwie voreingenommen ist. Wir werden eine negative binomische Regression verwenden, falls dies hilft. Die Daten sind ein ausgeglichenes Panel, …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.