Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Unterschied in der Differenzmethode: Wie kann die Annahme eines gemeinsamen Trends zwischen Behandlung und Kontrollgruppe überprüft werden?
Nach einem Kommentar aus einem früheren Thread möchte ich wissen, wie man die Annahme eines gemeinsamen Trends zwischen der Behandlungs- und Kontrollgruppe in der Differenz-in-Differenz-Methode testen kann. Kann ich diese Annahme mit Daten zu zwei Zeitpunkten testen (z. B. Basiserhebung im Jahr 2002, Behandlung von 2002 bis 2006 und Nachuntersuchung …

4
Fluch der Dimensionalität: kNN-Klassifikator
Ich lese Kevin Murphys Buch: Maschinelles Lernen - Eine probabilistische Perspektive. Im ersten Kapitel erklärt der Autor den Fluch der Dimensionalität und es gibt einen Teil, den ich nicht verstehe. Als Beispiel gibt der Autor an: Beachten Sie, dass die Eingaben gleichmäßig entlang eines D-dimensionalen Einheitswürfels verteilt sind. Angenommen, wir …

1
Wie benutzt man einen Entscheidungsstumpf als schwachen Lernenden in Adaboost?
Ich möchte Adaboost mit Decision Stump implementieren. Ist es richtig, in jeder Iteration von Adaboost so viele Entscheidungsstümpfe wie die Funktionen unseres Datensatzes zu treffen? Wenn ich beispielsweise einen Datensatz mit 24 Funktionen habe, sollte ich in jeder Iteration 24 Entscheidungsstumpfklassifizierer haben? Oder sollte ich zufällig einige Funktionen auswählen und …

2
Inkrementelle Gaußsche Prozessregression
Ich möchte eine inkrementelle Gaußsche Prozessregression mithilfe eines Schiebefensters über den Datenpunkten implementieren, das nacheinander über einen Stream ankommt. Lassen die Dimensionalität des Eingangsraums bezeichnen. Jeder Datenpunkt hat also Anzahl von Elementen.dddxixix_iddd Sei die Größe des Schiebefensters.nnn Um Vorhersagen zu treffen, muss ich die Inverse der Grammmatrix berechnen , wobei …

1
Bedeutung der y-Achse im Random Forest Partial Dependence Plot
Ich verwende das RandomForestR-Paket und bin verwirrt darüber, wie die Werte der Y-Achse in ihren partiellen Abhängigkeitsdiagrammen zu interpretieren sind. In den Hilfedokumenten heißt es, dass das Diagramm eine "grafische Darstellung des Randeffekts einer Variablen auf die Klassenwahrscheinlichkeit" ist. Ich bin jedoch immer noch verwirrt darüber, was genau die y-Achse …

1
Grundlegende Differenzierungsformel verstehen
Ich habe eine Zeitreihe und möchte sie als ARFIMA-Prozess (auch bekannt als FARIMA) modellieren. Wenn y_t in der (gebrochenen) Ordnung d integriert ist , möchte ich es fraktioniert differenzieren, um es stationär zu machen.y t dytyty_tytyty_tddd Frage : Ist die folgende Formel zur Definition der gebrochenen Differenzierung korrekt? Δdyt:=yt−dyt−1+d(d−1)2!yt−2−d(d−1)(d−2)3!yt−3+...+(−1)k+1d(d−1)⋅...⋅(d−k)k!yt−k+...Δdyt:=yt−dyt−1+d(d−1)2!yt−2−d(d−1)(d−2)3!yt−3+...+(−1)k+1d(d−1)⋅...⋅(d−k)k!yt−k+...\Delta^d y_t …



5
Durbin Watson Teststatistik
Ich habe den DW-Test auf mein Regressionsmodell in R angewendet und eine DW-Teststatistik von 1,78 und einen p-Wert von 2,2e-16 = 0 erhalten. Bedeutet dies, dass es keine Autokorrelation zwischen den Residuen gibt, weil der stat nahe bei 2 mit einem kleinen p-Wert liegt, oder bedeutet dies, dass der p-Wert …



1
MCMC mit Metropolis-Hastings-Algorithmus: Auswahl des Vorschlags
Ich muss eine Simulation durchführen, um ein Integral einer 3-Parameter-Funktion zu bewerten, wir sagen , das eine sehr komplizierte Formel hat. Es wird gebeten, die MCMC-Methode zu verwenden, um sie zu berechnen und den Metropolis-Hastings-Algorithmus zu implementieren, um die als verteilten Werte zu generieren , und es wurde vorgeschlagen, eine …

2
Verteilung für prozentuale Daten
Ich habe eine Frage zur richtigen Verteilung, die zum Erstellen eines Modells mit meinen Daten verwendet werden soll. Ich führte eine Waldinventur mit 50 Parzellen durch, wobei jede Parzelle 20 m × 50 m misst. Für jedes Grundstück schätzte ich den Prozentsatz der Baumkronen, die den Boden beschatten. Jedes Grundstück …


1
Normalitätsannahme bei linearer Regression
Als Annahme einer linearen Regression wird die Normalität der Fehlerverteilung manchmal fälschlicherweise "erweitert" oder als Notwendigkeit der Normalität von y oder x interpretiert. Ist es möglich, ein Szenario / einen Datensatz zu erstellen, bei dem X und Y nicht normal sind, der Fehlerterm jedoch lautet und daher die erhaltenen linearen …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.