Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


1
Wie funktioniert der wilde Bootstrap intuitiv?
Ich versuche die Intuition hinter dem Wild-Bootstrap zu verstehen. Was macht es eigentlich? Ich muss verstehen können, was es im Vergleich zu einer herkömmlichen Regression zu tun versucht. Meine Daten sind heteroskedastisch und die von mir verwendete Methode führt 5000 Replikationen durch. Wie werden 5000 zusätzliche Daten generiert?

2
Ursachen für bimodale Verteilungen beim Bootstrapping eines Metaanalysemodells
Ich helfe einem Kollegen, ein Metaanalyse-Modell mit gemischten Effekten mithilfe des von @Wolfgang verfassten Metafor R-Paket-Frameworks zu booten. Interessanterweise und besorgniserregend erhalte ich für einen der Koeffizienten des Modells beim Bootstrapping eine bimodale Verteilung (siehe unten rechts in der Abbildung unten). Ich denke, eine der Hauptursachen könnte die Tatsache sein, …

3
Was ist der Zweck der Verwendung eines Entscheidungsbaums?
Ich verstehe nicht, was der Zweck des Entscheidungsbaums ist. So wie ich es sehe, ist es eine Reihe von Wenn-Sonst. Warum verwende ich nicht einfach if-else anstelle eines Entscheidungsbaums? Liegt es daran, dass es die Komplexität meines Codes verringert? Ich werde immer noch von der Berechnung der Entropie und des …

2
Wie heißt dieses „Phänomen“?
Unten finden Sie ein Histogramm einiger Daten. Die Bins sind Ganzzahlen, die anderen Parameter sind irrelevant. Wie Sie sehen können, scheint es zwei getrennte, aber überlappende Normalverteilungen für ungerade und gerade Zahlen zu geben. Die Wahrscheinlichkeit, eine gerade Zahl zu sein, beträgt 1/3, bei einer ungeraden Zahl ebenfalls 2/3. Ich …

3
Logistische Funktion mit Steigung, aber ohne Asymptoten?
Die logistische Funktion hat einen Ausgabebereich von 0 bis 1 und die asymptotische Steigung ist auf beiden Seiten Null. Was ist eine Alternative zu einer Logistikfunktion, die an ihren Enden nicht vollständig abgeflacht ist? Wessen asymptotische Steigungen nähern sich Null, aber nicht Null, und die Reichweite ist unendlich?


2
Bedingte Erwartung einer einheitlichen Zufallsvariablen bei Auftragsstatistik
Es sei angenommen , X = (X1,...,Xn)(X1,...,Xn)(X_1, ..., X_n) ~ U(θ,2θ)U(θ,2θ)U(\theta, 2\theta) , wobei θ∈R+θ∈R+\theta \in \Bbb{R}^+ . Wie berechnet man die bedingte Erwartung von E[X1|X(1),X(n)]E[X1|X(1),X(n)]E[X_1|X_{(1)},X_{(n)}] , wobei X(1)X(1)X_{(1)} und X(n)X(n)X_{(n)} die kleinste bzw. größte Ordnungsstatistik sind? Mein erster Gedanke wäre, dass die Bestellstatistik den Bereich begrenzt und einfach (X(1)+X(n))/2(X(1)+X(n))/2(X_{(1)}+X_{(n)})/2 …

3
Wann implizieren
Die Frage: X.n→dX.Xn→dXX_n\stackrel{d}{\rightarrow}X und Y.n→dY.⟹?X.n+ Y.n→dX.+ Y.Yn→dY⟹?Xn+Yn→dX+YY_n\stackrel{d}{\rightarrow}Y \stackrel{?}{\implies} X_n+Y_n\stackrel{d}{\rightarrow}X+Y Ich weiß, dass dies im Allgemeinen nicht gilt; Der Satz von Slutsky gilt nur, wenn eine oder beide Konvergenzen wahrscheinlich sind. Gibt es jedoch Fälle, in denen dies der Fall ist ? Zum Beispiel, wenn die Sequenzen X.nXnX_n und Y.nYnY_n unabhängig …

2
Verschiedene Methoden zur Modellierung von Interaktionen zwischen kontinuierlichen und kategorialen Prädiktoren in GAM
Die folgende Frage baut auf der Diskussion auf dieser Seite auf . Bei einer gegebenen Antwortvariablen y, einer kontinuierlichen erklärenden Variablen xund einem Faktor facist es möglich, ein allgemeines additives Modell (GAM) mit einer Interaktion zwischen xund unter facVerwendung des Arguments zu definieren by=. Gemäß der Hilfedatei ?gam.models im R-Paket …
8 r  interaction  gam  mgcv 

2
Warum nicht die instrumentelle Variable direkt als Kovariate in der Regression verwenden?
Ich weiß, dass dies eine dumme Frage ist, da ich die Theorie der instrumentellen Variablen und der zweistufigen Regression kenne. Trotzdem habe ich nie eine klare Antwort auf Folgendes gesehen: Angenommen, Sie haben eine Endogenität aufgrund einer nicht beobachteten Variablen, die mit einem der anfänglichen Regressoren korreliert. Der typische Weg, …

1
Warum werden Interaktionen bei multipler Regression als Produkte und nicht als etwas anderes der Prädiktoren modelliert?
Betrachten Sie die multiple lineare Regression. Diese Frage mag täuschend einfach sein, aber ich versuche intuitiv zu verstehen, warum, wenn ich beispielsweise Prädiktoren X1 und X2 habe, Interaktionen zwischen diesen Prädiktoren von X1 * X2 angemessen erfasst werden können. Ich weiß, dass Interaktionsbegriffe als Produkte modelliert werden, nur weil mir …


2
Was sind "Fringeliers"?
Ich habe kürzlich einen Rezensenten-Kommentar von einer Journal-Einreichung erhalten, in der ich darum gebeten wurde berichten, wie ich mit Ausreißern und Randgruppen umgegangen bin . Ich hatte noch nichts von dem Begriff "Fringeliers" gehört und als ich googelte, gab es einige Artikel, aber keine präzise Definition. Daher dachte ich, es …

2
Wie kann ich Modelle ohne Anpassung vergleichen?
Regression und maschinelles Lernen werden in den Naturwissenschaften verwendet, um Hypothesen zu testen, Parameter zu schätzen und Vorhersagen zu treffen, indem Modelle an Daten angepasst werden. Wenn ich jedoch ein A-priori- Modell habe, möchte ich keine Anpassung vornehmen - zum Beispiel ein Modell eines deterministischen physikalischen Systems, das aus ersten …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.