Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


2
Ist der Bootstrap in einer Bayes'schen Umgebung unbrauchbar?
Soweit ich weiß, ist Bootstrapping in einer Frequentist-Umgebung unglaublich nützlich. In frequentistischen Statistiken: Wir versuchen, langfristige Wahrscheinlichkeiten abzuschätzen. In der Praxis haben wir nicht unendlich viele Proben. Mit dem Bootstrap können wir unendlich viele Re-Samples simulieren. Soweit ich weiß, ist dies wahrscheinlich das nützlichste Werkzeug in der Statistik der Frequentisten. …

1
Wie berechnet man den Median eines PDFs?
Ich bin neu in der Statistik und habe Probleme, eine Frage aus einer Aufgabe zu lösen. Ich habe eine Wahrscheinlichkeitsdichtefunktion und muss ihren Median berechnen Hier ist die Funktion: f(x)=2xe−x2,x>=0f(x)=2xe−x2,x>=0f(x) = 2xe^{-x^2}, x>= 0 Die Antwort lautet .log2−−−−√log⁡2\sqrt{\log 2} Kann jemand helfen? Ich versuche ... zu lernen

3
GLMs müssen in den Parametern linear sein.
Ich habe eine gewisse kognitive Dissonanz darüber, was "linear in den Parametern" bedeutet. Zum Beispiel hier und hier . Zum Beispiel ist mein Verständnis ist in den Parametern nicht linear, da zwei Parametervariablen miteinander multipliziert sind (nämlich ).yich=β0+β1β2x1+ exp(β3) (x2)2+ ϵyi=β0+β1β2x1+exp⁡(β3)(x2)2+ϵy_i = \beta_0 + \beta_1\beta_2x_1 + \exp(\beta_3)(x_2)^2 + \epsilonβ1,β2β1,β2{\beta_1, \beta_2} …

2
Gibt es zwei Definitionen des Wortes Voreingenommenheit?
Ich höre, dass der Begriff Voreingenommenheit in der statistischen Literatur häufig verwendet wird. Zum Beispiel, Durch die Verwendung der mittleren Imputation fügen wir unserer Schätzung eine Verzerrung hinzu. Ein anderes Beispiel, Der Bias-Varianz-Kompromiss ist ein wichtiges Thema bei der Auswahl von Modellen. Sind das die gleichen "Vorurteile"?

2
Umgang mit kleinen Losgrößen im SGD-Training
Ich versuche, ein großes Modell (tiefes Netz mit Kaffee) mit stochastischem Gradientenabstieg (SGD) zu trainieren. Das Problem ist, dass ich durch meine GPU-Speicherkapazität eingeschränkt bin und daher keine großen Mini-Batches für jede stochastische Gradientenschätzung verarbeiten kann. Wie kann ich diese Instabilität in meinem Training überwinden? Ein Gedanke, den ich hatte, …

2
Berechnung des Schwerkraftmodells in R- und Stata-Software: Warum sind Koeffizienten gleich, aber Standardfehler unterschiedlich?
Wir haben das Schwerkraftmodell in der R- und Stata-Software berechnet. Für Berechnungen haben wir das Standardpaket glmmin R (mit Parameter family = quasipoisson) und ppmlin Stata verwendet. Rufen Sie das Berechnungsverfahren in R auf: summary(glmm<-glm(formula=exports ~ ln_GDPimporter + ln_GDPexporter + ln_GDPimppc + ln_GDPexppc + ln_Distance + ln_Tariff + ln_ExchangeRate + …

2
Zerlegung der durchschnittlichen quadratischen Verzerrung (in Elemente des statistischen Lernens)
Ich kann nicht herausfinden, wie die Formel 7.14 auf Seite 224 von Die Elemente des statistischen Lernens abgeleitet wird. Kann mir jemand helfen, es herauszufinden? Average squared bias=Average[model bias]2+Average[estimation bias]2Average squared bias=Average[model bias]2+Average[estimation bias]2\textrm{Average squared bias} = \textrm{Average}[\textrm{model bias}]^2 + \textrm{Average}[\textrm{estimation bias}]^2


3
Wenn zwei Merkmale eine bekannte Korrelation aufweisen, können Sie dann die Wahrscheinlichkeit vorhersagen, dass sie sich für ein zufälliges Paar „ausrichten“?
Angenommen, Sie haben zwei Merkmale, die in einer bestimmten Population korrelieren, wie den BMI einer Person und ihren Blutdruck. Angenommen, ich möchte die Wahrscheinlichkeit abschätzen, dass bei einem zufällig ausgewählten Personenpaar aus dieser Population derjenige mit dem höheren BMI auch einen höheren Blutdruck aufweist. Wenn ich den Pearson-Korrelationskoeffizienten kenner (oder …


1
AIC versus Likelihood Ratio Test bei der Auswahl von Modellvariablen
Die Software, die ich derzeit zum Erstellen eines Modells verwende, vergleicht ein "aktuelles Lauf" -Modell mit einem "Referenzmodell" und meldet (falls zutreffend) sowohl einen Chi-Quadrat-p-Wert basierend auf Likelihood-Ratio-Tests als auch AIC-Werte für jedes Modell. Ich weiß, dass ein Vorteil von AIC gegenüber Likelihood-Ratio-Tests darin besteht, dass AIC mit nicht verschachtelten …

7
Das Frosch-Rätsel - Bedingte Wahrscheinlichkeiten
Ich habe dieses Rätsel im Internet gesehen: https://ed.ted.com/lessons/can-you-solve-the-frog-riddle-derek-abbott Zusammenfassend; Es gibt eine Population von Fröschen mit Männern: Frauen im Verhältnis 50:50. In Ihrer Nähe befinden sich zwei Bodenflecken, von denen einer einen Frosch und der andere zwei Frösche enthält. Ihr Überleben hängt davon ab, dass Sie einen weiblichen Frosch in …

2
Man beweise, dass
Ich habe diese Gleichheit wobei A und B quadratische symmetrische Matrizen sind.(A−1+B−1)−1=A(A+B)−1B(A−1+B−1)−1=A(A+B)−1B(A^{-1} + B^{-1})^{-1}=A(A+B)^{-1}BAAABBB Ich habe viele Tests von R und Matlab durchgeführt, die zeigen, dass dies zutrifft, aber ich weiß nicht, wie ich es beweisen soll.


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.