Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Was ist eine Ablationsstudie? Und gibt es eine systematische Möglichkeit, dies durchzuführen?
Was ist eine Ablationsstudie? Und gibt es eine systematische Möglichkeit, dies durchzuführen? Zum Beispiel habe ich Prädiktoren in einer linearen Regression, die ich als mein Modell bezeichnen werde.nnn Wie werde ich dazu eine Ablationsstudie durchführen? Welche Metriken soll ich verwenden? Eine umfassende Quelle oder ein Lehrbuch wäre willkommen.


2
Warum der Name "Kernel" in Statistiken und ML?
Dies wurde auf anderen SE-Sites im Zusammenhang mit Betriebssystemen und linearer Algebra gefragt, aber die gleiche Frage beunruhigt mich hinsichtlich der in der Statistik und beim maschinellen Lernen verwendeten Kernelmethoden. Oft wird gesagt, dass Kernel, z. B. bei der Schätzung der Kerneldichte oder bei SVMs, eine Ähnlichkeit darstellen, aber ich …

3
Was genau ist ein Startwert in einem Zufallszahlengenerator?
Ich habe eine gewöhnliche Google-Suche usw. versucht, aber die meisten Antworten, die ich finde, sind entweder mehrdeutig oder sprach- / bibliotheksspezifisch wie Python oder C ++ stdlib.husw. Ich suche eine sprachunabhängige, mathematische Antwort, nicht die Besonderheiten einer Bibliothek. Zum Beispiel sagen viele, dass der Startwert ein Ausgangspunkt für einen Zufallszahlengenerator …

3
Gibt es einen Unterschied zwischen Frequentist und Bayesian in der Definition der Wahrscheinlichkeit?
Einige Quellen sagen, dass die Wahrscheinlichkeitsfunktion keine bedingte Wahrscheinlichkeit ist, andere sagen, dass dies der Fall ist. Das ist sehr verwirrend für mich. Nach den meisten Quellen, die ich gesehen habe, sollte die Wahrscheinlichkeit einer Verteilung mit dem Parameter ein Produkt von Wahrscheinlichkeitsmassenfunktionen sein, wenn Stichproben von :n x iθθ\thetannnxixix_i …


4
Ist 50% 100% höher als 25% oder ist es 25% höher als 25%?
Wenn ich zwei Werte A und B habe, die beide als Prozentsatz von C ausgedrückt werden, und ich den Größenunterschied zwischen A und B als Prozentsatz D ausdrücken möchte, ist es richtiger, D als Prozentsatz von C auszudrücken, oder als Prozentsatz von B (oder tatsächlich A)? 50 Arbeitslose sind offensichtlich …

4
Wozu deskriptive Statistiken melden?
Ich habe gerade eine Analyse meiner Daten mit Hilfe der logistischen Regression durchgeführt. Allerdings muss mein Bericht auch einen beschreibenden statistischen Teil enthalten. Ich verstehe das ehrlich gesagt nicht und ich hatte gehofft, dass jemand erklären kann, warum es notwendig ist. Wenn ich zum Beispiel ein Histogramm einer meiner unabhängigen …

2
Die Grenze des Ridge-Regressionsschätzers für "Einheitsvarianz", wenn
Betrachten Sie die Ridge-Regression mit einer zusätzlichen Einschränkung, die voraussetzt, dass eine Einheitssumme von Quadraten hat (entsprechend eine Einheitsvarianz). Bei Bedarf kann man davon ausgehen, dass eine Einheitssumme von Quadraten hat:y^y^\hat{\mathbf y}yy\mathbf y β^∗λ=argmin{∥y−Xβ∥2+λ∥β∥2}s.t.∥Xβ∥2=1.β^λ∗=arg⁡min{‖y−Xβ‖2+λ‖β‖2}s.t.‖Xβ‖2=1.\hat{\boldsymbol\beta}_\lambda^* = \arg\min\Big\{\|\mathbf y - \mathbf X \boldsymbol \beta\|^2+\lambda\|\boldsymbol\beta\|^2\Big\} \:\:\text{s.t.}\:\: \|\mathbf X \boldsymbol\beta\|^2=1. Was ist die Grenze …

1
Latent Variable Interpretation von generalisierten linearen Modellen (GLMs)
Kurzfassung: Wir wissen, dass logistische Regression und Probit-Regression so interpretiert werden können, dass sie eine kontinuierliche latente Variable beinhalten, die vor der Beobachtung anhand eines festgelegten Schwellenwerts diskretisiert wird. Steht eine ähnliche latente Variableninterpretation beispielsweise für die Poisson-Regression zur Verfügung? Wie wäre es mit einer binomialen Regression (wie logit oder …

4
Bei einer ausreichend großen Stichprobe zeigt ein Test immer ein signifikantes Ergebnis, es sei denn, die tatsächliche Effektgröße ist genau Null. Warum?
Ich bin gespannt auf eine Behauptung im Wikipedia-Artikel zur Effektgröße . Speziell: [...] Ein statistischer Vergleich, der nicht Null ist, zeigt immer statistisch signifikante Ergebnisse, es sei denn, die Populationsgröße ist genau Null Ich bin mir nicht sicher, was dies bedeutet / impliziert, geschweige denn ein Argument, um es zu …

1
Dies zeigt, dass 100 Messungen für 5 Probanden weniger Informationen liefern als 5 Messungen für 100 Probanden
Auf einer Konferenz habe ich die folgende Aussage gehört: 100 Messungen für 5 Probanden liefern viel weniger Informationen als 5 Messungen für 100 Probanden. Es ist ein bisschen offensichtlich, dass dies wahr ist, aber ich habe mich gefragt, wie man es mathematisch beweisen könnte ... Ich denke, ein lineares gemischtes …



2
Eingeschränkte Boltzmann-Maschine: Wie wird sie beim maschinellen Lernen eingesetzt?
Hintergrund: Ja, die eingeschränkte Boltzmann-Maschine (RBM) kann verwendet werden, um die Gewichte eines neuronalen Netzwerks zu initiieren. Außerdem KANN es "Schicht für Schicht" verwendet werden, um ein tiefes Glaubensnetzwerk aufzubauen (d. H. Eine te Schicht auf der ( n - 1 ) -ten Schicht zu trainieren und dann die zu …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.