Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Zusammenfassende Statistik mit Mittelwert, SD, Min und Max zeichnen?
Ich habe einen wirtschaftswissenschaftlichen Hintergrund und normalerweise werden in der Disziplin die zusammenfassenden Statistiken der Variablen in einer Tabelle angegeben. Ich möchte sie jedoch zeichnen. Ich könnte ein Box-Diagramm so ändern, dass es den Mittelwert, die Standardabweichung, das Minimum und das Maximum anzeigt, aber ich möchte dies nicht tun, da …

2
Robuste Regressionsinferenz und Sandwich-Schätzer
Können Sie mir ein Beispiel für die Verwendung von Sandwich-Schätzern geben, um eine robuste Regressionsinferenz durchzuführen? Ich kann das Beispiel in sehen ?sandwich, aber ich verstehe nicht ganz, wie wir von lm(a ~ b, data)( r- codiert) zu einer Schätzung und einem p- Wert übergehen können, die aus einem Regressionsmodell …
10 r  regression  lm  sandwich 

3
Vergleichen verschachtelter binärer logistischer Regressionsmodelle, wenn
Um meine Frage besser zu stellen, habe ich einige der Ausgaben sowohl eines 16-Variablen-Modells ( fit) als auch eines 17-Variablen-Modells ( fit2) unten bereitgestellt (alle Prädiktorvariablen in diesen Modellen sind kontinuierlich, wobei der einzige Unterschied zwischen diesen Modellen darin besteht, dass fitdies nicht der Fall ist enthalten Variable 17 (var17)): …


2
So vergleichen Sie den Mittelwert zweier Stichproben, deren Daten zu Exponentialverteilungen passen
Ich habe zwei Datenproben, eine Basisprobe und eine Behandlungsprobe. Die Hypothese ist, dass die Behandlungsprobe einen höheren Mittelwert als die Basisprobe hat. Beide Proben haben eine exponentielle Form. Da die Daten ziemlich groß sind, habe ich zum Zeitpunkt der Durchführung des Tests nur den Mittelwert und die Anzahl der Elemente …

1
Schnelle Integration in eCDF in R.
Ich habe eine Integralgleichung der Form wobei das empirische cdf ist und eine Funktion ist . Ich habe eine Kontraktionsabbildung und versuche daher, die Integralgleichung mithilfe der Banach-Fixpunktsatzsequenz zu lösen.T1(x)=∫x0g(T1(y)) dF^n(y)T1(x)=∫0xg(T1(y)) dF^n(y) T_1(x) = \int_0^x g(T_1(y)) \ d\hat{F}_n(y) F^nF^n\hat{F}_nggg Dies läuft jedoch in R sehr langsam und ich denke, das …

4
Ich möchte
Sei eine Zufallsvariable im Wahrscheinlichkeitsraum Zeige, dassX:Ω→NX:Ω→NX:\Omega \to \mathbb N(Ω,B,P)(Ω,B,P)(\Omega,\mathcal B,P)E(X)=∑n=1∞P(X≥n).E(X)=∑n=1∞P(X≥n).E(X)=\sum_{n=1}^\infty P(X\ge n). Meine Definition von ist gleich E(X)E(X)E(X)E(X)=∫ΩXdP.E(X)=∫ΩXdP.E(X)=\int_\Omega X \, dP. Vielen Dank.


4
Auswirkungen der aktuellen Debatte auf die statistische Signifikanz
In den letzten Jahren haben verschiedene Wissenschaftler ein nachteiliges Problem beim Testen wissenschaftlicher Hypothesen angesprochen, das als "Freiheitsgrad der Forscher" bezeichnet wird. Dies bedeutet, dass Wissenschaftler während ihrer Analyse zahlreiche Entscheidungen treffen müssen, die darauf abzielen, mit einem p-Wert <5% zu finden. Diese zweideutigen Entscheidungen sind zum Beispiel, welcher Fall …

2
in Bezug auf die bedingte Unabhängigkeit und ihre grafische Darstellung
Beim Studium der Kovarianzauswahl habe ich einmal das folgende Beispiel gelesen. In Bezug auf das folgende Modell: Seine Kovarianzmatrix und inverse Kovarianzmatrix sind wie folgt angegeben: Ich verstehe nicht, warum die Unabhängigkeit von und y hier durch die inverse Kovarianz bestimmt wird?xxxyyy Welche mathematische Logik liegt dieser Beziehung zugrunde? Außerdem …

2
Grundlegendes zum Feature-Hashing
Wikipedia bietet das folgende Beispiel für die Beschreibung von Feature-Hashing . Die Zuordnung scheint jedoch nicht mit dem definierten Wörterbuch übereinzustimmen Zum Beispiel tosollte 3entsprechend dem Wörterbuch konvertiert werden , aber es wird 1stattdessen als codiert . Gibt es einen Fehler in der Beschreibung? Wie funktioniert Feature-Hashing? Die Texte: John …



1
Entscheidungsbäume Variable (Feature) Skalierung und Variable (Feature) Normalisierung (Tuning) in welchen Implementierungen erforderlich?
In vielen Algorithmen für maschinelles Lernen ist die Feature-Skalierung (auch bekannt als variable Skalierung, Normalisierung) ein häufiger Vorverarbeitungsschritt. Wikipedia - Feature-Skalierung - Diese Frage war knapp. Frage 41704 - Wie und warum funktionieren Normalisierung und Feature-Skalierung? Ich habe zwei Fragen speziell in Bezug auf Entscheidungsbäume: Gibt es Implementierungen von Entscheidungsbäumen, …

2
PyMC für nichtparametrisches Clustering: Der Dirichlet-Prozess zur Schätzung der Parameter der Gaußschen Mischung kann nicht geclustert werden
Problemeinrichtung Eines der ersten Spielzeugprobleme, auf das ich PyMC anwenden wollte, ist das nichtparametrische Clustering: Modellieren Sie anhand einiger Daten diese als Gaußsche Mischung und lernen Sie die Anzahl der Cluster sowie den Mittelwert und die Kovarianz jedes Clusters. Das meiste, was ich über diese Methode weiß, stammt aus Videovorträgen …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.