Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Seltsame Methode zur Berechnung des Chi-Quadrats in Excel vs R.
Ich schaue auf ein Excel-Blatt, das behauptet, das zu berechnen , aber ich erkenne diese Vorgehensweise nicht und habe mich gefragt, ob mir etwas fehlt.χ2χ2\chi^2 Hier sind die Daten, die analysiert werden: +------------------+----------+----------+ | Total Population | Observed | Expected | +------------------+----------+----------+ | 2000 | 42 | 32.5 | | …
9 r  chi-squared  excel 

1
Kann Bootstrap-Resampling verwendet werden, um ein Konfidenzintervall für die Varianz eines Datensatzes zu berechnen?
Ich weiß, dass, wenn Sie mehrmals aus einem Datensatz eine neue Stichprobe erstellen und jedes Mal den Mittelwert berechnen, diese Mittelwerte einer Normalverteilung (durch die CLT) folgen. Auf diese Weise können Sie ein Konfidenzintervall für den Mittelwert des Datensatzes berechnen, ohne Annahmen über die Wahrscheinlichkeitsverteilung des Datensatzes zu treffen. Ich …

1
Anwenden der Gratregression für ein unterbestimmtes Gleichungssystem?
Wenn , kann das Problem der kleinsten Quadrate, das dem Wert von eine sphärische Beschränkung auferlegt , als für ein überbestimmtes System. \ | \ cdot \ | _2 ist die euklidische Norm eines Vektors.y=Xβ+ey=Xβ+ey = X\beta + eδδ\deltaββ\betamin ∥y−Xβ∥22s.t. ∥β∥22≤δ2min⁡ ‖y−Xβ‖22s.t.⁡ ‖β‖22≤δ2\begin{equation} \begin{array} &\operatorname{min}\ \| y - X\beta \|^2_2 …


1
Erwartung der Summe von K Zahlen ohne Ersatz
Gegeben sind Zahlen, bei denen der Wert jeder Zahl unterschiedlich ist, bezeichnet als , und die Wahrscheinlichkeit, jede Zahl auszuwählen, ist .nnnv1,v2,...,vnv1,v2,...,vnv_1, v_2, ..., v_np1,p2,...,pnp1,p2,...,pnp_1, p_2, ..., p_n Wenn ich nun Zahlen basierend auf den gegebenen Wahrscheinlichkeiten auswähle , wobei , wie hoch ist die Erwartung der Summe dieser Zahlen? …



1
Dateneinrichtung für Unterschiede
Welches Setup ist für einen Unterschied im Differenzregressionsmodell mit geeignet? Yist=α+γs∗T+λdt+δ∗(T∗dt)+ϵistYist=α+γs∗T+λdt+δ∗(T∗dt)+ϵistY_{ist} = \alpha +\gamma_s*T + \lambda d_t + \delta*(T*d_t)+ \epsilon_{ist} wobei T ein Dummy ist, der gleich 1 ist, wenn die Beobachtung aus der Behandlungsgruppe stammt, und d ein Dummy ist, der in dem Zeitraum nach dem Auftreten der Behandlung …

2
Welche Bedeutung hat die Darstellung des Simplex als Dreiecksfläche in der Dirichlet-Verteilung?
Ich lese aus einem Buch, in dem die Dirchilet-Distribution vorgestellt wird, und präsentiere dann Zahlen darüber. Aber ich konnte diese Zahlen nicht wirklich verstehen. Ich habe die Figur hier unten angehängt. Was ich nicht verstehe, sind die Bedeutungen der Dreiecke. Wenn Sie eine Funktion von 2 Variablen zeichnen möchten, nehmen …


2
Kopplung von Zeitreiheninformationen aus Quellen mit mehreren räumlichen Auflösungen / Skalen
Ich habe viele Satelliten-Rasterbilder von verschiedenen Sensoren zur Verfügung. Von diesen haben die gröberen eine sehr reichliche zeitliche Auflösung. Die Raster mit mittlerer Auflösung haben tendenziell weniger Erwerbsdaten, es sind jedoch noch einige Informationen verfügbar. Die feineren Auflösungen haben eine sehr niedrige zeitliche Auflösung und umfassen 2 bis 6 beobachtete …

1
Testen Sie, ob zwei Stichproben von Binomialverteilungen mit demselben p übereinstimmen
Angenommen, ich habe getan: p 1 k 1n1n1n_1 unabhängige Versuche mit einer unbekannten Erfolgsrate und beobachteten Erfolgen.p1p1p_1k1k1k_1 n2n2n_2 unabhängige Versuche mit unbekannter Erfolgsrate und beobachteten Erfolgen.k 2p2p2p_2k2k2k_2 Wenn jetzt aber immer noch unbekannt, ist die Wahrscheinlichkeit , für ein gegebenes (oder umgekehrt zu beobachten, proportional zu \ int_0 ^ 1 …

1
Korrelationskoeffizienten für geordnete Daten: Kendalls Tau gegen Polychoric gegen Spearmans Rho
Es scheint, als würden sich Forscher bei der Verwaltung geordneter Messungen normalerweise mit der polychromen Korrelation befassen . (Zum Beispiel zum Erstellen einer Matrix vor der Faktoranalyse.) Warum? Der Kendall Tau- Rangkorrelationskoeffizient und der Spearman-Rangkorrelationskoeffizient eignen sich auch für geordnete Daten. Alle Punkte 'pro' und 'contra' für diese Korrelationskoeffizienten sind …

2
Bevölkerungsstabilitätsindex - Division durch Null
Der Populationsstabilitätsindex quantifiziert die Änderung einer Verteilung einer Variablen durch Vergleichen von Datenstichproben in zwei Zeiträumen. Es wird sehr häufig verwendet, um Verschiebungen in Punktzahlen zu messen. Es wird wie folgt berechnet: 1) Die Probe aus der Basisperiode wird diskretisiert. Normalerweise wird es in Dezile unterteilt. 2) Die Stichprobe aus …

1
Können zufällige Wälder viel besser abschneiden als der Testfehler von 2,8% bei MNIST?
Ich habe keine Literatur zur Anwendung von Random Forests auf MNIST, CIFAR, STL-10 usw. gefunden, daher dachte ich, ich würde sie selbst mit dem permutationsinvarianten MNIST ausprobieren. In R habe ich versucht: randomForest(train$x, factor(train$y), test$x, factor(test$y), ntree=500) Dies lief 2 Stunden und ergab einen Testfehler von 2,8%. Ich habe auch …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.