Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Wie wird die Softmax-Einheit abgeleitet und was bedeutet dies?
Ich versuche zu verstehen, warum die Softmax-Funktion als solche definiert ist: ezjΣK.k = 1ezk= σ( z)ezjΣk=1Kezk=σ(z)\frac{e^{z_{j}}} {\Sigma^{K}_{k=1}{e^{z_{k}}}} = \sigma(z) Ich verstehe, wie dies die Daten normalisiert und richtig auf einen bestimmten Bereich (0, 1) abbildet, aber der Unterschied zwischen den Gewichtswahrscheinlichkeiten variiert eher exponentiell als linear. Gibt es einen Grund, …

2
Alternative Begriffe zu den richtigen Bewertungsregeln und Verwendung von Bewertungsregeln zur Bewertung von Modellen
Eine Bewertungsregel ist ein Mittel zur Bewertung der Einschätzung eines Agenten hinsichtlich der mit einem kategorialen Ereignis verbundenen Wahrscheinlichkeiten bei einem (kategorialen) Ergebnis des Ereignisses. Abhängig von der Vermutung und dem beobachteten Ergebnis gibt die Bewertungsregel dem Agenten eine Punktzahl (eine reelle Zahl). Eine Bewertungsregel soll Punktzahlen so zuweisen, dass …

1
Wahrscheinlichkeit eines aufeinanderfolgenden Wertepaares
Lets X.= ( x1, x2, . . . x20)X=(x1,x2,...x20)X=(x_1, x_2,...x_{20}) , wo xich∼ N.( 0 , 1 )xi∼N(0,1)x_i\sim N(0,1) und xich, xjxi,xjx_i, x_j unabhängig sind ∀ i ≠ j∀i≠j\forall i\neq j . Wie groß ist die Wahrscheinlichkeit, eine Stichprobe zu erhalten, X.XXbei der mindestens zwei aufeinanderfolgende Werte xichxix_i und xi …


1
Höhe einer Normalverteilungskurve
Für eine glockenförmige Normalverteilungskurve hätte man gedacht, dass die Höhe einen idealen Wert haben sollte. Die Kenntnis dieses Wertes kann ein schneller Indikator sein, um zu überprüfen, ob die Daten normal verteilt sind. Ich konnte jedoch seinen formalen Wert nicht finden. An den meisten Stellen wird die Form angezeigt, nicht …


1
Was genau macht ein zufälliger Spaziergang?
Um ehrlich zu sein, habe ich viele Websites und Antworten zu dieser Frage gelesen und keine hat sie in einfachen Worten erklärt, die verständlich sind. Ich möchte verstehen, was ein zufälliger Spaziergang bewirkt und wie er für die Gen-Set-Anreicherungsanalyse verwendet werden kann. Es gibt hier ein veröffentlichtes Papier http://www.ncbi.nlm.nih.gov/pmc/articles/PMC3205944/, aber …

1
Optimale Anzahl von Behältern im Histogramm nach der Freedman-Diaconis-Regel: Differenz zwischen theoretischer Rate und tatsächlicher Anzahl
Wikipedia berichtet, dass nach der Freedman- und Diaconis-Regel die optimale Anzahl von Behältern in einem Histogramm wachsen solltekkk k ∼ n1 / 3k∼n1/3k\sim n^{1/3} Dabei ist die Stichprobengröße.nnn Wenn Sie sich jedoch die nclass.FDFunktion in R ansehen , die diese Regel implementiert, zumindest mit Gaußschen Daten, und wenn , scheint …

1
Probleme mit der Vorhersage von Zeitreihen
Ich habe eine Frage zur Modellierung von Zeitreihen in R. Meine Daten bestehen aus der folgenden Matrix: 1 0.03333333 0.01111111 0.9555556 2 0.03810624 0.02309469 0.9387991 3 0.00000000 0.03846154 0.9615385 4 0.03776683 0.03119869 0.9310345 5 0.06606607 0.01201201 0.9219219 6 0.03900325 0.02058505 0.9404117 7 0.03125000 0.01562500 0.9531250 8 0.00000000 0.00000000 1.0000000 9 …

1
Was ist das Minimum von über alle kontinuierlichen unimodalen Verteilungen in einem begrenzten Intervall ?
Alle Verteilungen in einem begrenzten Intervall erfüllen:[0,1][0,1][0,1] σ2≤μ(1−μ)σ2≤μ(1−μ)\sigma^2 \le \mu (1-\mu) Dabei ist der Mittelwert und die Varianz.μμ\muσ2σ2\sigma^2 Nehmen wir nun an, dass die Verteilung unimodal ist, in dem Sinne, dass sie höchstens ein lokales Maximum hat. Was ist der Mindestwert, den das folgende Verhältnis haben kann: μ(1−μ)σ2?μ(1−μ)σ2?\frac{\mu (1-\mu)}{\sigma^2}?
8 variance 



3
Frühes Stoppen gegen Kreuzvalidierung
Ich benutze derzeit ein frühes Anhalten in meiner Arbeit, um eine Überanpassung zu verhindern. Speziell diejenigen, die aus dem frühen Stoppen stammen, aber wann? . Ich möchte jetzt mit anderen Klassifizierungsalgorithmen vergleichen, bei denen es den Anschein hat, dass eine 10-fache Kreuzvalidierung weit verbreitet ist. Ich bin jedoch verwirrt darüber, …

2
Muss ein Vorhersageintervall den Mittelwert enthalten?
Ich habe ein großes Problem mit einem konzeptionellen Problem, das ich mir ausgedacht habe. Angenommen, ein Unternehmen hat eine stark verzerrte Verteilung . Etwas Ähnliches wie ein Exponential oder Lognormal nur extremer. Stellen Sie sich nun vor, die Verteilung sei so verzerrt, dass der Mittelwert der Verteilung höher ist als …

1
So berechnen Sie dfbetas manuell
Ich versuche zu replizieren, was die Funktion dfbetas()in R tut . dfbeta() ist kein Problem ... Hier ist eine Reihe von Vektoren: x <- c(0.512, 0.166, -0.142, -0.614, 12.72) y <- c(0.545, -0.02, -0.137, -0.751, 1.344) Wenn ich zwei Regressionsmodelle wie folgt anpasse: fit1 <- lm(y ~ x) fit2 <- …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.