Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Was bedeutet das statistisch, wenn
Es ist kein Fall aus der realen Welt, aber nehmen wir an, wir haben Beobachtungen und Variablen, da , wenn die Entwurfsmatrix ist, eine quadratische Matrix ist. Was bedeutet das statistisch? , wenn nicht existiert?nnnkkkk = n - 1k=n- -1k= n - 1 X.X.X(X.'X.)(X.'X.)(X'X)(X.'X.)- 1(X.'X.)- -1(X'X)^{-1}

2
Zufällige Waldregression und Trendzeitreihen
Ich vergleiche ein zufälliges Waldmodell mit einem GLS-Modell unter Verwendung einer univariaten Zeitreihe, die einen deterministischen linearen Trend aufweist. Ich werde dem GLS-Modell eine lineare Zeittrend-Kovariate (unter anderen Prädiktoren) hinzufügen, um den sich ändernden Trend zu berücksichtigen. Um in meinem Vergleich konsistent zu sein, hatte ich gehofft, diesen Prädiktor auch …

2
Die Regressionsvariable hat für eine Kategorie keine Bedeutung
Für eine (binäre) logistische Regression habe ich zwei IVs in meinem Modell. Die erste IV hat drei Kategorien (eine Person, zwei Personen, drei oder mehr Personen). Die zweite Variable ist binär (Kommunikation existiert vs. nicht existiert). Für die erste Kategorie hat die zweite IV keine Bedeutung, für die zweite und …

1
Wie kann ein Algorithmus zur Vorhersage von Zeitreihen am besten bewertet werden?
Was ist die beste Vorgehensweise zum Trainieren und Bewerten eines Vorhersagealgorithmus für eine Zeitreihe? Zum Lernen von Algorithmen, die im Batch-Modus trainiert werden, kann ein naiver Programmierer den Rohdatensatz [(sample, expected prediction),...]direkt an die train()Methode des Algorithmus weitergeben . Dies zeigt normalerweise eine künstlich hohe Erfolgsrate, da der Algorithmus effektiv …



2
Bedeutet ein niedrigerer p-Wert, dass der Test eine höhere Leistung hat?
Allgemeine Version der Frage: Wenn Sie zwei statistische Tests mit unterschiedlichen Annahmen für dieselben Daten vergleichen und einer einen niedrigeren p-Wert als der andere ergibt, bedeutet dies, dass er eine höhere Leistung hat? Biostatistik-Version: Vergleich der SKAT- und SKAT-O-Tests ( http://www.ncbi.nlm.nih.gov/pmc/articles/PMC3440237/pdf/kxs014.pdf ). SKAT-O soll mehr Leistung haben, wenn die getesteten …
7 p-value  power 

2
Zeigen Sie, dass eine Skalenmischung von Normalen ein Potenzexponent ist
Ich versuche zu zeigen, dass eine Skalenmischung von Normalen eine Laplace-Verteilung ergibt. Ich bin an dem Punkt angelangt, an dem ich sollte gleich einem Laplace sein. Mir ist unklar, wie ich das Integral lösen soll.∫N(0,τ)×Ga(τ;1,λ22)dτ∫N.(0,τ)×Gein(τ;;1,λ22)dτ\int N(0,\tau)\times Ga(\tau\:;\:1,\frac{\lambda^{2}}{2}) \:d\tau Alternativ habe ich eine Ableitung des Umfangs der Mischung Normale gesehen als …

1
Kann ich eine Cholesky-Zerlegung aus der Umkehrung einer Matrix erhalten?
Ich habe die Umkehrung einer riesigen Kovarianzmatrix, aus der ich zufällige Instanzen ziehen möchte. Ich weiß, wie das geht, indem ich eine Cholesky-Zerlegung in der Kovarianzmatrix durchführe und damit einen Vektor unabhängiger Gaußscher transformiere. Der einfache Prozess besteht also darin, die Riesenmatrix zu invertieren und dann die Cholesky-Zerlegung durchzuführen. Da …

1
Erwartung von
Ich versuche den erwarteten Wert von zu finden e−xe−x e^{-x} wann xx xist logarithmisch normal. Ich weiß das wennx∼N(μ,σ)x∼N(μ,σ) x \sim N(\mu, \sigma) dann E[ex]=eμ+12σ2E[ex]=eμ+12σ2 E[e^x] = e^{\mu + \frac{1}{2}\sigma^2} , die Erwartung einer logarithmischen Normalität. Ich versuche, die Erwartung des Exponenten des Negativs einer logarithmischen Normalen zu finden: E[e−ex]E[e−ex] …

2
Schätzung der maximalen Wahrscheinlichkeit von Infektionsmodellparametern
Ich verwende das Standardinfektionsmodell für einige Daten, mit denen ich arbeite. dS.= - βS.ichdS=−βSI dS = -\beta SI dich= βS.ich- γichdI=βSI−γI dI = \beta SI - \gamma I dR = γichdR=γI dR = \gamma I Wobei die Anzahl der anfälligen Probanden ist, die Infizierten und die Wiederhergestellten. Ich versuche verschiedene …


3
Unterschied zwischen Dummies mit festen Effekten und Schätzer für feste Effekte?
Ich begann über Panel-Regressionsmodelle zu lesen. Ich bin jedoch etwas verwirrt über die unterschiedlichen Modellspezifikationen im Modell mit festen Effekten: Bedeutet eine Regression des Panels mit festen Effekten immer, dass ich Dummy-Variablen für die Querschnitte einführe (z. B. für jedes Land in meiner Stichprobe) und dann z. B. eine OLS-Schätzung …

4
Friedmans Test ist sehr signifikant, aber seine Post-hoc-Vergleiche (SPSS) sind nicht signifikant
Ich habe einen nicht parametrischen Friedman-Test für meine Daten in SPSS 22 durchgeführt und die Null signifikant abgelehnt. Das würde bedeuten, dass unter den gepaarten Proben (in meinem Fall 3) mindestens zwei Proben mit ungleichen Verteilungen nachgewiesen werden sollten - eine ist tendenziell größer als die andere. Also, post hoc …

2
Lasso und statistische Signifikanz ausgewählter Variablen
Ich betrachte ein Regressionsmodell, bei dem eine sehr große Anzahl möglicher erklärender Variablen bewertet wird und schließlich eine kleine Anzahl über die Lasso-Methode der Variablenauswahl ausgewählt wird. Dasλλ\lambda Der Abstimmungsparameter im Lasso wird anhand der Leistung der Kreuzvalidierungsprognose ausgewählt, die ziemlich normal ist. Wenn ich jedoch die Liste der ausgewählten …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.