Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Likelihood Ratio für die Exponentialverteilung mit zwei Stichproben
Sei und zwei unabhängige Zufallsvariablen mit entsprechenden PDFs:XXXYYY f(x;θi)={1θie−x/θi0&lt;x&lt;∞,0&lt;θi&lt;∞0elsewheref(x;θi)={1θie−x/θi0&lt;x&lt;∞,0&lt;θi&lt;∞0elsewheref \left(x;\theta_i \right) =\begin{cases} \frac{1}{\theta_i} e^{-x/ {\theta_i}} \quad 0<x<\infty, 0<\theta_i< \infty \\ 0 \quad \text{elsewhere} \end{cases} für . Aus diesen Verteilungen werden zwei unabhängige Proben gezogen, um gegen der Größen und zu testen . Ich muss zeigen, dass LRT als Funktion einer …

1
Lasso zum negativen binomialen Regressionsmodell
Gibt es überhaupt eine Möglichkeit, LASSO mit negativer Binomialregression auf R durchzuführen? Ich führe eine negative binomiale Regression für meinen Datensatz durch, da die Daten zu verteilt sind, um eine Poisson-Regression zu erzwingen. Inzwischen stehe ich auch vor einem Multikollinearitätsproblem. Ich habe bereits versucht, glmnetmit zu arbeiten family = poisson, …

1
Erklärung der Zersetzung von Beverly Nelson
Kann jemand erklären, wie die Beveridge-Nelson-Zerlegung funktioniert? Bisher weiß ich nur, dass es Trendzyklen in nicht stationären Zeitreihendaten schätzt. Ich habe mir mehrere Zeitschriftenartikel angesehen und bin immer noch verwirrt darüber, wie es funktioniert. Http://research.economics.unsw.edu.au/jmorley/bn.pdf

2
Warum wird bei der Clustering-Methode (K-Mittelwert) nur der Mittelwert verwendet?
Bei Clustering-Methoden wie K-means ist der euklidische Abstand die zu verwendende Metrik. Daher berechnen wir nur die Mittelwerte innerhalb jedes Clusters. Anschließend werden die Elemente anhand ihres Abstands zu jedem Mittelwert angepasst. Ich habe mich gefragt, warum die Gaußsche Funktion nicht als Metrik verwendet wird. Anstatt zu verwenden xi -mean(X), …

1
Erforderliche Anzahl von Permutationen für einen permutationsbasierten p-Wert
Wie viele Permutationen benötige ich, wenn ich einen permutationsbasierten ppp Wert mit dem Signifikanzniveau berechnen αα\alphamuss? Aus dem Artikel "Permutationstests zur Untersuchung der Klassifikatorleistung" , Seite 5: In der Praxis ist die Obergrenze 1 / ( 2 k- -- -√)1/.(2k)1/(2\sqrt{k})wird typischerweise verwendet, um die Anzahl von Proben zu bestimmen, die …


2
Ist die Bonferroni-Korrektur für einige abhängige Hypothesen zu antikonservativ / liberal?
Ich habe häufig gelesen, dass die Bonferroni-Korrektur auch für abhängige Hypothesen funktioniert. Ich glaube jedoch nicht, dass dies wahr ist, und ich habe ein Gegenbeispiel. Kann mir bitte jemand sagen (a) wo mein Fehler ist oder (b) ob ich diesbezüglich richtig bin. Einrichten des Zählerbeispiels Angenommen, wir testen zwei Hypothesen. …

1
Wie und warum würden sich MLPs für die Klassifizierung von MLPs für die Regression unterscheiden? Unterschiedliche Backpropagation- und Übertragungsfunktionen?
Ich verwende zwei 3-Schicht-Feedforward-Mehrschicht-Perzeptrone (MLPs). Mit den gleichen Eingabedaten (14 Eingangsneuronen) mache ich eine Klassifizierung (wahr / falsch) und eine Regression (wenn wahr, "wie viel") ¹. Bis jetzt habe ich faul Matlabs Patternnet bzw. Fitnet verwendet. Faul, weil ich mir nicht die Zeit genommen habe, wirklich zu verstehen, was los …



2
Chi-Quadrat-Test mit 0 erwarteten Werten
Meine Kontingenztabelle: heterozygous homozygous.minor homozygous.major observed 2 0 3 expected 0 0 5 Die erwartete Population besteht nur aus dem AA-Genotyp, aber in der beobachteten Population beobachten wir 2 AB-Genotypen. Um das Chi-Quadrat dafür zu berechnen, würde ich einfach die beiden Fälle ignorieren, in denen das erwartete = 0 ist? …

4
Kurtosis der erfundenen Verteilung
Schauen Sie sich das Bild unten an. Die blaue Linie zeigt das normale Standard-PDF an. Die rote Zone soll gleich der Summe der Grauzonen sein (Entschuldigung für das schreckliche Zeichnen). Ich frage mich, ob wir eine neue Verteilung mit höherem Peak erstellen können, indem wir Grauzonen an die Spitze (rote …

2
Ursache der Singularität in der Matrix für die Quantilregression
Ich führe Quantilregressionen in R mit dem Paket quantreg durch. Mein Datensatz enthält 12.328 Beobachtungen zwischen 0,12 und 330. Die Zeitpunkte für meine Daten sind nicht genau kontinuierlich. Alle Daten fallen in einen von wenigen Dutzend Fächern zwischen 73 und 397. Als ich mit der Funktion lm () eine lineare …
8 r  regression 

1
Abweichung gegen Pearson Passgenauigkeit
Ich versuche, ein Modell mit negativer Binomialregression (negatives Binomial-GLM) zu entwickeln. Ich habe eine relativ kleine Stichprobengröße (größer als 300) und die Daten sind nicht skaliert. Mir ist aufgefallen, dass es zwei Möglichkeiten gibt, die Anpassungsgüte zu messen - eine Abweichung und die Pearson-Statistik. Wie kann ich bestimmen, welches Maß …

2
Wahrscheinlichkeitsfunktion von abgeschnittenen Daten
Ich habe ein wenig Probleme, das Konzept und die Ableitung der Wahrscheinlichkeit von Datenkürzungen zu verstehen. Wenn ich zum Beispiel die Wahrscheinlichkeitsfunktion basierend auf einer Stichprobe aus einer Verteilung finden möchte, aber wenn ich eine Stichprobe aus der Verteilung nehme, beobachte ich die abgeschnittenen Werte (wobei es einen Grenzwert für …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.