Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Zur kophenetischen Korrelation für das Dendrogramm-Clustering
Betrachten Sie den Kontext eines Dendrogramm-Clusters. Nennen wir ursprüngliche Unterschiede die Abstände zwischen den Individuen. Nach der Erstellung des Dendrogramms definieren wir die kophenetische Unähnlichkeit zwischen zwei Individuen als den Abstand zwischen den Clustern, zu denen diese Individuen gehören. Einige Leute denken, dass die Korrelation zwischen den ursprünglichen Unähnlichkeiten und …


4
Anpassen der logarithmischen Normalverteilung in R vs. SciPy
Ich habe ein logarithmisches Normalmodell mit R mit einem Datensatz versehen. Die resultierenden Parameter waren: meanlog = 4.2991610 sdlog = 0.5511349 Ich möchte dieses Modell auf Scipy übertragen, das ich noch nie benutzt habe. Mit Scipy konnte ich eine Form und einen Maßstab von 1 und 3.1626716539637488e + 90 erhalten …
10 r  python  numpy  scipy 

3
Wie modelliere ich eine voreingenommene Münze mit zeitlich variierender Voreingenommenheit?
Modelle von voreingenommenen Münzen haben typischerweise einen Parameter . Eine Möglichkeit, aus einer Reihe von Ziehungen abzuschätzen, besteht darin, einen Beta-Prior zu verwenden und die posteriore Verteilung mit binomialer Wahrscheinlichkeit zu berechnen.θ=P(Head|θ)θ=P(Head|θ)\theta = P(\text{Head} | \theta)θθ\theta In meinen Einstellungen ändern sich meine Münzeigenschaften aufgrund eines seltsamen physikalischen Prozesses langsam und …




1
Wie verwenden Sie den EM-Algorithmus, um MLEs für eine latente Variablenformulierung eines Poisson-Modells mit Null-Inflation zu berechnen?
Das auf Null aufgeblasene Poisson-Regressionsmodell wird für eine Stichprobe durch und es wird ferner angenommen, dass die Parameter und erfüllt sindY i = { 0 mit der Wahrscheinlichkeit p i + ( 1 - p i ) e - λ i k mit der Wahrscheinlichkeit ( 1 - p i …

3
Was ist die effizienteste Methode zum Trainieren von Daten mit dem geringsten Speicher?
Dies sind meine Trainingsdaten: 200.000 Beispiele x 10.000 Funktionen. Meine Trainingsdatenmatrix ist also - 200.000 x 10.000. Ich habe es geschafft, dies in einer flachen Datei ohne Speicherprobleme zu speichern, indem ich jeden Datensatz einzeln (ein Beispiel nach dem anderen) gespeichert habe, während ich die Funktionen für jedes Beispiel generierte. …

2
Erkennen von Clustern „ähnlicher“ Quellcodes
Angenommen, ich habe 400 Studenten (das ist an einer großen Universität), die ein Informatikprojekt durchführen müssen und die alleine arbeiten müssen (keine Gruppe von Studenten). Ein Beispiel für ein Projekt könnte sein, "einen schnellen Fourier-Transformations-Algorithmus in fortran zu implementieren" (ich weiß, das klingt nicht sexy, aber das macht meine Frage …

2
Logistische Regression für mehrere Klassen
Ich habe das Modell für die logistische Regression für mehrere Klassen erhalten, das von gegeben ist P(Y=j|X(i))=exp(θTjX(i))1+∑km=1exp(θTmX(i))P(Y=j|X(i))=exp⁡(θjTX(i))1+∑m=1kexp⁡(θmTX(i)) P(Y=j|X^{(i)}) = \frac{\exp(\theta_j^TX^{(i)})}{1+ \sum_{m=1}^{k}\exp(\theta_m^T X^{(i)})} Dabei ist k die Anzahl der Klassen. Theta ist der zu schätzende Parameter. j ist die j-te Klasse. Xi sind die Trainingsdaten Eine Sache, die ich nicht verstanden …

5
Clustering als Mittel zur Aufteilung von Daten für die logistische Regression
Ich versuche, den Erfolg oder Misserfolg von Schülern anhand einiger Funktionen mit einem logistischen Regressionsmodell vorherzusagen. Um die Leistung des Modells zu verbessern, habe ich bereits darüber nachgedacht, die Schüler anhand offensichtlicher Unterschiede in verschiedene Gruppen aufzuteilen und für jede Gruppe separate Modelle zu erstellen. Aber ich denke, es könnte …


1
Asynchrone (unregelmäßige) Zeitreihenanalyse
Ich versuche, die Vorlaufverzögerung zwischen Zeitreihen zweier Aktienkurse zu analysieren. In der regelmäßigen Zeitreihenanalyse können wir Cross Correlaton, VECM (Granger Causality) durchführen. Wie geht man jedoch in unregelmäßig verteilten Zeitreihen damit um? Die Hypothese ist, dass eines der Instrumente das andere führt. Ich habe Daten für beide Symbole in Mikrosekunden. …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.