Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


2
Anzahl der Fächer bei der Berechnung der gegenseitigen Information
Ich möchte die Beziehung zwischen zwei Variablen, A und B, unter Verwendung gegenseitiger Informationen quantifizieren. Die Berechnung erfolgt durch Gruppieren der Beobachtungen (siehe Beispiel-Python-Code unten). Welche Faktoren bestimmen jedoch, welche Anzahl von Behältern angemessen ist? Ich brauche eine schnelle Berechnung, damit ich nicht einfach viele Behälter verwenden kann, um auf …


1
Verwendung des Medians zur Berechnung der Varianz
Ich habe eine 1-D-Zufallsvariable, die extrem verzerrt ist. Um diese Verteilung zu normalisieren, möchte ich eher den Median als den Mittelwert verwenden. Meine Frage lautet: Kann ich die Varianz der Verteilung anhand des Medians in der Formel anstelle des Mittelwerts berechnen? dh kann ich ersetzen V a r (X.) = …
10 variance  mean  median 

1
Variational Bayes kombiniert mit Monte Carlo
Ich lese über Variations-Bayes nach, und so wie ich es verstehe, kommt es auf die Idee an, dass Sie approximieren (wobei die latenten Variablen Ihres Modells undp ( z∣ x )p(z∣x)p(z\mid x)zzzxxx die beobachteten Daten sind) mit einer Funktion approximieren , wobei angenommen wird, dass q als q i ( …

1
Ableitung des Kreuzentropieverlusts in word2vec
Ich versuche, mich durch den ersten Problemsatz des cs224d Online-Kurskurses in Stanford zu arbeiten, und ich habe einige Probleme mit Problem 3A: Wenn wir das Skip-Gramm-word2vec-Modell mit der Softmax-Vorhersagefunktion und der Cross-Entropy-Loss-Funktion verwenden, haben wir wollen die Gradienten in Bezug auf die vorhergesagten Wortvektoren berechnen. Also gegeben die Softmax-Funktion: wi^=Pr(wordi∣r^,w)=exp(wTir^)∑|V|jexp(wTjr^)wi^=Pr(wordi∣r^,w)=exp⁡(wiTr^)∑j|V|exp(wjTr^) …

2
Überlebensraten-Trends in Fall-Kontroll-Studien
Ich habe einen Artikel eingereicht, der aufgrund der unsachgemäßen Durchführung der Überlebensanalyse abgelehnt wurde. Der Schiedsrichter hinterließ keine anderen Details oder Erklärungen als: "Die Überlebensanalyse von Zeittrends erfordert differenziertere Zensurmethoden." Die Frage: Wurde das übermäßige Todesrisiko bei Rauchern in den letzten Jahrzehnten verringert? Daten: 25.000 Raucher in Deutschland. Sie wurden …

1
Ist diese Interpretation der Sparsity korrekt?
Laut der Dokumentation der removeSparseTermsFunktion aus dem tmPaket bedeutet dies Sparsamkeit: A term-document matrix where those terms from x are removed which have at least a sparse percentage of empty (i.e., terms occurring 0 times in a document) elements. I.e., the resulting matrix contains only terms with a sparse factor …

6
Wie wird die Notation gelesen?
Wie wird die Notation gelesen? Ist es folgt einer Normalverteilung? Oder ist eine Normalverteilung? Oder vielleicht ist ungefähr normal.X X X.X.∼ N.( μ , σ2)X∼N(μ,σ2)X\sim N(\mu,\sigma^2)X.XX X.XX X.XX Was ist, wenn mehrere Variablen derselben Verteilung folgen (oder was auch immer die Wörter sind)? Wie ist es geschrieben?

3
Identifizieren gefilterter Features nach Feature-Auswahl mit scikit learn
Hier ist mein Code für die Feature-Auswahlmethode in Python: from sklearn.svm import LinearSVC from sklearn.datasets import load_iris iris = load_iris() X, y = iris.data, iris.target X.shape (150, 4) X_new = LinearSVC(C=0.01, penalty="l1", dual=False).fit_transform(X, y) X_new.shape (150, 3) Aber nachdem ich neues X (abhängige Variable - X_new) erhalten habe, woher weiß …



1
Testen der Sharpe Ratio-Signifikanz
Was ist der richtige Weg, um die Bedeutung von Sharpe Ratios oder Information Ratios zu testen? Die Sharpe Ratios basieren auf verschiedenen Aktienindizes und können variable Rückblickperioden haben. Eine Lösung, die ich beschrieben habe, wendet einfach einen Student-T-Test an, wobei der df auf die Länge des Rückblickzeitraums eingestellt ist. Ich …

2
Was ist Bucketization?
Ich habe ohne Erfolg eine klare Erklärung für "Bucketization" im maschinellen Lernen gefunden. Was ich bisher verstehe, ist, dass die Bucketisierung der Quantisierung in der digitalen Signalverarbeitung ähnelt, bei der ein Bereich kontinuierlicher Werte durch einen diskreten Wert ersetzt wird. Ist das richtig? Was sind die Vor- und Nachteile (abgesehen …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.