Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


3
Verschiedene Methoden zur Erstellung eines Konfidenzintervalls für das Odds Ratio aus der logistischen Regression
Ich studiere, wie aus den in der logistischen Regression erhaltenen Koeffizienten ein Konfidenzintervall von 95% für das Odds Ratio erstellt wird. Also, unter Berücksichtigung des logistischen Regressionsmodells, Log( p1 - p) =α+βxLog⁡(p1-p)=α+βx \log\left(\frac{p}{1 - p}\right) = \alpha + \beta x \newcommand{\var}{\rm Var} \newcommand{\se}{\rm SE} so dass für die Kontrollgruppe und …

2
Gilt das "No Free Lunch Theorem" für allgemeine statistische Tests?
Eine Frau, für die ich arbeitete, bat mich, eine Einweg-ANOVA für einige Daten durchzuführen. Ich antwortete, dass es sich bei den Daten um wiederholte Messdaten (Zeitreihen) handele und dass die Annahme der Unabhängigkeit verletzt sei. Sie antwortete, ich solle mich nicht um die Annahmen kümmern, sondern nur den Test machen …

1
Was ist der Unterschied zwischen GINI- und AUC-Kurveninterpretation?
Wir haben die GINI-Kurve mit dem Lift erstellt, der mithilfe des Prozentsatzes von Gut und Schlecht für die Scorecard-Modellierung erstellt wurde. Was ich jedoch untersucht habe, ist, dass die ROC-Kurve unter Verwendung der Verwirrungsmatrix mit der Spezifität (1 - True Negative) als X-Achse und der Empfindlichkeit (True Positive) als Y-Achse …
12 roc  gini 

2
Begründung für Konjugat vor?
Gibt es neben der Benutzerfreundlichkeit eine erkenntnistheoretische Rechtfertigung (mathematisch, philosophisch, heuristisch usw.) für die Verwendung von konjugierten Prioren? Oder ist es meist nur so, dass es normalerweise eine gute Annäherung ist und die Dinge viel einfacher macht?


2
Wie wandle ich negative Werte in Logarithmen um?
Ich würde gerne wissen, wie man negative Werte umwandelt Log(), da ich heteroskedastische Daten habe. Ich habe gelesen, dass es mit der Formel funktioniert, Log(x+1)aber dies funktioniert nicht mit meiner Datenbank und ich erhalte weiterhin NaNs als Ergebnis. Ich erhalte zB die folgende Warnmeldung (ich habe meine Datenbank nicht vollständig …
12 r  logarithm 



1
Warum verwenden Menschen keine tieferen RBFs oder RBFs in Kombination mit MLP?
Bei der Betrachtung der Neuronalen Netze mit radialer Basisfunktion ist mir aufgefallen, dass immer nur die Verwendung einer verborgenen Schicht empfohlen wird, während bei neuronalen Netzen mit mehrschichtigen Perzeptronen mehr Schichten als besser angesehen werden. Angesichts der Tatsache, dass RBF-Netzwerke mit der Version der Rückübertragung trainiert werden können, gibt es …


1
Automatische Keyword-Extraktion: Verwenden von Cosinus-Ähnlichkeiten als Features
Ich habe eine Dokument-Term-Matrix und möchte jetzt mit einer überwachten Lernmethode (SVM, Naive Bayes, ...) Schlüsselwörter für jedes Dokument extrahieren. In diesem Modell verwende ich bereits Tf-idf, Pos-Tag, ...MMM Aber jetzt wundere ich mich über die Zusammenhänge. Ich habe eine Matrix mit den Kosinusähnlichkeiten zwischen den Begriffen.CCC Gibt es eine …

1
Wann sollte ich mir Sorgen um das Jeffreys-Lindley-Paradoxon bei der Wahl des Bayes'schen Modells machen?
Ich betrachte einen großen (aber begrenzten) Raum von Modellen unterschiedlicher Komplexität, die ich mit RJMCMC erforsche . Das Voranstellen des Parametervektors für jedes Modell ist ziemlich informativ. In welchen Fällen (wenn überhaupt) sollte ich mir Sorgen machen, dass das Jeffreys-Lindley-Paradoxon einfachere Modelle bevorzugt, wenn eines der komplexeren Modelle besser geeignet …

2
Warum wird bei der Textsprachenidentifikation n-Gramm anstelle von Wörtern verwendet?
In zwei weit verbreiteten Spracherkennungsbibliotheken, Compact Language Detector 2 für C ++ und Language Detector für Java, verwendeten beide (zeichenbasierte) n-Gramme, um Textfunktionen zu extrahieren. Warum wird ein Wortsack (einzelnes Wort / Wörterbuch) nicht verwendet, und was sind die Vor- und Nachteile von Wortsack und n-Gramm? Was sind auch einige …

1
Ungefähre Verteilung des Produkts von N normal iid? Sonderfall μ≈0
Gegeben IId X n ≈ N ( μ X , σ 2 X ) und μ X ≈ 0 , sucht nach:N≥30N≥30N\geq30Xn≈N(μX,σ2X)Xn≈N(μX,σX2)X_n\approx\mathcal{N}(\mu_X,\sigma_X^2)μX≈0μX≈0\mu_X \approx 0 genaue geschlossene Formverteilungsnäherung von YN=∏1NXnYN=∏1NXnY_N=\prod\limits_{1}^{N}{X_n} asymptotisch ( exponentiell) ?) Approximation des gleichen Produkts Dies ist ein Sonderfall einer allgemeineren Frage .μX≈0μX≈0\mu_X \approx 0

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.