Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

4
Grundwahrheitsdefinition
Ich habe zwei Bedeutungen gefunden, wie "Grundwahrheit" beim maschinellen Lernen verwendet wird: Etwas, von dem angenommen werden kann, dass es wahr ist Etwas, das zuvor als wahr bestätigt wurde Obwohl im Detail ähnlich, können sich die beiden unterscheiden. Vielleicht werden sie synonym verwendet, aber ein Zitat wäre für jede Bedeutung …

1
Geschlossene Form der Funktion in Bezug den natürlichen Parameter für die logarithmische Reihe Verteilung?
Während ich hier eine andere Frage beantwortete , erwähnte ich die logarithmische Reihenverteilung als mögliches Modell für Arten pro Gattung. Als ich mir die PMF ansah, als ich antwortete, stellte ich fest, dass es sich um eine exponentielle Familie handelte (eine Tatsache, die mir vorher nicht bewusst war). Die Parametrisierung …

3
Bland-Altman-Diagramm (Tukey Mean-Difference) für unterschiedliche Skalen
Ich finde, dass Bland-Altman-Diagramme zum Vergleich zweier Methoden bei der Beurteilung der Übereinstimmung äußerst nützlich sind. Ich bin jedoch gespannt, ob es eine ähnliche Methode oder Transformation gibt, die verwendet werden kann, wenn die Skalen der beiden Methoden nicht identisch sind, aber dennoch dasselbe zugrunde liegende Phänomen messen. Zum Beispiel …


2
Verallgemeinerung des Korrelationsbegriffs für
Die Pearson-Korrelation wird über Varianz und Kovarianz definiert und funktioniert daher nicht, wenn sie auf stabile Verteilungen mit angewendet wird . Gibt es eine Möglichkeit, den Begriff der Korrelation mit solchen Verteilungen zu verallgemeinern, z. B. durch irgendeine Form der Renormierung?αα\alphaα≠2α≠2\alpha \neq 2 Beispiel: ρgeneralised(X,Y):=limk→∞ρ(Xk,Yk)ρgeneralised(X,Y):=limk→∞ρ(Xk,Yk) \rho_{generalised}(X, Y) := \lim_{k \to …

2
lsmeans (R): Passen Sie mehrere Vergleiche mit Interaktionstermen an
Ich habe ein lsmeans-Problem in R. Ich möchte eine Post-hoc-Analyse einer Interaktion durchführen, ähnlich den Beispielen in der lsmeans-Dokumentation. Ich bin verwirrt darüber, dass die p-Werte gleich sind, ob ich sie benutze warp.lm <- lm(breaks ~ wool * tension, data = warpbreaks) (EIN): lsmeans(warp.lm, list(pairwise ~ wool|tension, pairwise ~ tension|wool)) …

1
Vorverarbeitung von E-Mail- und IP-Zeichenfolgen für die Klassifizierungsaufgabe
Ich bin relativ neu auf dem Gebiet der Datenwissenschaft, entschuldigen Sie meine Anfängerfrage. Welche Methoden stehen zur Konvertierung emailund ipin Vektoren für Online-Lernalgorithmen zur Verfügung? Das Klassifizierungsziel ist die Bewertung von Betrug / Nicht-Betrugstransaktionen. Zur weiteren Erläuterung: Die anderen relevanten Felder sind kategorisch und wurden vektorisiert.


2
Protokoll des Durchschnitts v. Durchschnitt des Protokolls
Ich erstelle einen Datensatz mit monatlichen Durchschnittswerten basierend auf täglichen Daten. Dieser Datensatz wird für die Standardregressionsanalyse verwendet. Ich gehe davon aus, dass ich die abhängige Variable transformieren möchte, die eine ungefähr logarithmische Normalverteilung aufweist. Meine Frage ist, ob es angemessener ist, die Daten vor oder nach dem monatlichen Durchschnitt …

1
Wie verwende ich den Gewichtsvektor von SVM und die logistische Regression für die Wichtigkeit von Merkmalen?
Ich habe einen SVM- und logistischen Regressionsklassifikator für die binäre Klassifizierung in meinem Datensatz trainiert. Beide Klassifikatoren liefern einen Gewichtsvektor, der der Größe der Anzahl von Merkmalen entspricht. Ich kann diesen Gewichtsvektor verwenden, um die 10 wichtigsten Merkmale auszuwählen. Dafür habe ich die Gewichte durch einen Permutationstest in T-Scores umgewandelt. …

1
Erwarteter Wert des Produkts nicht unabhängiger Bernoulli-Zufallsvariablen (Korrelationen sind bekannt)
Ich habe eine Frage zum Ermitteln der gemeinsamen Wahrscheinlichkeitsverteilung für Bernoulli-Zufallsvariablen gestellt, unter Berücksichtigung des erwarteten Werts für jede Variable ( und ihrer Korrelationen ( ). Jemand hat mich freundlicherweise auf dieses Papier verwiesen , und es war wirklich hilfreich, aber ich kann immer noch keinen letzten Punkt herausfinden:NNNE[Xi]=pi)E[Xi]=pi)E[X_i]=p_i)ρ12,ρ13,…ρ12,ρ13,…\rho_{12},\rho_{13},\dots Vorausgesetzt, …

2
Wie kann die schrittweise logistische Regression überprüft werden?
Ich habe ein konzeptionelles Problem mit dem Verständnis, wie eine schrittweise logistische Regression validiert werden kann. Jedes Mal, wenn der Trainingssatz geteilt wird, ist es sehr wahrscheinlich, dass unterschiedliche Merkmale basierend auf den Kriterien für Penter und Premove ausgewählt werden. Sollte ich jedes Mal eine Kreuzvalidierung mit einem anderen gewählten …


1
Summe der quadratischen Poisson-Wahrscheinlichkeitsmassen
Es sei die Wahrscheinlichkeitsmassen einer Poisson-Verteilung mit dem Parameter . Ich suche die Summe ihrer Quadrate, als Funktion von . Mit anderen Worten, ich interessiere mich für (das Exponential von) der Renyi-Entropie zweiter Ordnung einer Poisson-Verteilung.(pk)k = 0 , … , ∞(pk)k=0,…,∞(p_k)_{k=0, \dots, \infty}λλ\lambda∑k = 0∞p2k,∑k=0∞pk2,\sum_{k=0}^\infty p_k^2,λλ\lambda Hintergrund: Ich möchte …

1
Zitat für ML vs. REML
Kurze Frage: Kann mir jemand ein Zitat geben, mit dem ich die Verwendung von ML bei Modellvergleichen rechtfertigen kann? Hintergrund: Ich passe einige mehrstufige Modelle mit lme4 in R an und führe eine Reihe von Modellvergleichen durch. Ein Rezensent sagte mir, ich sollte REML (niemals ML) nur verwenden, wenn ein …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.