Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

6
Wie gehe ich mit Zähldaten (kategorialen Daten) um, wenn sie in eine Rate konvertiert wurden?
Ich arbeite an Krankheitsinfektionsdaten und bin verwirrt, ob ich die Daten als "kategorisch" oder "kontinuierlich" behandeln soll. "Infektionszahl" Die Anzahl der in einem bestimmten Zeitraum gefundenen Infektionsfälle wird aus kategorialen Daten generiert (dh Anzahl der als "infiziert" gekennzeichneten Patienten). "Patientenbett Tage" Summe der Gesamtzahl der Tage, die alle Patienten auf …





1
Ausfall in der linearen Regression
Ich habe das Originalpapier über Dropout ( https://www.cs.toronto.edu/~hinton/absps/JMLRdropout.pdf ) gelesen und im Abschnitt über lineare Regression heißt es: E.R ∼ B e r n o u l l i ( p )[ ∥ y - ( R ∗ X.) w∥2]]E.R.∼B.ernÖullich(p)[‖y - -(R.∗X.)w‖2]]\mathbb{E}_{R\sim Bernoulli(p)}\left[\| y\ - (R*X)w\|^2\right] reduziert zu: ∥ y- …

2
Warum ein Gaußsches Mischungsmodell verwenden?
Ich lerne etwas über Gaußsche Mischungsmodelle (GMM), bin aber verwirrt darüber, warum jemand diesen Algorithmus jemals verwenden sollte. Wie ist dieser Algorithmus besser als andere Standard-Clustering-Algorithmen wie Mittel, wenn es um Clustering geht? Der bedeutet, dass der Algorithmus Daten in Cluster mit eindeutigen Gruppenmitgliedschaften partitioniert , während das Gaußsche Mischungsmodell …


1
Warum Lasso für die Funktionsauswahl?
Angenommen, ich habe einen hochdimensionalen Datensatz und möchte eine Feature-Auswahl durchführen. Eine Möglichkeit besteht darin, ein Modell zu trainieren, das die wichtigsten Merkmale in diesem Datensatz identifizieren kann, und dieses zu verwenden, um die am wenigsten wichtigen wegzuwerfen. In der Praxis würde ich dafür den SelectFromModel- Transformator von sklearn verwenden …


3
logit - Koeffizienten als Wahrscheinlichkeiten interpretieren
Mir scheinen wichtige Informationen zu fehlen. Mir ist bekannt, dass der logistische Regressionskoeffizient in log (Quoten) angegeben ist, der so genannten Logit-Skala. Daher wird zur Interpretation exp(coef)genommen und ergibt OR, das Odds Ratio. Wenn ist, lautet die Interpretation wie folgt: Für eine Erhöhung der Kovariate eine Einheit beträgt das logarithmische …

2
Parameter als Zufallsvariable in der Bayes'schen Statistik verstehen
Wenn ich das richtig verstehe, ist in der Bayes'schen Statistik ein Parameter eine Zufallsvariable. Bei der Schätzung des Parameters wird eine vorherige Verteilung mit den Daten kombiniert, um eine hintere Verteilung zu erhalten. Frage: Wird jeder Datenpunkt (sowohl in der Stichprobe als auch in der Grundgesamtheit) durch dieselbe Realisierung des …
9 bayesian 

2
Die Identitätsverknüpfungsfunktion berücksichtigt nicht die Domäne der Gamma-Familie?
Ich verwende ein Gamma Generalized Linear Model (GLM) mit einem Identitätslink. Die unabhängige Variable ist die Vergütung einer bestimmten Gruppe. Die Zusammenfassung der Python-Statistikmodelle gibt mir eine Warnung zu der Identitätsverknüpfungsfunktion ( "DomainWarning: Die Identitätsverknüpfungsfunktion berücksichtigt nicht die Domäne der Gamma-Familie." ), Die ich nicht verstehe und bei der ich …

2
Probabilistische Programmierung gegen "traditionelle" ML
Ich habe im Github-Repo nach Pymc gesucht und dieses Notizbuch gefunden: Variationsinferenz: Bayesianische Neuronale Netze Der Autor lobt die Vorzüge der bayesianischen / probabilistischen Programmierung, sagt dann aber weiter: Leider spielt die probabilistische Programmierung bei traditionellen ML-Problemen wie Klassifizierung oder (nichtlinearer) Regression häufig eine zweite Rolle (in Bezug auf Genauigkeit …

1
Wie werden zufällige Wälder und extrem zufällige Bäume unterschiedlich aufgeteilt?
Für zufällige Gesamtstrukturen teilen wir den Knoten nach Gini-Verunreinigung oder Entropie für eine Reihe von Merkmalen auf. Mit dem RandomForestClassifier in sklearn können wir wählen, ob wir das Gini-Kriterium oder das Entropy-Kriterium verwenden möchten. Was ich jedoch über Extra-Trees Classifier gelesen habe, ist ein zufälliger Wert für die Aufteilung (ich …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.