Ich arbeite an Krankheitsinfektionsdaten und bin verwirrt, ob ich die Daten als "kategorisch" oder "kontinuierlich" behandeln soll. "Infektionszahl" Die Anzahl der in einem bestimmten Zeitraum gefundenen Infektionsfälle wird aus kategorialen Daten generiert (dh Anzahl der als "infiziert" gekennzeichneten Patienten). "Patientenbett Tage" Summe der Gesamtzahl der Tage, die alle Patienten auf …
Wenn ich zwei Listen A und B habe, die beide Teilmengen einer viel größeren Liste C sind, wie kann ich feststellen, ob der Grad der Überlappung von A und B größer ist, als ich zufällig erwarten würde? Sollte ich nur zufällig Elemente aus C mit den gleichen Längen wie die …
Wir zeichnen Zeitreihenmetriken im Kontext von Netzwerk- / Serveroperationen. Die Daten haben eine Abtastrate von 5 Minuten und bestehen aus Dingen wie CPU-Auslastung, Fehlerrate usw. Wir fügen den Diagrammen eine horizontale "Schwellenwert" -Linie hinzu, um visuell einen Werteschwellenwert anzuzeigen, über dem sich Personen Sorgen machen / beachten sollten. Im Beispiel …
Ich habe viele Artikel gelesen, in denen k-means mit vielen Datensätzen getestet wird, die normalerweise nicht wie der Iris-Datensatz verteilt sind, und um gute Ergebnisse zu erzielen. Da ich verstehe, dass k-means für normalverteilte Daten ist, warum wird k-means für nicht normalverteilte Daten verwendet? In der folgenden Veröffentlichung wurden beispielsweise …
Ich habe ein bisschen gegoogelt, aber nichts gefunden. Angenommen, Sie führen eine Quantilregression für das q-te Quantil der abhängigen Variablen durch. Dann teilen Sie den DV beim q-ten Quantil auf und beschriften das Ergebnis mit 0 und 1. Anschließend führen Sie eine logistische Regression für den kategorisierten DV durch. Ich …
Ich habe das Originalpapier über Dropout ( https://www.cs.toronto.edu/~hinton/absps/JMLRdropout.pdf ) gelesen und im Abschnitt über lineare Regression heißt es: E.R ∼ B e r n o u l l i ( p )[ ∥ y - ( R ∗ X.) w∥2]]E.R.∼B.ernÖullich(p)[‖y - -(R.∗X.)w‖2]]\mathbb{E}_{R\sim Bernoulli(p)}\left[\| y\ - (R*X)w\|^2\right] reduziert zu: ∥ y- …
Ich lerne etwas über Gaußsche Mischungsmodelle (GMM), bin aber verwirrt darüber, warum jemand diesen Algorithmus jemals verwenden sollte. Wie ist dieser Algorithmus besser als andere Standard-Clustering-Algorithmen wie Mittel, wenn es um Clustering geht? Der bedeutet, dass der Algorithmus Daten in Cluster mit eindeutigen Gruppenmitgliedschaften partitioniert , während das Gaußsche Mischungsmodell …
Zunächst stelle ich fest, dass meine Frage sehr weit gefasst ist und es daher schwierig sein kann, diese Frage zu beantworten. Haben Sie Ratschläge, wie Sie sich einem „Problem“ nähern können, bei dem Sie Prognosen / Prognosen für mehr als 2000 verschiedene Produkte erstellen müssen? Mit anderen Worten, jedes Produkt …
Angenommen, ich habe einen hochdimensionalen Datensatz und möchte eine Feature-Auswahl durchführen. Eine Möglichkeit besteht darin, ein Modell zu trainieren, das die wichtigsten Merkmale in diesem Datensatz identifizieren kann, und dieses zu verwenden, um die am wenigsten wichtigen wegzuwerfen. In der Praxis würde ich dafür den SelectFromModel- Transformator von sklearn verwenden …
Es gibt eine Aussage, dass die Maximierung der Wahrscheinlichkeit gleichbedeutend mit der Minimierung der Kreuzentropie ist. Gibt es Beweise für diese Aussage?
Mir scheinen wichtige Informationen zu fehlen. Mir ist bekannt, dass der logistische Regressionskoeffizient in log (Quoten) angegeben ist, der so genannten Logit-Skala. Daher wird zur Interpretation exp(coef)genommen und ergibt OR, das Odds Ratio. Wenn ist, lautet die Interpretation wie folgt: Für eine Erhöhung der Kovariate eine Einheit beträgt das logarithmische …
Wenn ich das richtig verstehe, ist in der Bayes'schen Statistik ein Parameter eine Zufallsvariable. Bei der Schätzung des Parameters wird eine vorherige Verteilung mit den Daten kombiniert, um eine hintere Verteilung zu erhalten. Frage: Wird jeder Datenpunkt (sowohl in der Stichprobe als auch in der Grundgesamtheit) durch dieselbe Realisierung des …
Ich verwende ein Gamma Generalized Linear Model (GLM) mit einem Identitätslink. Die unabhängige Variable ist die Vergütung einer bestimmten Gruppe. Die Zusammenfassung der Python-Statistikmodelle gibt mir eine Warnung zu der Identitätsverknüpfungsfunktion ( "DomainWarning: Die Identitätsverknüpfungsfunktion berücksichtigt nicht die Domäne der Gamma-Familie." ), Die ich nicht verstehe und bei der ich …
Ich habe im Github-Repo nach Pymc gesucht und dieses Notizbuch gefunden: Variationsinferenz: Bayesianische Neuronale Netze Der Autor lobt die Vorzüge der bayesianischen / probabilistischen Programmierung, sagt dann aber weiter: Leider spielt die probabilistische Programmierung bei traditionellen ML-Problemen wie Klassifizierung oder (nichtlinearer) Regression häufig eine zweite Rolle (in Bezug auf Genauigkeit …
Für zufällige Gesamtstrukturen teilen wir den Knoten nach Gini-Verunreinigung oder Entropie für eine Reihe von Merkmalen auf. Mit dem RandomForestClassifier in sklearn können wir wählen, ob wir das Gini-Kriterium oder das Entropy-Kriterium verwenden möchten. Was ich jedoch über Extra-Trees Classifier gelesen habe, ist ein zufälliger Wert für die Aufteilung (ich …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.