Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Dice-Coefficient-Loss-Funktion gegen Cross-Entropie
Wie entscheiden Sie sich beim Trainieren von neuronalen Netzen mit Pixelsegmentierung, wie z. B. vollständig faltungsorientierten Netzen, für die Verwendung der Funktion für den entropieübergreifenden Verlust im Vergleich zur Funktion für den Verlust des Würfelkoeffizienten? Mir ist klar, dass dies eine kurze Frage ist, aber ich bin mir nicht sicher, …

2
Wann ist es angebracht, eine falsche Bewertungsregel anzuwenden?
Merkle & Steyvers (2013) schreiben: Um eine korrekte Bewertungsregel formal zu definieren, sei eine probabilistische Vorhersage eines Bernoulli-Versuchs mit echter Erfolgswahrscheinlichkeit . Richtige Bewertungsregeln sind Metriken, deren erwartete Werte minimiert werden, wenn .fffdddpppf= pf=pf = p Ich verstehe, dass dies gut ist, weil wir die Prognostiker ermutigen möchten, Prognosen zu …


5
Kann sich ein tiefes neuronales Netzwerk der Multiplikationsfunktion ohne Normalisierung annähern?
Nehmen wir an, wir möchten eine Regression für einfache f = x * yVerwendung eines standardmäßigen tiefen neuronalen Netzwerks durchführen. Ich erinnere mich, dass es Forschungsergebnisse gibt, die besagen, dass NN mit einer Hiden-Schicht jede Funktion approximieren kann, aber ich habe es versucht und ohne Normalisierung konnte NN nicht einmal …





1
Was sind die klassischen Notationen in Statistik, linearer Algebra und maschinellem Lernen? Und wie hängen diese Notationen zusammen?
Wenn wir ein Buch lesen, spielt das Verstehen der Notationen eine sehr wichtige Rolle für das Verständnis des Inhalts. Leider haben verschiedene Communities unterschiedliche Notationskonventionen für die Formulierung des Modells und das Optimierungsproblem. Könnte jemand hier einige Formulierungsnotationen zusammenfassen und mögliche Gründe nennen? Ich werde hier ein Beispiel geben: In …

3
Warum werden Beta / Dirichlet-Regressionen nicht als verallgemeinerte lineare Modelle betrachtet?
Voraussetzung ist dieses Zitat aus der Vignette des R-Pakets betareg1 . Darüber hinaus hat das Modell einige Eigenschaften (z. B. linearer Prädiktor, Verknüpfungsfunktion, Dispersionsparameter) mit verallgemeinerten linearen Modellen (GLMs; McCullagh und Nelder 1989) gemeinsam, ist jedoch kein Sonderfall dieses Frameworks (auch nicht für feste Dispersion) ) Diese Antwort spielt auch …

5
Ist die Wahrscheinlichkeitstheorie das Studium nicht negativer Funktionen, die sich zu einer integrieren / summieren?
Dies ist wahrscheinlich eine dumme Frage, aber ist die Wahrscheinlichkeitstheorie das Studium von Funktionen, die sich zu einer integrieren / summieren? BEARBEITEN. Ich habe die Nicht-Negativität vergessen. Ist die Wahrscheinlichkeitstheorie also das Studium nicht-negativer Funktionen, die sich zu einer integrieren / summieren?

1
Warum sind nicht nullzentrierte Aktivierungsfunktionen ein Problem bei der Rückübertragung?
Ich habe hier folgendes gelesen : Sigmoid-Ausgänge sind nicht nullzentriert . Dies ist unerwünscht, da Neuronen in späteren Verarbeitungsebenen in einem neuronalen Netzwerk (dazu bald mehr) Daten empfangen würden, die nicht nullzentriert sind. Dies hat Auswirkungen auf die Dynamik beim Gradientenabstieg, denn wenn die in ein Neuron eingehenden Daten immer …


6
Wie wählt man zwischen ROC AUC und F1 Score?
Ich habe kürzlich einen Kaggle-Wettbewerb abgeschlossen, bei dem der ROC AUC-Score gemäß den Wettbewerbsanforderungen verwendet wurde. Vor diesem Projekt habe ich normalerweise den Wert f1 als Metrik zur Messung der Modellleistung verwendet. In Zukunft frage ich mich, wie ich zwischen diesen beiden Metriken wählen soll. Wann welche verwenden und welche …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.