Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren



2
Berechnung der Wahrscheinlichkeit einer Überlappung der Genliste zwischen einer RNA-Sequenz und einem ChIP-Chip-Datensatz
Hoffentlich kann mir jemand in diesen Foren bei diesem Grundproblem in Genexpressionsstudien helfen. Ich habe eine Tiefensequenzierung eines experimentellen und eines Kontrollgewebes durchgeführt. Ich erhielt dann fache Anreicherungswerte von Genen in der experimentellen Probe über Kontrolle. Das Referenzgenom hat ~ 15.000 Gene. 3.000 von 15.000 Genen sind in meiner interessierenden …


2
Wie ist die Verteilung der Stichprobenmittel einer Cauchy-Verteilung?
Wenn man zufällige Stichprobenmittelwerte einer Verteilung (mit einer Stichprobengröße von mehr als 30) nimmt, erhält man typischerweise eine Normalverteilung, die sich um den Mittelwert zentriert. Ich habe jedoch gehört, dass die Cauchy-Verteilung keinen Mittelwert hat. Welche Verteilung erhält man dann, wenn man Probenmittel der Cauchy-Verteilung erhält? Grundsätzlich ist für eine …
13 cauchy 

5
Gibt es ein visuelles Werkzeug zum Entwerfen und Anwenden von neuronalen Netzen / Deep Learning? [geschlossen]
Geschlossen. Diese Frage ist nicht zum Thema . Derzeit werden keine Antworten akzeptiert. Möchten Sie diese Frage verbessern? Aktualisieren Sie die Frage so dass es beim Thema für Kreuz Validated. Geschlossen vor 9 Monaten . Ich weiß, dass es viele Bibliotheken für maschinelles Lernen und tiefes Lernen gibt, wie Kaffee, …

2
Best Practices für die Codierung kategorialer Funktionen für Entscheidungsbäume?
Bei der Codierung kategorialer Merkmale für die lineare Regression gilt die Regel: Die Anzahl der Dummies sollte eins weniger sein als die Gesamtzahl der Ebenen (um Kollinearität zu vermeiden). Gibt es eine ähnliche Regel für Entscheidungsbäume (eingesackt, verstärkt)? Ich frage dies, weil eine Standardpraxis in Python darin zu bestehen scheint, …


1
Erklären Sie die Bedeutung und den Zweck der L2-Normalisierung
Lassen Sie mich zu Beginn sagen, dass ich sehr neu im maschinellen Lernen bin und nicht besonders gut in Mathe. Ich verstehe, was TF-IDF macht, aber in dem Buch, das ich lese, wird auch Folgendes erwähnt (es wird diskutiert, wie Scikit-Lernen Dinge macht): Beide Klassen [TfidfTransformer und TfidfVectorizer] wenden nach …

3
RNN für unregelmäßige Zeitintervalle?
RNNs eignen sich bemerkenswert gut zur Erfassung der Zeitabhängigkeit sequentieller Daten. Was passiert jedoch, wenn die Sequenzelemente nicht zeitlich gleich verteilt sind? Beispielsweise erfolgt die erste Eingabe in die LSTM-Zelle am Montag, dann keine Daten von Dienstag bis Donnerstag und schließlich neue Eingaben für jeden Freitag, Samstag, Sonntag. Eine Möglichkeit …

1
Wie trainiere ich das LSTM-Modell anhand mehrerer Zeitreihendaten?
Wie trainiere ich das LSTM-Modell anhand mehrerer Zeitreihendaten? Anwendungsfall: Ich habe in den letzten 5 Jahren einen wöchentlichen Umsatz von 20.000 Agenten. Sie müssen die bevorstehenden wöchentlichen Verkäufe für jeden Agenten prognostizieren. Muss ich einer Stapelverarbeitungstechnik folgen - jeweils einen Agenten nehmen, das LSTM-Modell trainieren und dann prognostizieren? Irgendwelche besseren …

1
Kombinieren mehrerer Metriken, um Vergleiche / Rangfolgen von k Objekten bereitzustellen [Frage und Referenzanforderung]
Sammeln von Metriken zu k Objektennnnkkk Angenommen, ich sammle Metriken über k Objekte. Ich suche nach gültigen Möglichkeiten, um die k Objekte zu vergleichen , damit sie "eingestuft" werden können. Ich denke, dass dies ein ausgetretener Boden ist (Sportstatistiken wie die gesamte Quarterback-Bewertung usw.), aber ich bin mit diesem Bereich …

3
Was bedeutet eine "nachvollziehbare" Verteilung?
Zum Beispiel hören wir in einem generativen kontradiktorischen Netzwerk oft, dass Inferenz einfach ist, weil die bedingte Verteilung von x bei gegebener latenter Variable z 'traktierbar' ist. Außerdem habe ich irgendwo gelesen, dass eine Boltzmann-Maschine und ein Variations-Autoencoder verwendet werden, bei denen die posteriore Verteilung nicht nachvollziehbar ist, so dass …



Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.