Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Sollte die Stichprobe für die logistische Regression das tatsächliche Verhältnis von Einsen und Nullen widerspiegeln?
Angenommen, ich möchte ein logistisches Regressionsmodell erstellen, das die Wahrscheinlichkeit des Auftretens einiger auf Bäumen lebender Tierarten basierend auf den Eigenschaften von Bäumen (z. B. der Höhe) abschätzen kann. Wie immer ist meine Zeit und mein Geld begrenzt, daher kann ich nur eine begrenzte Stichprobengröße sammeln. Ich habe folgende Fragen: …

10
Bester Begriff für erfundene Daten?
Ich schreibe ein Beispiel und habe einige Daten erfunden. Ich möchte, dass dem Leser klar wird, dass es sich nicht um echte Daten handelt, aber ich möchte auch nicht den Eindruck von Böswilligkeit erwecken, da dies nur als Beispiel dient. Es gibt keine (Pseudo-) Zufallskomponente für diese bestimmten Daten, daher …

2
Welches statistische Modell oder welcher statistische Algorithmus könnte zur Lösung des John Snow Cholera-Problems verwendet werden?
Ich bin daran interessiert zu lernen, wie man eine geografische Annäherung einer Art Epizentrum basierend auf den Daten des John Snow Cholera-Ausbruchs entwickelt. Welche statistische Modellierung könnte verwendet werden, um ein solches Problem zu lösen, ohne vorher zu wissen, wo sich die Bohrlöcher befinden. Als allgemeines Problem hätten Sie die …

3
Sollte die Reduzierung der Dimensionalität für die Visualisierung als „geschlossenes“ Problem angesehen werden, das von t-SNE gelöst wurde?
Ich habe viel über den sne- Algorithmus zur Dimensionsreduktion gelesen . Ich bin sehr beeindruckt von der Leistung bei "klassischen" Datensätzen wie MNIST, bei denen eine klare Trennung der Ziffern erzielt wird ( siehe Originalartikel ):ttt Ich habe es auch verwendet, um die Funktionen eines neuronalen Netzwerks zu visualisieren, das …


4
Warum werden Optimierungsalgorithmen im Hinblick auf andere Optimierungsprobleme definiert?
Ich forsche an Optimierungstechniken für maschinelles Lernen, bin jedoch überrascht, dass eine große Anzahl von Optimierungsalgorithmen im Hinblick auf andere Optimierungsprobleme definiert wurde. Ich illustriere im Folgenden einige Beispiele. Zum Beispiel https://arxiv.org/pdf/1511.05133v1.pdf Alles sieht schön und gut aus, aber dann gibt es dieses im . Was ist also der Algorithmus, …


1
Eigenschaften von PCA für abhängige Beobachtungen
In der Regel verwenden wir PCA als Methode zur Dimensionsreduktion für Daten, bei denen angenommen wird, dass es sich um iid-Fälle handelt Frage: Was sind die typischen Nuancen bei der Anwendung von PCA für abhängige, nicht-iid-bezogene Daten? Welche netten / nützlichen Eigenschaften von PCA, die für iid-Daten gelten, sind gefährdet …


2
Ist es sinnvoll, einen festen Effekt in einen zufälligen zu verschachteln, oder wie man wiederholte Takte in R (aov und lmer) codiert?
Ich habe diese Übersicht der lm / lmer R-Formeln von @conjugateprior durchgesehen und bin durch den folgenden Eintrag verwirrt: Angenommen, A ist zufällig, aber B ist fest und B ist in A verschachtelt. aov(Y ~ B + Error(A/B), data=d) Im Folgenden wird eine analoge Mischmodellformel lmer(Y ~ B + (1 …

1
Keras, wie funktioniert der Zerfall der SGD-Lernrate?
Wenn Sie sich die Dokumentation http://keras.io/optimizers/ ansehen, gibt es in der SGD einen Parameter für den Zerfall. Ich weiß, dass dies die Lernrate im Laufe der Zeit reduziert. Allerdings kann ich nicht herausfinden, wie es genau funktioniert. Ist es ein Wert, der mit der Lernrate multipliziert wird, wie lr = …

4
Monty Hall Problem mit einem fehlbaren Monty
Monty wusste genau, ob die Tür eine Ziege hinter sich hatte (oder leer war). Diese Tatsache ermöglicht es dem Spieler, seine Erfolgsrate im Laufe der Zeit zu verdoppeln, indem er "Vermutungen" auf die andere Tür überträgt. Was wäre, wenn Montys Wissen nicht perfekt wäre? Was ist, wenn manchmal der Preis …

2
Soll das endgültige (serienreife) Modell mit vollständigen Daten oder nur mit einem Trainingssatz trainiert werden?
Angenommen, ich habe mehrere Modelle auf dem Trainingsset trainiert und das beste mit dem Kreuzvalidierungsset und der gemessenen Leistung auf dem Testset ausgewählt. Jetzt habe ich ein letztes bestes Modell. Sollte ich alle verfügbaren Daten oder Schiffslösungen, die nur auf dem Schulungsset trainiert wurden, erneut trainieren? Wenn letzteres, warum dann? …


3
Kullback-Leibler-Divergenz OHNE Informationstheorie
Nach langem Durchforsten von Cross Validated fühle ich mich immer noch nicht näher daran, die KL-Divergenz außerhalb des Bereichs der Informationstheorie zu verstehen. Es ist ziemlich seltsam, wenn jemand mit einem mathematischen Hintergrund die Erklärung der Informationstheorie viel leichter versteht. Um mein Verständnis vor dem Hintergrund der Informationstheorie zu skizzieren: …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.