Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

4
Können Algorithmen für maschinelles Lernen oder Deep Learning verwendet werden, um den Abtastprozess einer MCMC-Technik zu „verbessern“?
Aufgrund der geringen Kenntnisse, die ich über MCMC-Methoden (Markov-Kette Monte Carlo) habe, verstehe ich, dass die Probenahme ein entscheidender Teil der oben genannten Technik ist. Die am häufigsten verwendeten Stichprobenverfahren sind Hamilton und Metropolis. Gibt es eine Möglichkeit, maschinelles Lernen oder sogar Tiefenlernen zu nutzen, um einen effizienteren MCMC-Sampler zu …

2
Wann sollten wir kontinuierliche unabhängige Variablen / Features diskretisieren / binieren und wann nicht?
Wann sollten wir unabhängige Variablen / Features diskretisieren / binieren und wann nicht? Meine Versuche, die Frage zu beantworten: Im Allgemeinen sollten wir nicht binieren, da Binning Informationen verlieren wird. Binning erhöht tatsächlich den Freiheitsgrad des Modells, sodass es nach dem Binning zu einer Überanpassung kommen kann. Wenn wir ein …

4
Unterschied zwischen den einer Korrelation zugrunde liegenden Annahmen und einem Regressionssteigungstest von Bedeutung
Meine Frage entstand aus einer Diskussion mit @whuber in den Kommentaren einer anderen Frage . Konkret lautete der Kommentar von @whuber wie folgt: Ein Grund dafür könnte sein, dass die Annahmen, die einem Korrelationstest und einem Regressionssteigungstest zugrunde liegen, unterschiedlich sind. Selbst wenn wir verstehen, dass Korrelation und Steigung wirklich …

7
Kann jemand helfen, den Unterschied zwischen unabhängig und zufällig zu erklären?
Beschreiben unabhängig und zufällig in der Statistik die gleichen Merkmale? Was ist der Unterschied zwischen ihnen? Wir stoßen oft auf die Beschreibung "zwei unabhängige Zufallsvariablen" oder "Zufallsstichproben". Ich frage mich, was genau der Unterschied zwischen ihnen ist. Kann jemand dies erklären und einige Beispiele geben? Zum Beispiel nicht unabhängiger, aber …

5
Überanpassung: Keine Wunderwaffe?
Mein Verständnis ist , dass , selbst wenn nach ordnungsgemäßem Kreuzvalidierung und Modellauswahlverfahren, Überanpassung wird , wenn man sucht nach einem Modell passiert schwer genug , wenn man nicht erlegt Beschränkungen Modellkomplexität, period. Darüber hinaus wird häufig versucht, aus den Daten Strafen für die Modellkomplexität zu lernen, die den Schutz …


2
Stärkung neuronaler Netze
Vor kurzem habe ich mich mit dem Erlernen von Boosting-Algorithmen wie Adaboost und Gradienten-Boost befasst, und ich kenne die Tatsache, dass der am häufigsten verwendete schwache Lernende Bäume sind. Ich möchte wirklich wissen, ob es in letzter Zeit einige erfolgreiche Beispiele (ich meine einige Artikel oder Artikel) für die Verwendung …



1
Anscombe-ähnliche Datensätze mit demselben Box- und Whisker-Diagramm (Mittelwert / Standard / Median / MAD / Min / Max)
EDIT: Da diese Frage aufgeblasen wurde, eine Zusammenfassung: Finden verschiedener aussagekräftiger und interpretierbarer Datensätze mit derselben gemischten Statistik (Mittelwert, Median, Mittlerer Bereich und die damit verbundenen Streuungen und Regressionen). Das Anscombe Quartett (siehe ? Purpose hoher Abmessungsdaten zu visualisieren ) ist ein bekanntes Beispiel von vier - Datensätzen mit dem …


3
Wie kann man ein Ergebnis mit nur positiven Fällen als Training vorhersagen?
Nehmen wir der Einfachheit halber an, ich arbeite am klassischen Beispiel von Spam- / Nicht-Spam-E-Mails. Ich habe 20000 E-Mails. Davon weiß ich, dass 2000 Spam sind, aber ich habe kein Beispiel für Nicht-Spam-E-Mails. Ich möchte vorhersagen, ob es sich bei den verbleibenden 18000 um Spam handelt oder nicht. Im Idealfall …

1
Bootstrapping vs. Bayesian Bootstrapping konzeptionell?
Ich habe Probleme zu verstehen, was ein Bayes-Bootstrapping-Prozess ist und wie sich dieser von Ihrem normalen Bootstrapping unterscheidet. Und wenn jemand eine intuitive / konzeptionelle Überprüfung und einen Vergleich von beiden anbieten könnte, wäre das großartig. Nehmen wir ein Beispiel. Angenommen, wir haben einen Datensatz X, der [1,2,5,7,3] ist. Wenn …

2
Datenerweiterungstechniken für allgemeine Datensätze?
In vielen Anwendungen des maschinellen Lernens haben die sogenannten Datenerweiterungsmethoden die Erstellung besserer Modelle ermöglicht. Nehmen Sie zum Beispiel einen Trainingssatz mit Bildern von Katzen und Hunden an. Durch Drehen, Spiegeln, Anpassen des Kontrasts usw. ist es möglich, zusätzliche Bilder aus den Originalbildern zu generieren.100100100 Bei Bildern ist die Datenerweiterung …

1
Wann werden Poisson-GLMs vs. geometrische GLMs vs. negative Binomial-GLMs für Zählungsdaten verwendet?
Ich versuche für mich selbst ein Layout zu erstellen, wenn es angebracht ist, welchen Regressionstyp (geometrisch, Poisson, negatives Binomial) mit Zähldaten innerhalb des GLM-Frameworks zu verwenden (nur 3 der 8 GLM-Verteilungen werden für Zähldaten verwendet, obwohl die meisten davon verwendet werden Ich habe Zentren über die negativen Binomial- und Poisson-Verteilungen …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.