Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Kontinuierliche Verallgemeinerung der negativen Binomialverteilung
Die negative Binomialverteilung (NB) ist für nicht negative ganze Zahlen definiert und hat die WahrscheinlichkeitsmassenfunktionIst es sinnvoll, eine kontinuierliche Verteilung auf nicht negative Reelle zu betrachten, die durch dieselbe Formel definiert sind (wobei durch )? Der Binomialkoeffizient kann als ein Produkt von umgeschrieben werden , das für jedes reelle gut …

2
Sind gemischte Modelle als Vorhersagemodelle nützlich?
Ich bin etwas verwirrt über die Vorteile gemischter Modelle in Bezug auf die prädiktive Modellierung. Da Vorhersagemodelle in der Regel dazu gedacht sind, Werte bisher unbekannter Beobachtungen vorherzusagen, erscheint es mir offensichtlich, dass ein gemischtes Modell nur durch seine Fähigkeit nützlich sein kann, Vorhersagen auf Bevölkerungsebene zu liefern (dh ohne …

2
Wer hat den Entscheidungsbaum erfunden?
Ich versuche zu verfolgen, wer die Datenstruktur und den Algorithmus des Entscheidungsbaums erfunden hat. Im Wikipedia-Eintrag zum Entscheidungsbaum-Lernen heißt es, dass "ID3 und CART ungefähr zur gleichen Zeit (zwischen 1970 und 1980) unabhängig voneinander erfunden wurden". ID3 wurde später vorgestellt in: Quinlan, JR 1986. Induktion von Entscheidungsbäumen. Mach. Lernen. 1, …
24 cart  history 


3
Geschichte der uninformativen Theorie
Ich schreibe einen kurzen theoretischen Aufsatz für einen Bayesian Statistics-Kurs (in einem Economics M.Sc.) über nicht-informative Prioritäten und versuche zu verstehen, welche Schritte zur Entwicklung dieser Theorie erforderlich sind. Mittlerweile besteht meine Zeitleiste aus drei Hauptschritten: Laplace-Gleichgültigkeitsprinzip (1812), Nicht-invariante Prioritäten (Jeffreys (1946)), Bernardo-Referenz vor (1979). Aus meiner Literaturrecherche habe ich …

3
Was ist der Grund, warum der Adam Optimizer für den Wert seiner Hyperparameter als robust angesehen wird?
Ich habe über den Adam-Optimierer für Deep Learning gelesen und bin in dem neuen Buch Deep Learning von Bengio, Goodfellow und Courville auf folgenden Satz gestoßen: Adam wird allgemein als ziemlich robust gegenüber der Auswahl von Hyperparametern angesehen, obwohl die Lernrate manchmal von der vorgeschlagenen Standardeinstellung geändert werden muss. Wenn …

3
Was kann man aus den Daten schließen, wenn das arithmetische Mittel dem geometrischen Mittel sehr nahe kommt?
Gibt es irgendetwas Bedeutendes an einem geometrischen Mittelwert und einem arithmetischen Mittelwert, die sehr nahe beieinander liegen, sagen wir ~ 0,1%? Welche Vermutungen lassen sich über einen solchen Datensatz anstellen? Ich habe gerade an der Analyse eines Datensatzes gearbeitet und merke, dass die Werte ironischerweise sehr, sehr nahe beieinander liegen. …


7
Empfehlungen für nichttechnische und dennoch tiefgründige Artikel in der Statistik
Die Inspiration für diese Frage stammt aus dem bekannten Artikel Statistical Modeling: The Two Cultures von Leo-Breiman (Open Access verfügbar). Der Autor vergleicht zwei seiner Meinung nach unterschiedliche Ansätze zur Datenanalyse und geht dabei auf Schlüsselideen der klassischen Statistik und des maschinellen Lernens ein. Der Artikel ist jedoch für ein …
24 references 

3
Auswertung der logistischen Regression und Interpretation von Hosmer-Lemeshow Goodness of Fit
Wie wir alle wissen, gibt es zwei Methoden, um das logistische Regressionsmodell zu bewerten, und sie testen sehr unterschiedliche Dinge Vorhersagekraft: Erhalten Sie eine Statistik, die misst, wie gut Sie die abhängige Variable basierend auf den unabhängigen Variablen vorhersagen können. Die bekannten Pseudo R ^ 2 sind McFadden (1974) und …

2
Das Paradox von iid-Daten (zumindest für mich)
Soweit meine gesammelten (und knappen) statistischen Kenntnisse dies zulassen , habe ich verstanden, dass, wenn Zufallsvariablen sind, sie, wie der Begriff impliziert, unabhängig und identisch verteilt sind.X1,X2,...,XnX1,X2,...,XnX_1, X_2,..., X_n Mein Anliegen ist hier die frühere Eigenschaft von iid samples, die lautet: p(Xn|Xi1,Xi2,...,Xik)=p(Xn),p(Xn|Xi1,Xi2,...,Xik)=p(Xn),p(X_{n}|X_{i_1},X_{i_2},...,X_{i_k}) = p(X_{n}), für jede Sammlung von verschiedenen 's …

4
ANOVA gegen multiple lineare Regression? Warum wird ANOVA in experimentellen Studien so häufig verwendet?
ANOVA gegen multiple lineare Regression? Ich verstehe, dass diese beiden Methoden anscheinend dasselbe statistische Modell verwenden. Unter welchen Umständen sollte ich jedoch welche Methode anwenden? Was sind die Vor- und Nachteile dieser Methoden im Vergleich? Warum wird ANOVA in experimentellen Studien so häufig verwendet und ich finde kaum eine Regressionsstudie?

2
Bag-of-Words für die Textklassifizierung: Warum nicht einfach Worthäufigkeiten anstelle von TFIDF verwenden?
Ein üblicher Ansatz zur Klassifizierung von Texten besteht darin, einen Klassifikator aus einem Wortsack zu schulen. Der Benutzer nimmt den zu klassifizierenden Text und zählt die Häufigkeit der Wörter in jedem Objekt, gefolgt von einer Art Beschnitt, um die resultierende Matrix in einer überschaubaren Größe zu halten. Oft sehe ich …

3
Warum werden seit Anbeginn der Zeit nicht auf alle Experimente mehrere Hypothesenkorrekturen angewendet?
Wir wissen, dass wir Benjamini-Hochberg-ähnliche Korrekturen für Mehrfachhypothesentests auf Experimente anwenden müssen, die auf einem einzigen Datensatz basieren, um die Rate falscher Entdeckungen zu kontrollieren. Andernfalls könnten alle Experimente, die ein positives Ergebnis liefern, falsch sein. Aber warum wenden wir dieses Prinzip nicht auf alle Experimente seit Beginn der Zeit …

2
Wechseln Sie von der Modellierung eines Prozesses mit einer Poisson-Verteilung zur Verwendung einer negativen Binomialverteilung?
\newcommand{\P}{\mathbb{P}}Wir haben einen zufälligen Prozess, der in einem festgelegten Zeitraum mehrmals auftreten kann oder auch nicht . Wir haben einen Datenfeed von einem bereits existierenden Modell dieses Prozesses, der die Wahrscheinlichkeit für eine Anzahl von Ereignissen in der Periode liefert . Dieses bestehende Modell ist alt und wir müssen die …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.