Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Mehrschichtiges Perzeptron gegen tiefes neuronales Netzwerk
Dies ist eine terminologische Frage. Manchmal sehe ich Menschen, die tiefe neuronale Netze als "vielschichtige Perzeptrone" bezeichnen. Warum ist das so? Mir wurde beigebracht, dass ein Perzeptron ein einschichtiger Klassifikator (oder Regressor) mit einem binären Schwellenwert ist, der eine bestimmte Art des Trainings der Gewichte verwendet (kein Back-Prop). Wenn die …

2
Warum wird eine T-Verteilung zum Testen eines linearen Regressionskoeffizienten verwendet?
In der Praxis ist die Verwendung eines Standard-T-Tests zur Überprüfung der Signifikanz eines linearen Regressionskoeffizienten gängige Praxis. Die Mechanik der Berechnung macht für mich Sinn. Warum kann die T-Verteilung verwendet werden, um die Standardteststatistik zu modellieren, die beim Testen von linearen Regressionshypothesen verwendet wird? Standardteststatistik, auf die ich mich hier …

2
Warum Lasso oder ElasticNet besser abschneiden als Ridge, wenn die Merkmale miteinander korrelieren
Ich habe 150 Funktionen, von denen viele stark miteinander korreliert sind. Mein Ziel ist es, den Wert einer diskreten Variablen vorherzusagen, deren Bereich 1-8 ist . Meine Stichprobengröße beträgt 550 und ich verwende die 10-fache Kreuzvalidierung. AFAIK: Unter den Regularisierungsmethoden (Lasso, ElasticNet und Ridge) ist Ridge strenger in Bezug auf …

2
Was ist der Unterschied zwischen Markov-Ketten und Markov-Prozessen?
Was ist der Unterschied zwischen Markov-Ketten und Markov-Prozessen? Ich lese widersprüchliche Informationen: Manchmal basiert die Definition darauf, ob der Zustandsraum diskret oder kontinuierlich ist, und manchmal basiert sie darauf, ob die Zeit diskret oder kontinuierlich ist. Folie 20 dieses Dokuments : Ein Markov-Prozess wird als Markov-Kette bezeichnet, wenn der Zustandsraum …

3
Welche Beziehung besteht zwischen der Beta-Verteilung und dem logistischen Regressionsmodell?
Meine Frage ist: Wie ist die mathematische Beziehung zwischen der Beta-Verteilung und den Koeffizienten des logistischen Regressionsmodells ? Zur Veranschaulichung: Die logistische (Sigmoid-) Funktion ist gegeben durch f( x ) = 11 + exp( - x )f(x)=11+exp⁡(-x)f(x) = \frac{1}{1+\exp(-x)} und es wird verwendet, um Wahrscheinlichkeiten im logistischen Regressionsmodell zu modellieren. …

5
Ein Maß für die "Varianz" aus der Kovarianzmatrix?
Wenn die Daten 1d sind, zeigt die Varianz das Ausmaß an, in dem sich die Datenpunkte voneinander unterscheiden. Wenn die Daten mehrdimensional sind, erhalten wir eine Kovarianzmatrix. Gibt es ein Maß, das angibt, wie unterschiedlich die Datenpunkte im Allgemeinen für mehrdimensionale Daten sind? Ich habe das Gefühl, dass es bereits …


1
Was ist der Zusammenhang zwischen partiellen kleinsten Quadraten, reduzierter Rangregression und Hauptkomponentenregression?
Sind reduzierte Rangregression und Hauptkomponentenregression nur Sonderfälle von partiellen kleinsten Quadraten? In diesem Lernprogramm (Seite 6, "Objektivvergleich") wird angegeben, dass bei Teilquadraten ohne X- oder Y-Projektion (dh "nicht partiell") die Rang- oder Hauptkomponentenregression entsprechend verringert wird. Eine ähnliche Erklärung finden Sie auf dieser SAS-Dokumentationsseite in den Abschnitten "Reduzierte Rangregression" und …




1
R-Paket für Weighted Random Forest? Klassewt Option?
Ich versuche, Random Forest zu verwenden, um das Ergebnis eines extrem unausgeglichenen Datensatzes vorherzusagen (die Minderheitsklassenrate beträgt nur etwa 1% oder sogar weniger). Da der herkömmliche Random Forest-Algorithmus die Gesamtfehlerrate minimiert, anstatt den Minderheitsklassen besondere Aufmerksamkeit zu widmen, ist er nicht direkt auf unausgeglichene Daten anwendbar. Daher möchte ich die …
16 r  random-forest 

1
Gibt es in der statistischen Lerntheorie nicht ein Problem der Überanpassung eines Testsatzes?
Betrachten wir das Problem beim Klassifizieren des MNIST-Datasets. Laut der MNIST-Webseite von Yann LeCun , "Ciresan et al." 0,23% Fehlerrate beim MNIST-Test mit Convolutional Neural Network. Lassen Sie uns bezeichnen MNIST Trainingssatz als , MNIST Testset als , die letzte Hypothese sie erhalten unter Verwendung von als , und ihre …

3
Was genau ist eine Distribution?
Ich weiß sehr wenig über Wahrscheinlichkeit und Statistik und möchte lernen. Ich sehe das Wort "Verteilung", das überall in verschiedenen Zusammenhängen verwendet wird. Beispielsweise hat eine diskrete Zufallsvariable eine "Wahrscheinlichkeitsverteilung". Ich weiß was das ist. Eine stetige Zufallsvariable hat eine Wahrscheinlichkeitsdichtefunktion. Für ist das Integral von bis der Wahrscheinlichkeitsdichtefunktion die …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.