Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Ist die multiple lineare Regression in drei Dimensionen eine Ebene mit der besten Anpassung oder eine Linie mit der besten Anpassung?
Unser Professor befasst sich nicht mit der Mathematik oder sogar der geometrischen Darstellung multipler linearer Regression, und das hat mich etwas verwirrt. Einerseits wird es auch in höheren Dimensionen immer noch als multiple lineare Regression bezeichnet. Auf der anderen Seite, wenn wir zum Beispiel haben Y = b 0 + …

1
Interpretation der TBATS-Modellergebnisse und Modelldiagnose
Ich habe halbstündliche Nachfragedaten, bei denen es sich um eine multisaisonale Zeitreihe handelt. Ich habe tbatsin forecastPaket in R verwendet und habe folgende Ergebnisse erhalten: TBATS(1, {5,4}, 0.838, {<48,6>, <336,6>, <17520,5>}) Bedeutet dies, dass die Serie nicht unbedingt die Box-Cox-Transformation verwenden muss und der Fehlerterm ARMA (5, 4) ist und …

2
Techniken des maschinellen Lernens für Längsschnittdaten
Ich habe mich gefragt, ob es (unbeaufsichtigt) maschinelle Lerntechniken zur Modellierung von Längsschnittdaten gibt. Ich habe immer Modelle mit gemischten Effekten verwendet (meistens nicht linear), aber ich habe mich gefragt, ob es andere Möglichkeiten gibt (maschinelles Lernen). Mit maschinellem Lernen meine ich zufällige Gesamtstruktur, Klassifizierung / Clustering, Entscheidungsbäume und sogar …



4
Gute Beispiele / Bücher / Ressourcen zum Erlernen des angewandten maschinellen Lernens (nicht nur ML selbst)
Ich habe zuvor einen ML-Kurs besucht, aber jetzt, da ich an meinem Arbeitsplatz mit ML-bezogenen Projekten arbeite, habe ich große Probleme, ihn tatsächlich anzuwenden. Ich bin mir sicher, dass das, was ich mache, schon einmal recherchiert / behandelt wurde, aber ich kann keine spezifischen Themen finden. Alle Beispiele für maschinelles …

1
Was ist der Unterschied zwischen asymptotischer Unparteilichkeit und Konsistenz?
Bedeutet jeder den anderen? Wenn nicht, impliziert das eine das andere? Warum Warum nicht? Dieses Problem trat als Antwort auf einen Kommentar zu einer Antwort auf, die ich hier gepostet habe . Obwohl die Google-Suche in den relevanten Begriffen nichts hervorbrachte, was besonders nützlich schien, bemerkte ich eine Antwort auf …

1
Was ist eine Erklärung für das Beispiel, warum die Chargennormalisierung mit einiger Sorgfalt durchgeführt werden muss?
Ich habe das Batch-Normalisierungspapier [1] gelesen und es hatte einen Abschnitt, in dem ein Beispiel behandelt wird, um zu zeigen, warum die Normalisierung sorgfältig durchgeführt werden muss. Ich kann ehrlich gesagt nicht verstehen, wie das Beispiel funktioniert, und ich bin wirklich sehr neugierig zu verstehen, dass sie so viel Papier …

2
Beziehen sich verbleibende Netzwerke auf die Erhöhung des Gradienten?
Kürzlich haben wir die Entstehung des verbleibenden neuronalen Netzes gesehen, bei dem jede Schicht aus einem Rechenmodul cicic_i und einer Verknüpfungsverbindung besteht, die die Eingabe in die Schicht beibehält, wie die Ausgabe der i-ten Schicht zeigt: yi+1=ci+yiyi+1=ci+yi y_{i+1} = c_i + y_i Das Netzwerk ermöglicht das Extrahieren von Restmerkmalen und …

4
Neuronales Netz - Bedeutung von Gewichten
Ich verwende Feed-Forward NN. Ich verstehe das Konzept, aber meine Frage betrifft Gewichte. Wie können Sie sie interpretieren, dh was stellen sie dar oder wie können sie ungestört sein (nur Funktionskoeffizienten)? Ich habe etwas gefunden, das "Raum der Gewichte" genannt wird, bin mir aber nicht ganz sicher, was es bedeutet.

2
Kreuzvalidierung nach LASSO in komplexen Umfragedaten
Ich versuche, mit LASSO eine Modellauswahl für einige Kandidaten-Prädiktoren mit einem kontinuierlichen Ergebnis durchzuführen. Das Ziel besteht darin, das optimale Modell mit der besten Vorhersageleistung auszuwählen, was normalerweise durch K-fache Kreuzvalidierung erfolgen kann, nachdem ein Lösungspfad der Abstimmungsparameter von LASSO erhalten wurde. Das Problem hierbei ist, dass die Daten aus …

2
Die Interpretation der Modellmittelung führt zu R.
Ich versuche zu verstehen und zu wissen, was ich aus meiner Analyse einiger Daten mithilfe der Modellmittelung in R berichten soll. Ich verwende das folgende Skript, um die Auswirkung der Messmethode auf eine bestimmte Variable zu analysieren: Hier ist der Datensatz: https://www.dropbox.com/s/u9un273gzw9o30u/VMT4.csv?dl=0 Zu montierendes Modell: LM.1 <- gls(VMTf ~ turn+sex+method, …

1
Unterschied zwischen ElasticNet in Scikit-Learn Python und Glmnet in R.
Hat jemand versucht zu überprüfen, ob das Anpassen eines Elastic Net-Modells mit ElasticNetin scikit-learn in Python und glmnetin R an denselben Datensatz identische arithmetische Ergebnisse liefert? Ich habe mit vielen Kombinationen der Parameter experimentiert (da sich die beiden Funktionen in den Standardwerten unterscheiden, die sie an die Argumente übergeben) und …

3
Hauptvorteile von Gaußschen Prozessmodellen
Das Gaußsche Verfahren ist weit verbreitet, insbesondere bei der Emulation. Es ist bekannt, dass der Rechenaufwand hoch ist ( ).0(n3)0(n3)0(n^3) Was macht sie beliebt? Was sind ihre wichtigsten und verborgenen Vorteile? Warum werden sie anstelle von parametrischen Modellen verwendet (mit parametrischem Modell meine ich eine typische lineare Regression, bei der …

3
Regression mit verzerrten Daten
Der Versuch, die Anzahl der Besuche anhand der demografischen Daten und des Service zu berechnen. Die Daten sind sehr verzerrt. Histogramme: qq-Diagramme (links ist log): m <- lm(d$Visits~d$Age+d$Gender+city+service) m <- lm(log(d$Visits)~d$Age+d$Gender+city+service) cityund servicesind Faktorvariablen. Ich bekomme einen niedrigen p-Wert *** für alle Variablen, aber ich bekomme auch ein niedriges r-Quadrat …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.