Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Anpassen eines Exponentialmodells an Daten
Diese Frage wurde von Stack Overflow migriert, da sie bei Cross Validated beantwortet werden kann. Vor 8 Jahren migriert . Ich habe 2 Variablen, beide aus der Klasse "numerisch": > head(y) [1] 0.4651804 0.6185849 0.3766175 0.5489810 0.3695258 0.4002567 > head(x) [1] 59.32820 68.46436 80.76974 132.90824 216.75995 153.25551 Ich habe sie …
21 r 



2
Wie benutzt man Gewichte in der Funktion lm in R?
Verschlossen . Diese Frage und ihre Antworten sind gesperrt, da die Frage nicht zum Thema gehört, aber von historischer Bedeutung ist. Derzeit werden keine neuen Antworten oder Interaktionen akzeptiert. Könnte jemand einige Hinweise zur Verwendung des weightsArguments in der lmFunktion von R geben ? Angenommen, Sie haben versucht, ein Modell …
21 r  regression 

3
Poisson-Regression vs. Log-Count-Regression nach kleinsten Quadraten?
Eine Poisson-Regression ist ein GLM mit einer Log-Link-Funktion. Eine alternative Möglichkeit, nicht normalverteilte Zählerdaten zu modellieren, besteht in der Vorverarbeitung, indem das Protokoll (bzw. das Protokoll (1 + Zähler) zur Behandlung von Nullen) verwendet wird. Wenn Sie eine Regression der kleinsten Quadrate für die Anzahl der logarithmischen Antworten durchführen, hängt …

2
Wie man zwischen Lernalgorithmen wählt
Ich muss ein Programm implementieren, das Datensätze basierend auf einigen Trainingsdaten in 2 Kategorien (wahr / falsch) klassifiziert, und ich habe mich gefragt, welchen Algorithmus / welche Methodik ich betrachten soll. Es scheint eine Menge von ihnen zur Auswahl zu geben - künstliches neuronales Netzwerk, genetischer Algorithmus, maschinelles Lernen, Bayesianische …

2
Schwierigkeiten beim Testen der Linearität in der Regression
In der statistischen Modellierung: Die zwei Kulturen schreibt Leo Breiman Die derzeitige angewandte Praxis besteht darin, die Anpassung des Datenmodells mithilfe von Anpassungstests und Restanalyse zu überprüfen. Vor einigen Jahren habe ich einmal ein simuliertes Regressionsproblem in sieben Dimensionen mit einem kontrollierten Maß an Nichtlinearität erstellt. Standardtests der Anpassungsgüte lehnten …

5
Einführung in die Maßtheorie
Ich möchte mehr über nichtparametrische Bayesianische (und verwandte) Techniken erfahren. Mein Hintergrund liegt in der Informatik, und obwohl ich noch nie einen Kurs in Maß- oder Wahrscheinlichkeitstheorie belegt habe, habe ich nur ein begrenztes Maß an formaler Ausbildung in Wahrscheinlichkeits- und Statistikwissenschaften erhalten. Kann mir jemand eine lesbare Einführung in …


7
Wie ist das Konfidenzintervall der Mittelwertdifferenz in einem Stichproben-T-Test zu interpretieren?
SPSS liefert die Ausgabe "Konfidenzintervall der Differenzmittel". Ich habe an einigen Stellen gelesen, dass es bedeutet, dass "95 mal von 100, unsere mittlere Stichprobendifferenz wird zwischen diesen Grenzen liegen". Ich finde dies unklar. Kann jemand eine klarere Formulierung vorschlagen, um das "Konfidenzintervall der Mittelwertdifferenz" zu erklären? Diese Ausgabe erscheint im …

2
Dokumentähnlichkeit messen
Um (Text-) Dokumente zu gruppieren, müssen Sie die Ähnlichkeit zwischen Dokumentenpaaren messen. Zwei Alternativen sind: Vergleichen Sie Dokumente als Termvektoren mit Cosine Similarity - und TF / IDF als Gewichtungen für Terme. Vergleichen Sie die Wahrscheinlichkeitsverteilung jedes Dokuments mit f-Divergenz, z. B. Kullback-Leibler-Divergenz Gibt es einen intuitiven Grund, eine Methode …





Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.