Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Klassifikator für nur eine Klasse
In einer einfachen Klassifikation haben wir zwei Klassen: Klasse-0 und Klasse-1. In einigen Daten habe ich nur Werte für Klasse 1, also keine für Klasse 0. Jetzt denke ich darüber nach, ein Modell zu erstellen, um die Daten für Klasse 1 zu modellieren. Wenn also neue Daten kommen, wird dieses …

2
Test der Unabhängigkeit gegen Test der Homogenität
Ich unterrichte einen Statistik-Grundkurs und werde heute den Chi-Quadrat-Test der Unabhängigkeit für zwei Kategorien und den Test der Homogenität behandeln. Diese beiden Szenarien unterscheiden sich konzeptionell, können jedoch dieselbe Teststatistik und -verteilung verwenden. Bei einem Homogenitätstest wird angenommen, dass Grenzsummen für eine der Kategorien Teil des Entwurfs selbst sind - …

2
Maximal & häufig geschlossen - Antwort enthalten
My dataset:My dataset:My \ \ dataset: 1:A,B,C,E1:A,B,C,E1: A,B,C,E 2:A,C,D,E2:A,C,D,E2:A,C,D,E 3: B,C,E3: B,C,E3:\ \ \ \ \ B,C,E 4:A,C,D,E4:A,C,D,E4:A,C,D,E 5: C,D,E5: C,D,E5:\ \ \ \ C, D, E 6: A,D,E6: A,D,E6: \ \ \ \ A, D,E Ich möchte die maximal häufigen Objektgruppen und die geschlossenen häufigen Objektgruppen herausfinden . Die …


1
Was sind die Einschränkungen von Kernel-Methoden und wann sollten Kernel-Methoden verwendet werden?
Kernel-Methoden sind bei vielen überwachten Klassifizierungsaufgaben sehr effektiv. Was sind die Einschränkungen von Kernel-Methoden und wann sollten Kernel-Methoden verwendet werden? Was sind die Fortschritte der Kernel-Methoden, insbesondere im Zeitalter großer Datenmengen? Was ist der Unterschied zwischen Kernel-Methoden und dem Lernen mehrerer Instanzen? Wenn die Daten sind 500x10000, 500ist die Anzahl …



1
Log Likelihood für GLM
Im folgenden Code führe ich eine logistische Regression für gruppierte Daten mit glm und "von Hand" mit mle2 durch. Warum gibt mir die logLik-Funktion in R eine Log-Wahrscheinlichkeit logLik (fit.glm) = - 2.336, die sich von der logLik (fit.ml) = - 5.514 unterscheidet, die ich von Hand erhalte? library(bbmle) #successes …

1
Was ist der Unterschied zwischen Wahrscheinlichkeit und Fuzzy-Logik?
Ich arbeite seit Jahren mit Fuzzy-Logik (FL) und weiß, dass es Unterschiede zwischen FL und Wahrscheinlichkeit gibt, insbesondere in Bezug auf den Umgang von FL mit Unsicherheit. Ich möchte jedoch fragen, welche weiteren Unterschiede zwischen FL und Wahrscheinlichkeit bestehen. Mit anderen Worten, wenn ich mich mit Wahrscheinlichkeiten befasse (Informationen zusammenführen, …
10 bayes  fuzzy 


3
Bootstrapping-Residuen: Mache ich es richtig?
Zuallererst: Nach meinem Verständnis funktioniert das Bootstrapping von Residuen wie folgt: Modell an Daten anpassen Berechnen Sie die Residuen Probieren Sie die Residuen erneut aus und addieren Sie sie zu 1. Modell an neuen Datensatz von 3 anpassen. Wiederholen Sie die nZeiten, aber fügen Sie immer die neu abgetasteten Residuen …

3
Schätzung des Parameters einer gleichmäßigen Verteilung: falsch vor?
Wir haben N Proben, , aus einer gleichmäßigen Verteilung wobei unbekannt ist. Schätzen Sie aus den Daten.XiXiX_i[0,θ][0,θ][0,\theta]θθ\thetaθθ\theta Also, Bayes 'Regel ... f(θ|Xi)=f(Xi|θ)f(θ)f(Xi)f(θ|Xi)=f(Xi|θ)f(θ)f(Xi)f(\theta | {X_i}) = \frac{f({X_i}|\theta)f(\theta)}{f({X_i})} und die Wahrscheinlichkeit ist: f(Xi|θ)=∏Ni=11θf(Xi|θ)=∏i=1N1θf({X_i}|\theta) = \prod_{i=1}^N \frac{1}{\theta} (bearbeiten: wenn für alle und 0 sonst - danke whuber)0≤Xi≤θ0≤Xi≤θ0 \le X_i \le \thetaiii aber ohne …

1
Permutationstest zum Vergleich einer einzelnen Probe mit einem Mittelwert
Wie wird mit dem Mittelwert umgegangen, wenn Personen Permutationstests durchführen, um eine einzelne Stichprobe mit einem Mittelwert zu vergleichen (z. B. wie bei einem Permutationstest)? Ich habe Implementierungen gesehen, die einen Mittelwert und eine Stichprobe für einen Permutationstest verwenden, aber es ist unklar, was sie tatsächlich unter der Haube tun. …

1
Zwei Methoden für Bootstrap-Signifikanztests
Mit Bootstrap berechne ich p-Werte von Signifikanztests mit zwei Methoden: Resampling unter der Nullhypothese und Zählen der Ergebnisse mindestens so extrem wie das Ergebnis aus den Originaldaten Resampling unter der alternativen Hypothese und Zählen der Ergebnisse, die mindestens so weit vom ursprünglichen Ergebnis entfernt sind wie der Wert, der der …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.