Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Cross-Validierung oder Bootstrapping zur Bewertung der Klassifizierungsleistung?
Welche Stichprobenmethode eignet sich am besten, um die Leistung eines Klassifikators für einen bestimmten Datensatz zu bewerten und mit anderen Klassifikatoren zu vergleichen? Kreuzvalidierung scheint Standard zu sein, aber ich habe gelesen, dass Methoden wie .632-Bootstrap eine bessere Wahl sind. Als Follow-up: Hat die Auswahl der Leistungsmetrik Einfluss auf die …

2
Warum verwenden wir in der Überlebensanalyse semiparametrische Modelle (Cox-proportionale Gefahren) anstelle von vollständig parametrischen Modellen?
Diese Frage wurde von Mathematics Stack Exchange migriert, da sie auf Cross Validated beantwortet werden kann. Vor 6 Jahren migriert . Ich habe das Cox Proportional Hazards-Modell untersucht, und diese Frage wird in den meisten Texten übersehen. Cox schlug vor, die Koeffizienten der Hazard-Funktion mithilfe einer Partial-Likelihood-Methode anzupassen, aber warum …


2
Wie groß ist ein Trainingsset?
Gibt es eine gängige Methode, um zu bestimmen, wie viele Trainingsmuster erforderlich sind, um einen Klassifikator (in diesem Fall einen LDA) zu trainieren, um eine Mindestgenauigkeit für die Verallgemeinerung des Schwellenwerts zu erhalten? Ich frage, weil ich die Kalibrierungszeit minimieren möchte, die normalerweise für eine Gehirn-Computer-Schnittstelle erforderlich ist.

3
Bestimmen Sie verschiedene Cluster von 1d-Daten aus der Datenbank
Ich habe eine Datenbanktabelle von Datenübertragungen zwischen verschiedenen Knoten. Dies ist eine riesige Datenbank (mit fast 40 Millionen Überweisungen). Eines der Attribute ist die Anzahl der Bytes (nBytes), die zwischen 0 Byte und 2 Terabytes übertragen werden. Ich möchte die nbytes so gruppieren, dass gegebene k Cluster einige x1 Übertragungen …

3
Wie vergleichen Bayesianer Verteilungen?
Ich denke also, dass ich die Grundlagen der frequentistischen Wahrscheinlichkeit und der statistischen Analyse (und wie schlecht sie verwendet werden können) gut verstehe. In einer frequentistischen Welt ist es sinnvoll, eine Frage wie "Unterscheidet sich diese Verteilung von jener Verteilung?" Zu stellen, da angenommen wird, dass Verteilungen real, objektiv und …

2
Wie kann eine asymmetrische Verlustfunktion für die Regression entworfen und implementiert werden?
Problem Bei der Regression berechnet man normalerweise den mittleren quadratischen Fehler (MSE) für eine Stichprobe: , um die Qualität eines Prädiktors zu messen.MSE = 1n∑i = 1n( g( xich) - gˆ( xich) )2MSE=1n∑ich=1n(G(xich)-G^(xich))2 \text{MSE} = \frac{1}{n} \sum_{i=1}^n\left(g(x_i) - \widehat{g}(x_i)\right)^2 Im Moment arbeite ich an einem Regressionsproblem, bei dem das Ziel …


1
Standardabweichung der Beobachtungen in Gruppen
Ich habe einen Datensatz mit Probenbeobachtungen, die als Anzahl in Bereichsfächern gespeichert sind. z.B: min/max count 40/44 1 45/49 2 50/54 3 55/59 4 70/74 1 Nun ist es ziemlich einfach, daraus eine Schätzung des Durchschnitts zu finden. Verwenden Sie einfach den Mittelwert (oder Median) jedes Entfernungsbereichs als Beobachtung und …

3
ROC-Kurve für diskrete Klassifikatoren wie SVM: Warum nennen wir es immer noch eine "Kurve"? Ist es nicht nur ein "Punkt"?
In der Diskussion: Wie man eine ROC-Kurve für die binäre Klassifikation erzeugt , war meiner Meinung nach die Verwirrung, dass ein "binärer Klassifikator" (ein Klassifikator, der zwei Klassen trennt) für Yang ein so genannter "diskreter Klassifikator" war (der erzeugt) diskrete Ausgänge (0/1 wie ein SVM) und keine kontinuierlichen Ausgänge wie …

5
Wie robust ist der T-Test für unabhängige Stichproben, wenn die Verteilungen der Stichproben nicht normal sind?
Ich habe gelesen, dass der t- Test "ziemlich robust" ist, wenn die Verteilung der Stichproben von der Normalität abweicht. Natürlich ist es die Stichprobenverteilung der Unterschiede, die wichtig sind. Ich habe Daten für zwei Gruppen. Eine der Gruppen ist in Bezug auf die abhängige Variable stark verzerrt. Die Stichprobengröße ist …



2
Wie füge ich einen Interaktionsbegriff in GAM ein?
Der folgende Code bewertet die Ähnlichkeit zwischen zwei Zeitreihen: set.seed(10) RandData <- rnorm(8760*2) America <- rep(c('NewYork','Miami'),each=8760) Date = seq(from=as.POSIXct("1991-01-01 00:00"), to=as.POSIXct("1991-12-31 23:00"), length=8760) DatNew <- data.frame(Loc = America, Doy = as.numeric(format(Date,format = "%j")), Tod = as.numeric(format(Date,format = "%H")), Temp = RandData, DecTime = rep(seq(1, length(RandData)/2) / (length(RandData)/2), 2)) require(mgcv) mod1 …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.