Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Berechnung der besten Teilmenge von Prädiktoren für die lineare Regression
Welche Methoden stehen für die Auswahl von Prädiktoren in multivariater linearer Regression mit geeigneten Prädiktoren zur Verfügung, um eine "optimale" Teilmenge der Prädiktoren zu finden, ohne alle 2 p Teilmengen explizit zu testen ? In 'Applied Survival Analysis' beziehen sich Hosmer & Lemeshow auf Kuks Methode, aber ich kann das …

2
Vergleich zweier genetischer Algorithmen
Ich habe zwei Implementierungen eines genetischen Algorithmus, die sich gleichwertig verhalten sollen. Aufgrund technischer Einschränkungen, die nicht gelöst werden können, ist ihre Ausgabe bei gleicher Eingabe jedoch nicht exakt gleich. Trotzdem möchte ich zeigen, dass es keinen signifikanten Leistungsunterschied gibt. Ich habe 20 Läufe mit der gleichen Konfiguration für jeden …


2
Wie identifiziere ich Übertragungsfunktionen in einem Zeitreihen-Regressionsprognosemodell?
Ich versuche, ein Zeitreihen-Regressionsprognosemodell für eine Ergebnisvariable in US-Dollar in Bezug auf andere Prädiktoren / Eingabevariablen und autokorrelierte Fehler zu erstellen. Diese Art von Modell wird auch als dynamisches Regressionsmodell bezeichnet. Ich muss lernen, wie man Übertragungsfunktionen für jeden Prädiktor identifiziert, und würde gerne von Ihnen hören, wie Sie genau …


2
Wie staple ich zwei Graphen vertikal mit derselben x-Skala, aber einer anderen y-Skala in R?
Schöne Grüße, Derzeit mache ich folgendes in R: require(zoo) data <- read.csv(file="summary.csv",sep=",",head=TRUE) cum = zoo(data$dcomp, as.Date(data$date)) data = zoo(data$compressed, as.Date(data$date)) data <- aggregate(data, identity, tail, 1) cum <- aggregate(cum, identity, sum, 1) days = seq(start(data), end(data), "day") data2 = na.locf(merge(data, zoo(,days))) plot(data2,xlab='',ylab='compressed bytes',col=rgb(0.18,0.34,0.55)) lines(cum,type="h",col=rgb(0,0.5,0)) Ausschnitt aus summary.csv: date,revision,file,lines,nclass,nattr,nrel,bytes,compressed,diff,dcomp 2007-07-25,16,model.xml,96,11,22,5,4035,991,0,0 2007-07-27,17,model.xml,115,16,26,6,4740,1056,53,777 …


5
Ist eine Variable in einem linearen Regressionsmodell signifikant?
Ich habe ein lineares Regressionsmodell mit der Stichprobe und den variablen Beobachtungen und möchte wissen: Gibt an, ob eine bestimmte Variable signifikant genug ist, um im Modell enthalten zu bleiben. Ob eine andere Variable (mit Beobachtungen) in das Modell aufgenommen werden soll. Welche Statistiken können mir helfen? Wie können sie …





7
Normalverteilung und monotone Transformationen
Ich habe gehört, dass viele Mengen, die in der Natur vorkommen, normal verteilt sind. Dies wird normalerweise mit dem zentralen Grenzwertsatz gerechtfertigt, der besagt, dass Sie eine Normalverteilung erhalten, wenn Sie eine große Anzahl von iid-Zufallsvariablen mitteln. So kann beispielsweise ein Merkmal, das durch die additive Wirkung einer großen Anzahl …

4
Berechnung des Verhältnisses der für die Modellanpassung / Schulung und Validierung verwendeten Probendaten
Bereitstellung einer Stichprobengröße "N", die ich zur Vorhersage von Daten verwenden möchte. Wie kann ich die Daten so unterteilen, dass ich einige davon zum Erstellen eines Modells und die restlichen Daten zum Validieren des Modells verwende? Ich weiß, dass es keine Schwarz-Weiß-Antwort darauf gibt, aber es wäre interessant, einige "Faustregeln" …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.