Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Nichtlineare SVM-Klassifizierung mit RBF-Kernel
Ich implementiere einen nichtlinearen SVM-Klassifikator mit RBF-Kernel. Mir wurde gesagt, dass der einzige Unterschied zu einer normalen SVM darin bestand, dass ich das Punktprodukt einfach durch eine Kernelfunktion ersetzen musste: Ich weiß, wie eine normale lineare SVM funktioniert, dh nachdem ich das quadratische Optimierungsproblem (doppelte Aufgabe) gelöst habe, berechne ich …

3
Grundlinienunterschiede in der RCT: Welche Variablen (falls vorhanden) sollten als Kovariaten aufgenommen werden?
Ich habe kürzlich eine Studie abgeschlossen, in der ich die Teilnehmer zufällig einer von zwei Behandlungsgruppen zugeordnet habe. Ich habe die Teilnehmer zu Studienbeginn, unmittelbar nach der Intervention, 1 Monat und 4 Monate an einer ziemlich großen Anzahl von Ergebnisvariablen getestet. Ich hatte vor, mehrere gemischte ANOVAs durchzuführen, um die …

3
Bewertung der Ergebnisse der linearen Regression
Ich habe ein lineares Regressionsproblem. Kurz gesagt, ich habe einen Datensatz, den ich in zwei Teilmengen unterteilt habe. Eine Teilmenge wird verwendet, um die lineare Regression zu finden (Trainingsuntermenge), eine andere wird verwendet, um sie zu bewerten (Bewertungsuntermenge). Meine Frage ist, wie das Ergebnis dieser linearen Regression bewertet werden kann, …

1
Warum gibt es in R so viele Zufallsgeneratoren?
Ein kurzer Blick auf der Hilfeseite des Zufallszahlengenerators von R zeigt , dass Sie unter 7 vordefinierte Generatoren können wählen , ( Wichmann-Hill, Marsaglia-Multicarry, Super-Duper, Mersenne-Twister, Knuth-TAOCP-2002, Knuth-TAOCP, L'Ecuyer-CMRG). ?Random Die Standardeinstellung ist Mersenne-Twister , was sehr gut zu sein scheint. Warum sollten Sie jemals einen anderen verwenden müssen?

1
MCMC und Datenerweiterung
Ich habe mir eine Frage zur MCMC-Datenerweiterung angesehen. Die allgemeine Form der Frage lautet wie folgt: Angenommen, die in einem Prozess gesammelten Daten deuten auf und ein Prior für den Ratenparameter wird als . Die Daten werden in einer typischen Form aufgezeichnet und dargestellt (dh die Anzahl der Vorkommen jedes …


2
Erläutern Sie das Kernel-Dichtediagramm
Ich führe eine Simulation auf einem linearen Modell aus. Ich erhalte 1000 Ergebnisse und die Ergebnisse werden in ein Dichtediagramm eingetragen. Ich verstehe, dass die x-Achse die abhängige Variable ist und die y-Achse die Kerneldichte darstellt. Yaxis ist in Dezimalzahlen von 0 bis 0,15. Wie erkläre ich das den anderen …

1
Welche Ebene soll beim Vergleich von Probanden in einer hierarchischen Bayes'schen Analyse verwendet werden?
Angenommen, ich habe ein Experiment, bei dem ich die Reaktionszeit einer Reihe von Probanden teste, bei denen jeder Proband viele Reaktionszeitversuche durchführt. In einem Bayes'schen Rahmen könnten die Reaktionszeiten ( ) durch ein hierarchisches Modell mit vorheriger Verteilung sowohl auf Subjektebene als auch für die gesamte Subjektgruppe modelliert werden. Ein …



2
Nicht parametrisch für Zweiwege-ANOVA (3x3)
Meine abhängige Variable ist kontinuierlich, nicht normal (nach links verschoben nach Shapiro-Wilk-Test). Ich habe zwei unabhängige Variablen (Behandlungsgruppe nach Farbe, Lebensmitteltyp). Innerhalb jeder unabhängigen Variablen gibt es 3 Ebenen. Die Anzahl der Beobachtungen für jede unabhängige Variable ist nicht gleich. Ich habe nichtparametrische Tests wie den Friedman-Test und den Scheirer-Ray-Hare-Test …

1
Wo soll ich anfangen?: Zeitreihen mit ungleichmäßigen Abständen, mit vielen Ausreißern oder Zufälligkeiten
Ich weiß nicht genau, was möglich ist, und möchte einen Zeiger in die richtige Richtung. Ich habe Zeit- und Positionsmessungen, die von einer Person, die läuft, einem Fahrzeug auf einer Straße, einem Parkplatz oder einem Drucker in einem Büro stammen können. Ich muss die Fahrzeiten für Fahrzeuge zwischen zwei Punkten …


6
Ist die Verwendung derselben Daten für die Merkmalsauswahl und Kreuzvalidierung voreingenommen oder nicht?
Wir haben einen kleinen Datensatz (ca. 250 Beispiele * 100 Features), auf dem wir nach Auswahl der besten Feature-Teilmenge einen binären Klassifikator erstellen möchten. Nehmen wir an, wir partitionieren die Daten in: Schulung, Validierung und Prüfung Für die Merkmalsauswahl wenden wir ein Wrapper-Modell an, das auf der Auswahl von Merkmalen …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.