Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Standardfehler einer Zählung
Ich habe einen Datensatz von Vorfallsfällen nach Jahreszeit einer seltenen Krankheit. Angenommen, es gab 180 Fälle im Frühjahr, 90 im Sommer, 45 im Herbst und 210 im Winter. Ich kämpfe mit der Frage, ob es angebracht ist, Standardfehler an diese Zahlen anzuhängen. Die Forschungsziele sind insofern schlüssig, als wir nach …

1
Wiederherstellung von Rohkoeffizienten und Varianzen aus der orthogonalen Polynomregression
Es scheint, als hätte ich ein Regressionsmodell wie yi∼β0+β1xi+β2x2i+β3x3iyi∼β0+β1xi+β2xi2+β3xi3y_i \sim \beta_0 + \beta_1 x_i+\beta_2 x_i^2 +\beta_3 x_i^3Ich kann entweder ein Rohpolynom anpassen und unzuverlässige Ergebnisse erhalten oder ein orthogonales Polynom anpassen und Koeffizienten erhalten, die keine direkte physikalische Interpretation haben (z. B. kann ich sie nicht verwenden, um die Orte …

1
Wie man Varianzkomponenten mit lmer für Modelle mit zufälligen Effekten schätzt und mit lme-Ergebnissen vergleicht
Ich habe ein Experiment durchgeführt, bei dem ich verschiedene Familien aus zwei verschiedenen Bevölkerungsgruppen großgezogen habe. Jede Familie erhielt eine von zwei Behandlungen. Nach dem Experiment habe ich mehrere Merkmale an jedem Individuum gemessen. Um die Wirkung einer Behandlung oder einer Quelle sowie deren Wechselwirkung zu testen, verwendete ich ein …
14 r  anova  variance  lme4-nlme 


1
Finden lokaler Extrema einer Dichtefunktion mit Splines
Ich versuche, die lokalen Maxima für eine Wahrscheinlichkeitsdichtefunktion zu finden (gefunden mit der densityMethode von R ). Ich kann keine einfache Methode zum Umsehen von Nachbarn durchführen (bei der man sich an einem Punkt umsieht, um festzustellen, ob es sich um ein lokales Maximum in Bezug auf die Nachbarn handelt), …
14 r  pdf  splines  maximum 

3
Versteckte Markov-Modellschwelle
Ich habe ein Proof-of-Concept-System für die Schallerkennung mit mfcc- und Hidden-Markov-Modellen entwickelt. Es gibt vielversprechende Ergebnisse, wenn ich das System auf bekannte Geräusche teste. Obwohl das System, wenn ein unbekannter Ton eingegeben wird, das Ergebnis mit der genauesten Übereinstimmung zurückgibt und die Punktzahl nicht so eindeutig ist, ist es ein …


2
Lehnen Sie die Nullhypothese ab, wenn
Dies ist eindeutig nur eine Frage der Definition oder Konvention und hat praktisch kaum Bedeutung. Wenn αα\alpha auf seinen traditionellen Wert von 0,05 eingestellt ist, wird ein Wert von 0,0500000000000 als statistisch signifikant angesehen oder nicht? Wird die Regel zur Definition der statistischen Signifikanz normalerweise als oder ?p < α …

1
Welche Arten von Codierungen sind für kategoriale Variablen (in R) verfügbar und wann würden Sie sie verwenden?
Wenn Sie ein lineares Modell oder ein gemischtes Modell anpassen, stehen verschiedene Codierungstypen zur Verfügung, um eine kategoriale oder nominelle Varibale in eine Reihe von Variablen zu transformieren, für die Parameter geschätzt werden, z. B. Dummy-Conding (Standardeinstellung R) und Effektcodierung. Ich habe gehört, dass die Effektcodierung (manchmal auch als Abweichungs- …

3
Themenmodelle für kurze Dokumente
Inspiriert von dieser Frage frage ich mich, ob an Themenmodellen für große Sammlungen von extrem kurzen Texten gearbeitet wurde. Meiner Intuition nach sollte Twitter eine natürliche Inspiration für solche Modelle sein. Nach einigen begrenzten Experimenten sieht es jedoch so aus, als ob Standardthemenmodelle (LDA usw.) mit dieser Art von Daten …


5
Interpretation von Diskrepanzen zwischen R und SPSS mit explorativer Faktoranalyse
Ich bin ein Doktorand in Informatik. Ich habe eine explorative Faktorenanalyse für ein Forschungsprojekt durchgeführt. Meine Kollegen (die das Projekt leiten) verwenden SPSS, während ich R. bevorzuge. Dies spielte keine Rolle, bis wir eine große Diskrepanz zwischen den beiden statistischen Paketen entdeckten. Wir verwenden das Prinzipalachsen-Factoring als Extraktionsmethode (bitte beachten …

2
Frage zur logistischen Regression
Ich möchte eine binäre logistische Regression durchführen, um das Vorhandensein oder Nichtvorhandensein von Konflikten (abhängige Variable) aus einer Reihe unabhängiger Variablen über einen Zeitraum von 10 Jahren (1997-2006) zu modellieren, wobei jedes Jahr 107 Beobachtungen enthält. Meine Unabhängigen sind: Bodendegradation (kategorial für 2 Arten von Degradation); Bevölkerungswachstum (0 - nein; …


3
Crashkurs in robuster Mittelwertschätzung
Ich habe eine Menge (ungefähr 1000) Schätzungen, und alle sollen Schätzungen der langfristigen Elastizität sein. Etwas mehr als die Hälfte davon wird mit Methode A und der Rest mit Methode B geschätzt. Irgendwo las ich so etwas wie "Ich denke, Methode B schätzt etwas ganz anderes als Methode A, weil …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.