Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Proportionsdaten transformieren: Wenn Bögen in Quadratwurzel nicht ausreichen
Gibt es eine (stärkere?) Alternative zur Arcsin-Quadratwurzel-Transformation für Prozent- / Proportionsdaten? In dem Datensatz, an dem ich gerade arbeite, bleibt eine ausgeprägte Heteroskedastizität bestehen, nachdem ich diese Transformation angewendet habe, dh die Darstellung der Residuen gegenüber den angepassten Werten ist immer noch sehr rhomboid. Bearbeitet, um auf Kommentare zu antworten: …

2
Gibt an, ob strukturelle Gleichungsmodelle zur Analyse von Beobachtungsstudien in der Psychologie verwendet werden sollen
Mir ist aufgefallen, dass dieses Problem in der statistischen Beratung häufig auftritt, und ich war sehr gespannt auf Ihre Gedanken. Kontext Ich spreche oft mit Forschungsstudenten, die eine Studie ungefähr wie folgt durchgeführt haben: Beobachtungsstudie Die Stichprobengröße kann 100, 200, 300 usw. betragen. Es wurden mehrere psychologische Skalen gemessen (z. …

2
"Interestingness" -Funktion für StackExchange-Fragen
Diese Frage wurde von Mathematics Stack Exchange migriert, da sie auf Cross Validated beantwortet werden kann. Vor 8 Jahren migriert . Ich versuche, ein Data-Mining-Paket für StackExchange-Sites zusammenzustellen, und insbesondere stecke ich fest, um die "interessantesten" Fragen zu ermitteln. Ich würde gerne die Fragenbewertung verwenden, aber die Verzerrung aufgrund der …

2
Wahl der Methode der saisonalen Zersetzung
Die saisonale Anpassung ist ein entscheidender Schritt, um die Daten für die weitere Forschung aufzubereiten. Forscher haben jedoch eine Reihe von Optionen für die trendzyklus-saisonale Zerlegung. Die gebräuchlichste rivalisierenden saisonaler Zersetzungsverfahren (durch die Anzahl der Zitate in empirischer Literatur Beurteilung) sind X-11 (12) -ARIMA, Tramo / Sitze (beide in realisiert …




4
Mittelung der Korrelationswerte
Angenommen, ich teste, wie die Variable unter verschiedenen Versuchsbedingungen von der Variablen Yabhängt X, und erhalte das folgende Diagramm: Die gestrichelten Linien in der obigen Grafik stellen die lineare Regression für jede Datenreihe dar (Versuchsaufbau), und die Zahlen in der Legende bezeichnen die Pearson-Korrelation für jede Datenreihe. Ich möchte die …

2
Schätzung der quadratischen und statistischen Signifikanz anhand des bestraften Regressionsmodells
Ich benutze das R-Paket bestraft , um geschrumpfte Koeffizientenschätzungen für einen Datensatz zu erhalten, bei dem ich viele Prädiktoren und wenig Wissen darüber habe, welche wichtig sind. Gibt es, nachdem ich die Abstimmungsparameter L1 und L2 ausgewählt und mit meinen Koeffizienten zufrieden bin, eine statistisch fundierte Möglichkeit, die Modellanpassung mit …


2
Wie benenne ich die Ticks in einem Python Matplotlib Boxplot?
Verschlossen . Diese Frage und ihre Antworten sind gesperrt, da die Frage nicht zum Thema gehört, aber von historischer Bedeutung ist. Derzeit werden keine neuen Antworten oder Interaktionen akzeptiert. Python matplotlib verfügt über einen Boxplot-Befehl . Normalerweise sind alle Teile des Diagramms numerisch markiert. Wie kann ich die Häkchen in …


6
Gutes Hilfsmittel, um ANOVA und ANCOVA zu verstehen?
Ich führe Experimente für eine Arbeit durch und suche ein interessantes Buch / eine interessante Website, um die Funktionsweise von ANOVA und ANCOVA richtig zu verstehen. Ich habe einen guten mathematischen Hintergrund, daher brauche ich nicht unbedingt eine vulgäre Erklärung. Ich möchte auch wissen, wie man feststellt, wann man ANOVA …

2
Anpassung für Kovariaten in der ROC-Kurvenanalyse
Bei dieser Frage geht es um die Schätzung der Cut-off-Scores in einem mehrdimensionalen Screening-Fragebogen, um einen binären Endpunkt bei Vorhandensein korrelierter Skalen vorherzusagen. Ich wurde gefragt, ob es wichtig ist, die zugehörigen Unterpunkte zu kontrollieren, wenn Cut-off-Scores für jede Dimension einer Messskala (Persönlichkeitsmerkmale) erstellt werden, die für das Alkoholismus-Screening verwendet …
20 epidemiology  roc 

3
Kombinieren von Konfidenzintervallen für eine Varianzkomponente eines Mixed-Effects-Modells bei Verwendung mehrerer Imputationen
Die Logik der Multiplen Imputation (MI) besteht darin, die fehlenden Werte nicht nur einmal, sondern mehrmals (typischerweise M = 5) zu unterstellen, was zu M vollständigen Datensätzen führt. Die M vervollständigten Datensätze werden dann mit Verfahren für vollständige Daten analysiert, bei denen die M Schätzungen und ihre Standardfehler unter Verwendung …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.