Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Annahmen des verallgemeinerten linearen Modells
Ich habe ein verallgemeinertes lineares Modell mit einer einzelnen Antwortvariablen (stetig / normalverteilt) und 4 erklärenden Variablen (von denen 3 Faktoren sind und die vierte eine ganze Zahl ist) erstellt. Ich habe eine Gaußsche Fehlerverteilung mit einer Identitätsverknüpfungsfunktion verwendet. Ich überprüfe derzeit, ob das Modell die folgenden Annahmen des verallgemeinerten …


1
Lineare Mixed-Effects-Modellierung mit Zwillingsstudiendaten
Angenommen, ich habe eine Antwortvariable yijyijy_{ij} , die vom jjj ten Geschwister in der iii ten Familie gemessen wurde . Darüber hinaus sind einige Verhaltensdaten xijxijx_{ij} in der gleichen Zeit von jedem Probanden erhoben wurden. Ich versuche die Situation mit dem folgenden linearen Mixed-Effects-Modell zu analysieren: yij=α0+α1xij+δ1ixij+εijyij=α0+α1xij+δ1ixij+εijy_{ij} = \alpha_0 + …

2
Erklären der Quantilregression für Nichtstatistiker
Ich habe kürzlich eine Arbeit in einem Psychologie-Journal eingereicht, in der ich die Quantile-Regression verwendet habe. Obwohl ich dachte, ich hätte bereits genug Gedanken in eine klare Darstellung der Quantilregression gesteckt, fragten die Rezensenten nach besseren Erklärungen für die Quantilregressionstechnik, die nur mit der Standard-OLS-Regression vertraut ist. Wie kann man …

1
Was bedeuten die Pfeile in einem PCA-Biplot?
Betrachten Sie den folgenden PCA-Biplot: library(mvtnorm) set.seed(1) x <- rmvnorm(2000, rep(0, 6), diag(c(5, rep(1,5)))) x <- scale(x, center=T, scale=F) pc <- princomp(x) biplot(pc) Es sind ein paar rote Pfeile eingezeichnet. Was bedeuten sie? Ich wusste, dass der erste mit "Var1" beschriftete Pfeil in die unterschiedlichste Richtung des Datensatzes zeigen sollte …
14 r  pca  linear-algebra  biplot 

4
Prüfen, ob die Genauigkeitsverbesserung signifikant ist
Angenommen, ich habe einen Algorithmus, der die Dinge in zwei Kategorien unterteilt. Ich kann die Genauigkeit des Algorithmus an beispielsweise 1000 Testobjekten messen. Angenommen, 80% der Objekte sind korrekt klassifiziert. Nehmen wir an, ich ändere den Algorithmus irgendwie so, dass 81% der Dinge richtig klassifiziert sind. Können Statistiken Aufschluss darüber …

9
Referenz mit Verteilungen mit verschiedenen Eigenschaften
Ich stelle oft Fragen wie: "Ich weiß, dass diese Variable in und der größte Teil der Masse in und dann kontinuierlich gegen 1 abfällt. Mit welcher Verteilung kann ich sie modellieren? "( 0 , 1 ) ( 0xxx(0,1)(0,1)(0,1)(0,.20)(0,.20)(0,.20) In der Praxis verwende ich immer wieder dieselben Distributionen, nur weil ich …


4
Schätzung des Bruchpunktes in einem gebrochenen Stab / stückweise linearen Modell mit zufälligen Effekten in R [Code und Ausgabe enthalten]
Kann mir bitte jemand sagen, wie R den Bruchpunkt in einem stückweisen linearen Modell (als fester oder zufälliger Parameter) abschätzen soll, wenn ich auch andere zufällige Effekte abschätzen muss? Im Folgenden ist ein Spielzeugbeispiel aufgeführt, das eine Hockeyschläger- / gebrochener-Schläger-Regression mit zufälligen Steigungsabweichungen und einer zufälligen y-Achsenabschnittsabweichung für einen Bruchpunkt …



3
Wie berechnet man die Wahrscheinlichkeit, die mit absurd großen Z-Scores verbunden ist?
Softwarepakete zur Erkennung von Netzwerkmotiven können enorm hohe Z-Scores liefern (der höchste Wert, den ich gesehen habe, ist 600.000+, aber Z-Scores von mehr als 100 sind durchaus üblich). Ich habe vor zu zeigen, dass diese Z-Scores falsch sind. Riesige Z-Scores entsprechen extrem niedrigen zugehörigen Wahrscheinlichkeiten. Die Werte der zugehörigen Wahrscheinlichkeiten …

1
Warum sind Beziehungen in nichtparametrischen Statistiken so schwierig?
Mein nichtparametrischer Text " Praktische nichtparametrische Statistik" enthält häufig klare Formeln für Erwartungen, Abweichungen, Teststatistiken und dergleichen, enthält jedoch den Vorbehalt, dass dies nur funktioniert, wenn wir Bindungen ignorieren. Bei der Berechnung der Mann-Whitney-U-Statistik wird empfohlen, beim Vergleich, der größer ist, gebundene Paare auszuschließen. Ich verstehe, dass Bindungen nicht wirklich …

4
Berechnung der AUPR in R [geschlossen]
Geschlossen. Diese Frage ist nicht zum Thema . Derzeit werden keine Antworten akzeptiert. Möchten Sie diese Frage verbessern? Aktualisieren Sie die Frage so dass es beim Thema für Kreuz Validated. Geschlossen vor 6 Monaten . Es ist leicht, einen Paketberechnungsbereich unter ROC zu finden, aber gibt es ein Paket, das …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.