Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


1
Wie soll ich Experimente mit individuellen Unterschieden mit wiederholten Messungen analysieren?
Ich mache quasi-experimentelle Psychologieforschung zu individuellen Unterschieden. Ich untersuche, wie Menschen, die sich in einer kognitiven Fähigkeit (die ich messe) unterscheiden, eine andere Aufgabe ausführen, die immer mindestens Manipulationen innerhalb des Subjekts (und manchmal zwischen Subjekten) beinhaltet. DVs sind normalerweise Reaktionszeit und / oder Genauigkeit. Bei dieser Frage möchte ich …

3
Wie identifiziere ich Ausreißer in den Leistungsdaten der Serververfügbarkeit?
Ich habe ein Python-Skript, das eine Liste von Listen mit Server-Verfügbarkeits- und Leistungsdaten erstellt, wobei jede Unterliste (oder 'Zeile') die Statistiken eines bestimmten Clusters enthält. Zum Beispiel sieht es gut formatiert so aus: ------- ------------- ------------ ---------- ------------------- Cluster %Availability Requests/Sec Errors/Sec %Memory_Utilization ------- ------------- ------------ ---------- ------------------- ams-a 98.099 …

1
Zwei-Stichproben-Permutation Kolmogorov-Smirnov-Tests
Während es einfacher ist, den Pearson-Chi-Quadrat / Cressie-Read-Typentest zu verwenden, möchte ich die Gleichheit der Proportionen in kkk Kategorien über zwei Gruppen unter Verwendung eines Kolmogorov-Smirnov-Typentests der von Pettitt & Stephens (1977 vorgeschlagenen Form) testen ) (siehe auch hier ). Dn=supπsup1≤j≤k|∑i=1j(fexp,π(i)−fobs,π(i))|Dn=supπsup1≤j≤k|∑i=1j(fexp,π(i)−fobs,π(i))| D_n = \sup_{\pi}\sup_{1 \leq j \leq k}\vert \sum_{i=1}^j(f_{exp,\pi(i)}-f_{obs,\pi(i)})\vertππ\pif.,if.,if_{.,i}iiiDn=12∑i=1k|fexp,i−fobs,i|Dn=12∑i=1k|fexp,i−fobs,i| D_n …


2
Boxplots als Tabellen
Wir bereiten ein Manuskript vor und der Herausgeber hat uns gebeten, eine Figur mit einem Boxplot "wegen des genaueren Dateninhalts" in eine Tabelle umzuwandeln. Während ich denke, dass Boxplots ziemlich anständig sind, etwas über die Daten zu enthüllen, habe ich mich gefragt, was ihr darüber denkt? Entscheiden Sie sich (oft) …


2
Ist die Probenkurtose hoffnungslos voreingenommen?
Ich betrachte die Stichproben-Kurtosis einer ziemlich verzerrten Zufallsvariablen, und die Ergebnisse scheinen inkonsistent zu sein. Um das Problem einfach zu veranschaulichen, habe ich mir die Beispielkurtose eines logarithmisch normalen Wohnmobils angesehen. In R (was ich langsam lerne): library(moments); samp_size = 2048; n_trial = 4096; kvals <- rep(NA,1,n_trial); #preallocate for (iii …


3
Testen gepaarter Frequenzen auf Unabhängigkeit
Ich hoffe, das ist nicht viel zu einfach oder überflüssig. Ich habe mich nach Rat umgesehen, bin mir aber bisher noch nicht sicher, wie ich vorgehen soll. Meine Daten bestehen aus Zählungen einer bestimmten Struktur, die in Gesprächen zwischen Gesprächspartnerpaaren verwendet werden. Die Hypothese, die ich testen möchte, lautet wie …

4
Suchen Sie eine Verteilung, die vielleicht ungewöhnlich ist und mit zwei Datenpunkten und Experteneinschränkungen übereinstimmt?
Ich versuche, eine vorherige Verteilung für eine Bayes'sche Metaanalyse anzugeben. Ich habe die folgenden Informationen zu einer Zufallsvariablen: Zwei Beobachtungen: 3.0, 3.6 Ein Wissenschaftler, der die Variable untersucht, hat mir gesagt, dass ist und dass Werte bis 6 eine Wahrscheinlichkeit ungleich Null haben.P(X&lt;2)=P(X&gt;8)=0P(X&lt;2)=P(X&gt;8)=0P(X<2)=P(X>8)=0 Ich habe den folgenden Optimierungsansatz verwendet (der …

2
Wie berechne ich die Stichprobengröße für die Simulation, um ein gewisses Maß an Güte in meinen Ergebnissen zu erzielen?
Ich bin ein Statistik-Neuling, also entschuldige mich im Voraus, wenn ich eine Kopffrage stelle. Ich habe nach Antworten auf meine Frage gesucht, aber ich finde, dass viele der Themen entweder zu spezifisch sind oder schnell über das hinausgehen, was ich derzeit verstehe. Ich habe einige Simulationsarbeiten, die große Datensätze enthalten, …

1
Bias für Kernel Density Estimator (periodischer Fall)
Der Kernel-Dichteschätzer ist gegeben durch wobei mit einer unbekannten Dichte , - Bandbreite,f^(x,h)=1nh∑i=1nK(x−Xih)f^(x,h)=1nh∑i=1nK(x−Xih)\hat{f}(x,h)=\frac{1}{nh}\sum_{i=1}^{n}K(\frac{x-X_{i}}{h})X1,...XnX1,...XnX_1,...X_nfffhhh KKK - Kernelfunktion ( , , ). Die Vorspannung kann unter Verwendung der Taylor-Erweiterung berechnet werden: ∫∞−∞K(x)dx=1∫−∞∞K(x)dx=1\int_{-\infty}^{\infty}K(x)dx=1∫∞−∞K(x)xdx=0∫−∞∞K(x)xdx=0\int_{-\infty}^{\infty}K(x)xdx=0∫∞−∞K(x)x2dx&lt;∞∫−∞∞K(x)x2dx&lt;∞\int_{-\infty}^{\infty}K(x)x^2dx<\infty∫∞−∞1hK(x−yh)f(y)dy−f(x)=∫∞−∞K(y)(f(x−hy)−f(x))dy∫−∞∞1hK(x−yh)f(y)dy−f(x)=∫−∞∞K(y)(f(x−hy)−f(x))dy\int_{-\infty}^{\infty}\frac{1}{h}K(\frac{x-y}{h})f(y)dy-f(x)=\int_{-\infty}^{\infty}K(y)\left(f(x-hy)-f(x)\right)dy =∫∞−∞K(y)(f′(x)hy+12f′′(x)(hy)2+o(h2))dy=12f′′(x)h2+o(h2)=∫−∞∞K(y)(f′(x)hy+12f″(x)(hy)2+o(h2))dy=12f″(x)h2+o(h2)=\int_{-\infty}^{\infty}K(y)\left(f'(x)hy+\frac{1}{2}f''(x)(hy)^{2}+o(h^{2})\right)dy=\frac{1}{2}f''(x)h^{2}+o(h^{2}) Umgang mit periodischem Kernel und fff ( ∫10K(x)dx=1∫01K(x)dx=1\int_{0}^{1}K(x)dx=1 , ∫10K(x)xdx=0∫01K(x)xdx=0\int_{0}^{1}K(x)xdx=0 , ∫10K(x)x2dx&lt;∞∫01K(x)x2dx&lt;∞\int_{0}^{1}K(x)x^2dx<\infty )? Wie kann ich die Taylor-Erweiterung verwenden? …


1
Was sind die Vorteile der ANOVA gegenüber einem normalen linearen Modell?
Ich experimentiere mit R und habe festgestellt, dass eine anova () ein Objekt vom Typ lm benötigt. Aber warum sollte ich danach mit einer Anova fortfahren: &gt; x &lt;- data.frame(rand=rnorm(100), factor=sample(c("A","B","C"),100,replace=TRUE)) &gt; head(x) rand factor 1 0.9640502 B 2 -0.5038238 C 3 -1.5699734 A 4 -0.8422324 B 5 0.2489113 B …
8 r  anova 

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.