Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
abhängig von der Summe, wie ist die Verteilung der negativen Binome
Wenn ein negatives Binomial sind, wie ist dann die Verteilung von gegebenx1,x2,…,xnx1,x2,…,xnx_1, x_2, \ldots, x_n(x1,x2,…,xn)(x1,x2,…,xn)(x_1, x_2, \ldots, x_n) x1+x2+…+xn=Nx1+x2+…+xn=Nx_1 + x_2 + \ldots + x_n = N\quad ? NNN ist fest. Wenn x1,x2,…,xnx1,x2,…,xnx_1, x_2, \ldots, x_n Poisson sind, ist (x_1, x_2, \ ldots, x_n) abhängig von der Summe (x1,x2,…,xn)(x1,x2,…,xn)(x_1, x_2, …

2
Kollaboratives Filtern durch Matrixfaktorisierung mit logistischer Verlustfunktion
Betrachten Sie das Problem der kollaborativen Filterung. Wir haben Matrix der Größe #users * #items. wenn Benutzer i Element j mag, wenn Benutzer i Element j nicht mag, undwenn es keine Daten über (i, j) Paar gibt. Wir wollen für zukünftige Benutzer-Artikel-Paare vorhersagen .MMMMi,j=1Mi,j=1M_{i,j} = 1Mi,j=0Mi,j=0M_{i,j} = 0Mi,j=?Mi,j=?M_{i,j}=?Mi,jMi,jM_{i,j} Der Standardansatz …

1
Diskrete Daten und Alternativen zu PCA
Ich habe einen Datensatz mit diskreten (ordinalen, meristischen und nominalen) Variablen, die morphologische Flügelcharakteristika für mehrere eng verwandte Insektenarten beschreiben. Ich möchte eine Art Analyse durchführen, die mir eine visuelle Darstellung der Ähnlichkeit der verschiedenen Arten anhand der morphologischen Eigenschaften gibt. Das erste, was mir in den Sinn kam, war …


2
Aus relationalen Daten lernen
Einstellungen Viele Algorithmen arbeiten mit einer einzelnen Beziehung oder Tabelle, während viele reale Datenbanken Informationen in mehreren Tabellen speichern (Domingos, 2003). Frage Welche Arten von Algorithmen lernen gut aus mehreren (relationalen) Tabellen. Insbesondere interessieren mich die Algorithmen, die für die Regressions- und Klassifizierungsaufgaben anwendbar sind (nicht die netzwerkanalyseorientierten, z. B. …

3
Vorzeichenwechsel beim Hinzufügen einer weiteren Variablen in der Regression und mit viel größerer Größe
Grundeinstellung: Regressionsmodell: wobei C der Vektor der Kontrollvariablen ist.y=constant+β1x1+β2x2+β3x3+β4x4+αC+ϵy=constant+β1x1+β2x2+β3x3+β4x4+αC+ϵy = \text{constant} +\beta_1x_1+\beta_2x_2+\beta_3x_3+\beta_4x_4+\alpha C+\epsilon Ich interessiere mich für und erwarte, dass und negativ sind. Es gibt jedoch ein Multikollinearitätsproblem im Modell. Der Korrelationskoeffizient ist gegeben durch corr ( , 0,9345, corr ( , x_3) = 0,1765, corr ( x_2 , x_3) …

1
Interpretationskoeffizienten einer Interaktion zwischen kategorialer und kontinuierlicher Variable
Ich habe eine Frage zur Interpretation der Koeffizienten einer Wechselwirkung zwischen kontinuierlicher und kategorialer Variable. Hier ist mein Modell: model_glm3=glm(cog~lg_hag+race+pdg+sex+as.factor(educa)+(lg_hag:as.factor(educa)), data=base_708) Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) 21.4836 2.0698 10.380 < 2e-16 *** lg_hag 8.5691 3.7688 2.274 0.02334 * raceblack -8.4715 1.7482 -4.846 1.61e-06 *** racemexican -3.0483 1.7073 …

4
Box Cox Transformationen zur Regression
Ich versuche, ein lineares Modell mit nur einem Prädiktor (z. B. (x, y)) an einige Daten anzupassen. Die Daten sind so, dass für kleine Werte von x die y-Werte eine enge Anpassung an eine gerade Linie ergeben. Wenn jedoch die x-Werte zunehmen, werden die y-Werte flüchtiger. Hier ist ein Beispiel …

1
Eine Parallele zwischen LSA und pLSA
In der Originalarbeit von pLSA zeichnet der Autor Thomas Hoffman eine Parallele zwischen pLSA- und LSA-Datenstrukturen, die ich mit Ihnen diskutieren möchte. Hintergrund: Nehmen wir an, wir haben eine Sammlung von Dokumenten und ein Vokabular von BegriffenNNND={d1,d2,....,dN}D={d1,d2,....,dN}D = \lbrace d_1, d_2, ...., d_N \rbraceMMMΩ={ω1,ω2,...,ωM}Ω={ω1,ω2,...,ωM}\Omega = \lbrace \omega_1, \omega_2, ..., \omega_M …


2
Benjamini-Hochberg-Abhängigkeitsannahmen gerechtfertigt?
Ich habe einen Datensatz, in dem ich auf signifikante Unterschiede zwischen drei Populationen in Bezug auf etwa 50 verschiedene Variablen teste. Ich mache dies einerseits mit Kruskal-Wallis-Tests und andererseits mit Likelihood-Ratio-Tests für verschachtelte GLM-Modellanpassungen (mit und ohne Population als unabhängige Variable). Als Ergebnis habe ich einerseits eine Liste von Kruskal-Wallis- …



2
Verteilungen auf Teilmengen von ?
Ich frage mich, ob es Standardverteilungen für Teilmengen von Ganzzahlen . Entsprechend könnten wir dies als Verteilung auf einen Längenvektor von binären Ergebnissen ausdrücken , z. B. wenn dann entspricht dem Vektor .{1,2,...,J}{1,2,...,J}\{1, 2, ..., J\}JJJJ=5J=5J = 5{1,3,5}{1,3,5}\{1, 3, 5\}(1,0,1,0,1)(1,0,1,0,1)(1, 0, 1, 0, 1) Im Idealfall suche ich eine Verteilung …

3
PCA-, ICA- und Laplace-Eigenkarten
Ich interessiere mich sehr für die Laplace-Eigenkartenmethode. Derzeit verwende ich es zur Dimensionsreduzierung für meine medizinischen Datensätze. Bei der Verwendung der Methode bin ich jedoch auf ein Problem gestoßen. Zum Beispiel habe ich einige Daten (Spektren-Signale), ich kann PCA (oder ICA) verwenden, um einige PCs und ICs zu erhalten. Das …
9 pca  ica 

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.