Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


4
Wie verdaue ich den statistischen Kontext?
Erstens nehme ich an, dass nicht alle aktiven Mitglieder dieser interessanten Site Statistiker sind. Andernfalls ergibt die folgende Frage keinen Sinn! Ich respektiere sie natürlich, aber ich brauche eine Erklärung, die eher praktischer als konzeptioneller Natur ist. Ich beginne mit einem Beispiel aus Wikipedia , um Folgendes zu definieren point …

3
Wie Levene Testfunktion in R verwenden?
Ich bin ein Neuling in Statistik und R und habe Probleme mit der Verwendung der Levene-Funktion (ich möchte die Varianzgleichheit von zwei Stichproben prüfen). In der Dokumentation steht, dass ich Folgendes ausführen soll: levene.test (y, Gruppe) Aber ich habe keine Ahnung, was ich als y und Gruppe setzen soll? Ich …

2
Gibt es Unterschiede in der bayesianischen und der frequentistischen Herangehensweise an EDA?
Ganz einfach gesagt: Gibt es Unterschiede in den Bayesianischen und Frequentistischen Ansätzen zur exploratorischen Datenanalyse? Ich kenne keine inhärenten Verzerrungen in EDA-Methoden, da ein Histogramm ein Histogramm ist, ein Streudiagramm ein Streudiagramm ist usw., und ich habe auch keine Beispiele für Unterschiede in der Darstellung oder Vermittlung von EDA gefunden …

1
Interpretation der Entfernung von der Hyperebene in SVM
Ich habe einige Zweifel daran, SVMs intuitiv zu verstehen. Angenommen, wir haben ein SVM-Modell für die Klassifizierung mit einem Standardwerkzeug wie SVMLight oder LibSVM trainiert. Wenn wir dieses Modell zur Vorhersage von Testdaten verwenden, generiert das Modell eine Datei mit "Alpha" -Werten für jeden Testpunkt. Wenn der Alpha-Wert positiv ist, …


2
Auswahl der Box-Jenkins-Modelle
Das Box-Jenkins-Modellauswahlverfahren in der Zeitreihenanalyse beginnt mit der Betrachtung der Autokorrelations- und der partiellen Autokorrelationsfunktion der Reihe. Diese Diagramme können das geeignete und in einem ARMA -Modell vorschlagen . Das Verfahren wird fortgesetzt, indem der Benutzer aufgefordert wird, die AIC / BIC-Kriterien anzuwenden, um das sparsamste Modell unter denjenigen auszuwählen, …

1
Generieren von Werten aus einer multivariaten Gaußschen Verteilung
Ich versuche gerade, Werte einer dimensionalen Zufallsvariablen zu simulieren , die eine multivariate Normalverteilung mit dem mittleren Vektor und der Kovarianzmatrix .NNNXXXμ=(μ1,...,μN)Tμ=(μ1,...,μN)T\mu = (\mu_1,...,\mu_N)^TSSS Ich hoffe, eine Prozedur zu verwenden, die der inversen CDF-Methode ähnelt, was bedeutet, dass ich zuerst eine dimensionale einheitliche Zufallsvariable generieren und diese dann in die …


3
Gleichmäßig verteilte Gewichte generieren, die die Summe aus Einheit ergeben?
Es ist üblich, Gewichte in Anwendungen wie der Gemischmodellierung zu verwenden und Basisfunktionen linear zu kombinieren. Gewichte wiwiw_i muss oft gehorchen wi≥wi≥w_i ≥ 0 und ∑iwi=1∑iwi=1\sum_{i} w_i=1 . Aus einer gleichmäßigen Verteilung solcher Vektoren möchte ich zufällig einen Gewichtsvektor auswählen w=(w1,w2,…)w=(w1,w2,…)\mathbf{w} = (w_1, w_2, …). Es kann verlockend sein, wi=ωi∑jωjwi=ωi∑jωjw_i …


2
Beispiele für Text Mining mit R (TM-Paket)
Ich verbrachte drei Tage damit, mich mit tmeinem Entwurf eines Freundes zu beschäftigen, in dem er mit UCINET einen Textkorpus erkundete, der Textwolken, Zwei-Modus-Netzwerkgraphen und Einzelwertzerlegung (mit Grafiken, unter Verwendung von Stata) zeigte. Ich habe viele Probleme: Unter Mac OS X gibt es Probleme mit Java hinter Bibliotheken wie Snowball …
14 r  text-mining 

1
So stimmen Sie die Glättung im mgcv GAM-Modell
Ich versuche herauszufinden, wie die Glättungsparameter in einem mgcv: gam-Modell gesteuert werden. Ich habe eine Binomialvariable, die ich hauptsächlich als Funktion der x- und y-Koordinaten auf einem festen Gitter modellieren möchte, sowie einige andere Variablen mit geringfügigeren Einflüssen. In der Vergangenheit habe ich ein einigermaßen gutes lokales Regressionsmodell unter Verwendung …
14 r  smoothing  mgcv 

3
oderMetriken für Clustering?
Verwendet jemand die Metriken L1L1L_1 oder L.5L.5L_.5 für das Clustering und nicht L2L2L_2 ? Über das überraschende Verhalten von Distanzmetriken im hochdimensionalen Raum gaben Aggarwal et al. (2001) an, dass L1L1L_1 istfür hochdimensionale Data-Mining-Anwendungendurchweg vorzuziehen als die euklidische Distanzmetrik L2L2L_2 und behauptete, dass oder noch besser kann.L.5L.5L_.5L.1L.1L_.1 Gründe für die …

5
Software (oder Webapps) zum Unterrichten von Kinder-Statistiken oder Wahrscheinlichkeit?
Ich möchte (in ferner Zukunft) Kindern Statistik beibringen. Für diese Angelegenheit würde ich mich über Software (offensichtlich tendiere ich zu FOSS) oder Webapps freuen, die hilfreich sind, um Kindern (oder Erwachsenen für diese Angelegenheit) statistische / probabilistische Ideen zu erklären. Dies kann entweder vom Lehrer, den Kindern oder beiden verwendet …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.