Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


3
T-Test auf stark verzerrten Daten
Ich habe einen Datensatz mit zehntausenden Beobachtungen von medizinischen Kostendaten. Diese Daten sind stark nach rechts verschoben und enthalten viele Nullen. Es sieht für zwei Personengruppen so aus (in diesem Fall zwei Altersgruppen mit jeweils> 3000 Beobachtungen): Min. 1st Qu. Median Mean 3rd Qu. Max. 0.0 0.0 0.0 4536.0 302.6 …


1
Umgang mit einer SVM mit kategorialen Attributen
Ich habe einen Raum von 35 Dimensionen (Attribute). Mein analytisches Problem ist eine einfache Klassifizierung. Von 35 Dimensionen sind mehr als 25 kategorial und jedes Attribut akzeptiert mehr als 50 Werttypen. In diesem Szenario funktioniert die Einführung einer Dummy-Variablen auch für mich nicht. Wie kann ich eine SVM auf einem …

4
Wie kann man in einer Potenzanalyse mit zwei unabhängigen Anteilen eine Stoppregel entwickeln?
Ich bin ein Softwareentwickler, der an A / B-Testsystemen arbeitet. Ich habe keinen soliden Hintergrund für Statistiken, habe aber in den letzten Monaten Wissen gesammelt. In einem typischen Testszenario werden zwei URLs auf einer Website verglichen. Ein Besucher besucht LANDING_URLund wird dann nach dem Zufallsprinzip an URL_CONTROLoder weitergeleitet URL_EXPERIMENTAL. Ein …

2
Einfluss datenbasierter Bin-Grenzen auf einen Chi-Quadrat-Anpassungstest?
Abgesehen von dem offensichtlichen Problem der geringen Leistung des Chi-Quadrats unter diesen Umständen, stellen Sie sich vor, Sie führen einen Chi-Quadrat-Test für eine bestimmte Dichte mit nicht festgelegten Parametern durch, indem Sie die Daten bündeln. Nehmen wir der Vollständigkeit halber eine Exponentialverteilung mit unbekanntem Mittelwert und einer Stichprobengröße von beispielsweise …

2
Warum ist die Fisher Information Matrix positiv semidefinit?
Lassen Sie . Die Fisher Information Matrix ist definiert als:θ ∈ Rnθ∈Rn\theta \in R^{n} ich( θ )ich , j= - E[ ∂2Log( f( X| θ))∂θich∂θj∣∣∣θ ]ich(θ)ich,j=-E[∂2Log⁡(f(X|θ))∂θich∂θj|θ]I(\theta)_{i,j} = -E\left[\frac{\partial^{2} \log(f(X|\theta))}{\partial \theta_{i} \partial \theta_{j}}\bigg|\theta\right] Wie kann ich nachweisen, dass die Fisher Information Matrix positiv semidefinit ist?

1
Zentraler Grenzwertsatz und das Gesetz der großen Zahlen
Ich habe eine Anfängerfrage zum Central Limit Theorem (CLT): Mir ist bekannt, dass die CLT angibt, dass ein Mittelwert von iid Zufallsvariablen ungefähr normalverteilt ist (für , wobei der Index der Summanden ist), oder dass die standardisierte Zufallsvariable eine Standardnormalverteilung aufweisen würde.nn → ∞n→∞n \to \inftynnn Das Gesetz der großen …

2
Große Uneinigkeit in der Steigungsschätzung, wenn Gruppen in einem gemischten Modell als zufällig oder fest behandelt werden
Ich verstehe, dass wir Modelle mit zufälligen Effekten (oder gemischten Effekten) verwenden, wenn wir glauben, dass einige Modellparameter über einen Gruppierungsfaktor zufällig variieren. Ich möchte ein Modell xanpassen, bei dem die Reaktion über einen Gruppierungsfaktor normalisiert und zentriert (nicht perfekt, aber ziemlich nahe beieinander) ist, aber eine unabhängige Variable in …

3
Varianz-Kovarianz-Matrix in lmer
Ich weiß, dass einer der Vorteile gemischter Modelle darin besteht, dass sie die Angabe einer Varianz-Kovarianz-Matrix für die Daten ermöglichen (zusammengesetzte Symmetrie, autoregressiv, unstrukturiert usw.). Die lmerFunktion in R ermöglicht jedoch keine einfache Angabe dieser Matrix. Weiß jemand, welche Struktur lmerstandardmäßig verwendet wird und warum es keine Möglichkeit gibt, diese …

3
Welche Beziehung besteht zwischen der Profilwahrscheinlichkeit und den Konfidenzintervallen?
Um dieses Diagramm zu erstellen, habe ich Zufallsstichproben unterschiedlicher Größe aus einer Normalverteilung mit Mittelwert = 0 und sd = 1 generiert. Die Konfidenzintervalle wurden dann unter Verwendung von Alpha-Grenzwerten zwischen 0,001 und 0,999 (rote Linie) mit der Funktion t.test () berechnet. Die Profilwahrscheinlichkeit wurde unter Verwendung des Codes berechnet, …

5
Gehen Statistiker davon aus, dass man eine Pflanze nicht übergießen kann, oder verwende ich nur die falschen Suchbegriffe für die krummlinige Regression?
Fast alles, was ich über lineare Regression und GLM lese , läuft darauf hinaus: y=f(x,β)y=f(x,β)y = f(x,\beta) wobei f(x,β)f(x,β)f(x,\beta) eine nicht zunehmende oder nicht abnehmende Funktion von xxx und ββ\beta der Parameter ist, den Sie schätzen und testen Hypothesen über. Es gibt Dutzende von Verknüpfungsfunktionen und Transformationen von yyy und …

1
Inwiefern unterscheidet sich ein extrem zufälliger Wald von einem zufälligen Wald?
Ist die Umsetzung von ER effizienter (ähnlich Extreme Gradient Boostingwie die Steigerung des Gradienten) - ist der Unterschied aus praktischer Sicht wichtig? Es gibt ein R-Paket, das sie implementiert. Ist es ein neuer Algorithmus, der die "generische" Implementierung (RandomForest-Paket von R) nicht nur hinsichtlich der Effizienz oder auch in einigen …

9
Paarweise Mahalanobis-Entfernungen
Ich muss den Mahalanobis-Abstand in R zwischen jedem Beobachtungspaar in einer n×pn×pn \times p Matrix von Kovariaten berechnen. Ich benötige eine effiziente Lösung, dh es werden nur Abstände berechnet und vorzugsweise in C / RCpp / Fortran usw. implementiert. Ich gehe davon aus, dass , die Populationskovarianzmatrix, unbekannt ist, und …
18 r  algorithms  distance 


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.