Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


1
Unterschied zwischen Gewichten und vor in Teil und wie man sie verwendet
Ich habe eine Frage zu den "Gewichten" und "Prior" in Rs rpart-Funktion. Diese Frage wurde hier schon einmal gestellt , aber die Antwort macht keinen Sinn. Derzeit habe ich sehr unausgeglichene Daten, bei denen das Ziel nur 0,0066% des gesamten Datensatzes beträgt, der über 2 Millionen Zeilen enthält. Ich möchte …
8 r  rpart 

1
Lindeberg CLT für exponentielle unabhängige Variablen
Crossposted in math.stackexchange: CLT für unabhängige, aber nicht identisch verteilte Exponentialvariablen Dieses Problem ist das Selbststudium für meine Eignungsprüfung. Problem Annehmen (en)n≥1(en)n≥1(e_n)_{n\ge 1} sind unabhängige exponentiell verteilte Zufallsvariablen mit E(en)=μnE(en)=μnE(e_n)=\mu_n. Wenn maxi≤nμi∑nj=1μj→0maxi≤nμi∑j=1nμj→0 \max_{i\le n}\frac{\mu_i}{\sum^n_{j=1}\mu_j}\to 0 dann ∑i=1n(ei−μi)/∑j=1nμ2j−−−−−⎷⟹N(0,1).∑i=1n(ei−μi)/∑j=1nμj2⟹N(0,1). \sum^n_{i=1}(e_i-\mu_i)/\sqrt{\sum^n_{j=1}\mu_j^2}\implies N(0,1). Ich habe versucht, eine Lösung unter Verwendung der Liapunov-Bedingung zu finden, …


3
Was bedeutet ein p-Wert von genau 1,0000?
Ich habe eine Tabelle mit paarweisen Vergleichen mit gepaarten t-Tests, die ich mit dem folgenden Code in R erstellt habe: with(d_OAI, pairwise.t.test(OAI, Ven,p.adjust.method="bonferroni", paired=T)) Einige der p-Werte sind signifikant (dh weniger als 0,05), andere nicht. Einige der p-Werte sind jedoch gleich 1,00000. Ich nehme an, dies bedeutet, dass die beiden …

1
Datenvisualisierung für fehlende Daten
Ich bin Designer und versuche, einen Datensatz über die Zeit zu zeichnen. Zum Beispiel, Day1 Day2 Day3 Day4 Day5 10 53 21 67 38 Ich verwende ein normales Liniendiagramm, um dies zu zeichnen, aber wenn für ein oder zwei Tage dazwischen keine Daten verfügbar sind (wie zum Beispiel unten), gehen …

2
Standardentwickler "normalisieren"?
Zunächst einmal bin ich keine Statistikperson, aber ich bin auf diese Website gestoßen und habe mir gedacht, ich würde eine möglicherweise dumme Frage stellen: Ich schaue mir einige GuV-Daten an, bei denen es sich bei den Werbebuchungen um Umsatz, direkte Kosten, Werbekosten usw. handelt. Ich habe Daten für 12 Monate …

1
Verwendung empirischer Prioritäten in PyMC
Ich verwende PyMC, um die posteriore Verteilung abzutasten, und bin auf eine Straßensperre gestoßen, bei der Priors aus Samples verwendet werden, keine Modelle. Meine Situation ist wie folgt: Ich habe einige empirische Daten für einen Parameter aus dem ich eine Wahrscheinlichkeitsverteilung p (z) berechne . Es ist kein Modell / …

2
Ist es richtig, die Ausgabe des neuronalen Netzwerks als sein Vertrauen in die Vorhersage der Ausgabe zu betrachten?
Angenommen, ich habe ein einzelnes Ausgangssigmoid (tanh), das einen Ausgangsbereich im Bereich von [-1, +1] erzeugt. Ist es richtig, diese Ausgabe als Vertrauensmaß für die Vorhersage der Ausgabe zu betrachten? Der Ausgabewert würde zwischen -1 und +1 liegen, aber obwohl ich eine hohe Genauigkeit habe, sehe ich, dass die Werte …

3
Welche Ausgleichsmethode kann ich auf einen unausgeglichenen Datensatz anwenden?
Ich versuche, ein Klassifizierungsproblem aus dem UCI-Datenbank-Repository zu lösen . Leider (oder zum Glück) habe ich festgestellt, dass mein Datensatz nicht ausgeglichen ist. Ich habe die Daten in 5 Klassen strukturiert, entsprechend der vom Schüler erreichten Endnote: Wenn der Schüler eine Note von 0 bis 7 erhält => Klasse 1 …


1
Faire Münztests
Dies mag ein sehr bekanntes Problem sein, aber ich bin mir nicht sicher, welche Methoden dafür gut wären. Nehmen wir an, jemand bittet uns, 20 Mal eine Münze zu werfen, um zu prüfen, ob es sich um eine faire Münze handelt. Dies ist eine ziemlich einfache Aufgabe. Wir könnten leicht …

1
Sollten wir kontinuierliche Variablen ablegen?
Ich weiß, dass dies bereits gefragt wurde, und ich habe die Antworten auf die früheren Fragen zum Binning kontinuierlicher Variablen gelesen. Ich verstehe, dass wir generell das Binning vermeiden sollten, da dies möglicherweise dazu führt, dass nützliche Informationen (unter anderem) weggeworfen werden. Ich versuche jedoch, ein logistisches Regressionsmodell zu erstellen, …
8 binning 

2
Auf der Suche nach einem robusten, verteilungsfreien / nichtparametrischen Abstand zwischen multivariaten Stichproben
Es gibt viele Distanzfunktionen für Verteilungen, aber es fällt mir schwer, sie alle zu durchsuchen, um eine zu finden, die ist "verteilungsfrei" oder "nichtparametrisch", womit ich nur meine, dass es nur wenige / schwache Annahmen über die zugrunde liegenden Verteilungen macht (insbesondere keine Normalität annimmt); ist robust gegenüber Ausreißern. (Von …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.