Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Was ist der Unterschied zwischen Regressionskoeffizienten und partiellen Regressionskoeffizienten?
Ich habe gelesen , in Abdi (2003) , dass Wenn die unabhängigen Variablen paarweise orthogonal sind, wird der Effekt jeder von ihnen in der Regression bewertet, indem die Steigung der Regression zwischen dieser unabhängigen Variablen und der abhängigen Variablen berechnet wird. In diesem Fall (dh Orthogonalität der IVs) sind die …

3
Training, Testen, Validieren in einem Überlebensanalyseproblem
Ich habe hier verschiedene Themen durchgesehen, aber ich glaube nicht, dass meine genaue Frage beantwortet ist. Ich habe einen Datensatz von ~ 50.000 Studenten und deren Zeit bis zum Abbruch. Ich werde eine proportionale Hazard-Regression mit einer großen Anzahl potenzieller Kovariaten durchführen. Ich werde auch eine logistische Regression bei Studienabbrechern …


2
Verteilung der Faltung von quadrierten Normal- und Chi-Quadrat-Variablen?
Das folgende Problem ist kürzlich bei der Datenanalyse aufgetreten. Wenn die Zufallsvariable X einer Normalverteilung folgt und Y einer χ2nχn2\chi^2_n Verteilung folgt (mit n dof), wie ist verteilt? Bisher habe ich mir das PDF von : Y 2 ≤ 2 n ( x )Z=X2+Y2Z=X2+Y2Z = X^2 + Y^2Y2Y2Y^2ψ2n(x)====∂F(x−−√)∂x(∫x√0tn/2−1⋅e−t/22n/2Γ(n/2)dt)′x12n/2Γ(n/2)⋅(x−−√)n/2−1⋅e−x√/2⋅(x−−√)′x12n/2−1Γ(n/2)⋅xn/4−1⋅e−x√/2ψn2(x)=∂F(x)∂x=(∫0xtn/2−1⋅e−t/22n/2Γ(n/2)dt)x′=12n/2Γ(n/2)⋅(x)n/2−1⋅e−x/2⋅(x)x′=12n/2−1Γ(n/2)⋅xn/4−1⋅e−x/2\begin{eqnarray} \psi^2_n(x) &=& …

3
Beste Open-Source-Datenvisualisierungssoftware zur Verwendung mit PowerPoint
Was ist die beste Open-Source-Datenvisualisierungssoftware? Ich benötige folgendes: Kann Daten aus Microsoft Excel importieren (das Importieren von Daten aus Oracle-Datenbanken wäre auch gut, aber dies ist nicht obligatorisch). Von der Software erstellte Diagramme können nach Microsoft PowerPoint exportiert werden (Kopieren und Einfügen ist für mich in Ordnung). Open Source & …

1
Test auf Differenz zwischen 2 empirischen diskreten Verteilungen
Ich habe Testdaten, bei denen ich mehrere große Stichproben aus diskreten Verteilungen habe, die ich als empirische Verteilungen verwende. Ich möchte testen, ob die Verteilungen tatsächlich unterschiedlich sind und was der Unterschied in den Mitteln für diejenigen Verteilungen ist, die tatsächlich unterschiedlich sind. Da es sich um diskrete Verteilungen handelt, …


3
Schätzung von n im Problem des Kuponsammlers
In einer Variation des Problems des Gutscheinsammlers kennen Sie die Anzahl der Gutscheine nicht und müssen diese anhand von Daten ermitteln. Ich werde dies als das Fortune-Cookie-Problem bezeichnen: Bei einer unbekannten Anzahl unterschiedlicher Glückskeksnachrichten nnn schätzen Sie nnn indem Sie die Cookies einzeln abtasten und zählen, wie oft jedes Glück …


4
Warum enthält ein 95% -Konfidenzintervall aus der Perspektive der Bayes'schen Wahrscheinlichkeit nicht den wahren Parameter mit einer Wahrscheinlichkeit von 95%?
Auf der Wikipedia-Seite zu Konfidenzintervallen : ... Wenn Konfidenzintervalle aus mehreren separaten Datenanalysen von wiederholten (und möglicherweise unterschiedlichen) Experimenten erstellt werden, entspricht der Anteil solcher Intervalle, die den wahren Wert des Parameters enthalten, dem Konfidenzniveau ... Und von derselben Seite: Ein Konfidenzintervall sagt nicht voraus, dass der wahre Wert des …


3
Kann ich eine Normalverteilung aus dem Stichprobenumfang und den Min- und Max-Werten rekonstruieren? Ich kann den Mittelpunkt verwenden, um den Mittelwert darzustellen
Ich weiß, dass dies statistisch gesehen vielleicht ein bisschen blöd ist, aber das ist mein Problem. Ich habe viele Bereichsdaten, das heißt das Minimum, das Maximum und die Stichprobengröße einer Variablen. Für einige dieser Daten habe ich auch einen Mittelwert, aber nicht viele. Ich möchte diese Bereiche miteinander vergleichen, um …

3
Gewichtung neuerer Daten im Random Forest-Modell
Ich trainiere ein Klassifizierungsmodell mit Random Forest, um zwischen 6 Kategorien zu unterscheiden. Meine Transaktionsdaten umfassen ungefähr 60.000 Beobachtungen und 35 Variablen. Hier ist ein Beispiel, wie es ungefähr aussieht. _________________________________________________ |user_id|acquisition_date|x_var_1|x_var_2| y_vay | |-------|----------------|-------|-------|--------| |111 | 2013-04-01 | 12 | US | group1 | |222 | 2013-04-12 | 6 …



Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.