Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Interpretation der ordinalen logistischen Regression
Ich habe diese ordinale logistische Regression in R ausgeführt: mtcars_ordinal <- polr(as.factor(carb) ~ mpg, mtcars) Ich habe diese Zusammenfassung des Modells erhalten: summary(mtcars_ordinal) Re-fitting to get Hessian Call: polr(formula = as.factor(carb) ~ mpg, data = mtcars) Coefficients: Value Std. Error t value mpg -0.2335 0.06855 -3.406 Intercepts: Value Std. Error …

1
Ist der R-Quadrat-Wert zum Vergleichen von Modellen geeignet?
Ich versuche, das beste Modell zu finden, um die Preise für Automobile vorherzusagen. Dabei verwende ich die Preise und Funktionen, die auf Websites für Kleinanzeigen für Automobile verfügbar sind. Dazu verwendete ich einige Modelle aus der Scikit-Learn-Bibliothek und neuronale Netzwerkmodelle aus Pybrain und Neurolab. Der Ansatz, den ich bisher verwendet …


1
Was bewirkt die Funktion „Effekte“ in R?
Ich verstehe die Erklärung in Rder Hilfedatei für effects () nicht : Für ein lineares Modell, das mit lmoder angepasst wurde aov, sind die Effekte die nicht korrelierten Einzelfreiheitsgradwerte, die durch Projektion der Daten auf die aufeinanderfolgenden orthogonalen Teilräume erhalten wurden, die durch die QR-Zerlegung während des Anpassungsprozesses generiert wurden. …
17 r  regression 


1
Bleiben autokorrelierte Residuenmuster auch in Modellen mit geeigneten Korrelationsstrukturen erhalten und wie werden die besten Modelle ausgewählt?
Kontext Diese Frage verwendet R, bezieht sich jedoch auf allgemeine statistische Fragen. Ich analysiere die Auswirkungen von Mortalitätsfaktoren (% Mortalität aufgrund von Krankheit und Parasitismus) auf die Wachstumsrate der Mottenpopulation im Laufe der Zeit, wobei Larvenpopulationen 8 Jahre lang einmal pro Jahr an 12 Standorten beprobt wurden. Die Daten zur …

9
Randindexberechnung
Ich versuche herauszufinden, wie der Rand-Index eines Cluster-Algorithmus berechnet wird, aber ich bin nicht sicher, wie die wahren und falschen Negative berechnet werden. Im Moment verwende ich das Beispiel aus dem Buch Eine Einführung in die Informationsbeschaffung (Manning, Raghavan & Schütze, 2009). Auf Seite 359 wird erläutert, wie der Rand-Index …
17 clustering 

2
Qualitative Variablencodierung in der Regression führt zu „Singularitäten“
Ich habe eine unabhängige Variable namens "Qualität"; Diese Variable hat 3 Antwortmodalitäten (schlechte Qualität; mittlere Qualität; hohe Qualität). Ich möchte diese unabhängige Variable in meine multiple lineare Regression einführen. Wenn ich eine binäre unabhängige Variable habe (Dummy-Variable, ich kann 0/ codieren 1), ist es einfach, sie in ein Modell mit …

3
Statistischer Test für zwei Verteilungen, bei denen nur eine Zusammenfassung mit fünf Zahlen bekannt ist
Ich habe zwei Verteilungen, bei denen nur die Zusammenfassung mit fünf Zahlen (Minimum, 1. Quartil, Median, 3. Quartil, Maximum) und die Stichprobengröße bekannt sind. Anders als hier stehen nicht alle Datenpunkte zur Verfügung. Gibt es einen nicht-parametrischen statistischen Test, mit dem ich überprüfen kann, ob die zugrunde liegenden Verteilungen der …

1
Fragen zum Wahrscheinlichkeitsprinzip
Ich versuche derzeit, das Likelihood-Prinzip zu verstehen und verstehe es ehrlich gesagt überhaupt nicht. Also werde ich alle meine Fragen als Liste schreiben, auch wenn dies ziemlich grundlegende Fragen sein mögen. Was genau bedeutet "alle Informationen" im Kontext dieses Prinzips? (Wie bei allen Informationen in einer Stichprobe ist die Wahrscheinlichkeitsfunktion …

1
Was sind effiziente Algorithmen zur Berechnung der Singularwertzerlegung (SVD)?
Der Wikipedia-Artikel zur Hauptkomponentenanalyse besagt dies Es gibt effiziente Algorithmen zur Berechnung der SVD von ohne dass die Matrix muss. Daher ist die Berechnung der SVD heute die Standardmethode zur Berechnung einer Hauptkomponentenanalyse aus einer Datenmatrix, sofern nicht nur eine Handvoll Komponenten erforderlich sind.XXXXTXXTXX^TX Könnte mir jemand sagen, um welche …
17 pca  algorithms  svd  numerics 

3
Analogie der Pearson-Korrelation für 3 Variablen
Ich interessiere mich dafür, ob eine "Korrelation" von drei Variablen etwas ist oder nicht, und wenn ja, was wäre das? Pearson-Produktmoment-Korrelationskoeffizient E{(X−μX)(Y−μY)}Var(X)Var(Y)−−−−−−−−−−−−√E{(X−μX)(Y−μY)}Var(X)Var(Y)\frac{\mathrm{E}\{(X-\mu_X)(Y-\mu_Y)\}}{\sqrt{\mathrm{Var}(X)\mathrm{Var}(Y)}} Nun die Frage für 3 Variablen: Ist E{(X−μX)(Y−μY)(Z−μZ)}Var(X)Var(Y)Var(Z)−−−−−−−−−−−−−−−−−−√E{(X−μX)(Y−μY)(Z−μZ)}Var(X)Var(Y)Var(Z)\frac{\mathrm{E}\{(X-\mu_X)(Y-\mu_Y)(Z-\mu_Z)\}} {\sqrt{\mathrm{Var}(X)\mathrm{Var}(Y)\mathrm{Var}(Z)}} etwas? In R scheint es etwas Interpretierbares zu sein: > a <- rnorm(100); b <- rnorm(100); c <- rnorm(100) …

1
Wann schneidet Naive Bayes besser ab als SVM?
In einem kleinen Textklassifizierungsproblem, das ich mir angesehen habe, hat Naive Bayes eine Leistung gezeigt, die einer SVM ähnelt oder größer ist, und ich war sehr verwirrt. Ich habe mich gefragt, welche Faktoren den Triumph eines Algorithmus über den anderen entscheiden. Gibt es Situationen, in denen es keinen Sinn macht, …

2
Wie passt man eine diskrete Verteilung an, um Daten zu zählen?
Ich habe das folgende Histogramm der Zähldaten. Und ich würde gerne eine diskrete Verteilung hinzufügen. Ich bin mir nicht sicher, wie ich das anstellen soll. Soll ich dem Histogramm zuerst eine diskrete Verteilung überlagern, z. B. eine negative Binomialverteilung, damit ich die Parameter der diskreten Verteilung erhalte, und dann einen …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.