Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren


4
Verbinden der Punkte in einem Diagramm
Mit einem Diagramm, das das Produkt einer Gleichung ist, können wir alle Punkte, die die Gleichung lösen, und folglich auch eine Linie, die durch die Punkte verläuft, sinnvoll berechnen. Die Linie an jedem ihrer Punkte ist die Antwort. Aber was ist mit Maßnahmen wie "Anzahl der Autos pro Stunde / …



1
Warum nicht Beta (1,1) als Grenzvermeidung vor einem transformierten Korrelationsparameter verwenden?
In Bayesian Data Analysis , Kapitel 13, Seite 317, zweiter vollständiger Absatz, in den Modal- und Verteilungsnäherungen, haben Gelman et al. schreiben: Wenn der Plan darin besteht, die Inferenz durch den posterioren Modus von [dem Korrelationsparameter in einer bivariaten Normalverteilung] zusammenzufassen, würden wir die vorherige Verteilung von U (-1,1) durch …

2
Wie gehe ich mit unvollständigen Daten in Kalman Filter um?
Was sind einige typische Ansätze zum Umgang mit unvollständigen Daten im Kalman-Filter? Ich spreche von der Situation, in der einige Elemente des beobachteten Vektors fehlen, im dem Fall, in dem ein ganzer beobachteter Vektor . Eine andere Art, darüber nachzudenken, wäre, dass die Dimension des beobachteten Vektors für jeden Zeitpunkt …


2
Die Bedeutung des bedingten Testfehlers gegenüber dem erwarteten Testfehler bei der Kreuzvalidierung
Mein Lehrbuch zur Kreuzvalidierung ist The Elements of Statistical Learning von Hastie et al. (2. Aufl.). In den Abschnitten 7.10.1 und 7.12, sie über den Unterschied zwischen bedingte Testfehler sprechen E.( X.∗, Y.∗)[ L ( Y., f^( X.) ) | τ]]E.(X.∗,Y.∗)[L.(Y.,f^(X.))|τ]]E_{(X^*,Y^*)}[L(Y, \hat{f}(X))|\tau] und erwarteter Testfehler Hier ist der Trainingsdatensatz, ist …

2
Lineare Regression auf einer Probe, die viele Größenordnungen umfasst
Das Gesetz von Beer aus der Chemie besagt, dass die Absorption einer Flüssigkeit proportional zur Konzentration C ist , also: A = k C Der Standard besteht darin, einen Satz von Lösungen mit bekannten Konzentrationen herzustellen und die Absorption zu messen, um einen Standard zu bilden Kurve '(im Grunde eine …

3
Optimierungsfehler beim Einpassen des Arima-Modells in R.
Ich verwende die Arima-Methode des Statistikpakets von R mit meiner Zeitreihe von 17376 Elementen. Mein Ziel ist es, den Wert des AIC-Kriteriums zu erhalten. Ich habe in meinem ersten Test Folgendes beobachtet: ts <- arima(serie[,1], order = c(2,1,1), seasonal = list(order=c(2,0,1),period = 24), method = "CSS", optim.method = "BFGS",) > …

2
Ist ein großer Unterschied in der Stichprobengröße zusammen mit einem Unterschied in den Varianzen für einen t-Test (oder Permutationstest) von Bedeutung?
Ich habe eine sehr verwirrende Frage. Ich habe Daten und möchte numerische Werte zwischen Männern und Frauen vergleichen. Es gibt einen großen Unterschied zwischen diesen beiden Gruppen: Die Anzahl der Männer beträgt 34, während die Anzahl der Frauen 310 beträgt und die Varianzen nicht gleich sind. Soweit ich weiß, kann …

1
Ignoriert RandomForest die räumliche Unabhängigkeit?
Ich habe 5 Variablen für jedes Land der Welt und ich muss deren Auswirkungen und Wechselwirkungen auf eine unabhängige Variable analysieren. Random Forest wäre für meinen Anwendungsbereich angemessen, da es sich um nichtlineare Beziehungen handelt und die Wichtigkeit von Variablen vorhersagt. Ich frage mich jedoch, ob räumliche Abhängigkeit ein Problem …

1
Kolmogorov-Smirnov-Test?
Ich untersuche Störungen, die durch den Schiffsverkehr zu einem kleinen Seevogel verursacht werden. Ich beobachtete fokale Tiere für eine festgelegte Zeitspanne und zeichnete auf, ob sie während der Beobachtung aus dem Wasser fliegen oder nicht. Dieser bestimmte Vogel fliegt nicht mit hoher Wahrscheinlichkeit, wenn er nicht gestört wird (etwa 10% …



Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.