Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Können die Skalierungswerte in einer linearen Diskriminanzanalyse (LDA) verwendet werden, um erklärende Variablen auf den linearen Diskriminanten darzustellen?
Unter Verwendung eines Biplots von Werten, die durch Hauptkomponentenanalyse erhalten wurden, ist es möglich, die erklärenden Variablen zu untersuchen, aus denen jede Hauptkomponente besteht. Ist dies auch mit der linearen Diskriminanzanalyse möglich? Beispiele hierfür sind: Die Daten sind "Edgar Andersons Irisdaten" ( http://en.wikipedia.org/wiki/Iris_flower_data_set ). Hier sind die Irisdaten : id …

2
Korrelation zwischen zwei Kartenspielen?
Ich habe ein Programm geschrieben, um ein Überhandkarten -Shuffle zu simulieren . Jede Karte ist nummeriert, mit einer Farbe von CLUBS, DIAMONDS, HEARTS, SPADESund einem Rang von zwei bis zehn, dann Jack, Queen, King und Ace. Somit hat die Zwei der Vereine eine Nummer von 1, die Drei der Vereine …

3
Wie man den Nemenyi-Post-Hoc-Test nach dem Friedman-Test richtig anwendet
Ich vergleiche die Leistung mehrerer Algorithmen für mehrere Datensätze. Da nicht garantiert wird, dass diese Leistungsmessungen normal verteilt sind, habe ich den Friedman-Test mit dem Nemenyi-Post-Hoc-Test basierend auf Demšar (2006) gewählt . Ich fand dann ein anderes Papier, das nicht nur andere Methoden wie den Quade-Test mit anschließendem Shaffer-Post-hoc-Test vorschlägt, …

4
Online-Ressourcen für die Philosophie der Kausalität für kausale Folgerungen
Können Sie Bücher, Artikel, Aufsätze, Online-Tutorials / Kurse usw. empfehlen, die für einen Epidemiologen / Biostatistiker interessant und nützlich wären, um etwas über die Philosophie der Kausalität / kausalen Folgerung zu lernen? Ich weiß ziemlich viel darüber, wie man tatsächlich kausale Schlussfolgerungen aus einem Epi- und Biostat-Framework zieht, aber ich …

2
Wie modelliere ich monatliche Effekte in täglichen Zeitreihendaten?
Ich habe zwei Zeitreihen von täglichen Daten. Eines ist sign-upsund das andere terminationsvon Abonnements. Letzteres möchte ich anhand der in beiden Variablen enthaltenen Informationen vorhersagen. Wenn man sich die Grafik dieser Serien ansieht, ist es offensichtlich, dass die Kündigungen mit einem Vielfachen der Anmeldungen in den Monaten zuvor korrelieren. Das …

3
Nachweis der Beziehung zwischen Gefährdungsrate, Wahrscheinlichkeitsdichte, Überlebensfunktion
Ich lese ein bisschen über Überlebensanalysen und die meisten Lehrbücher geben das an h(t)=limΔt→0P(t&lt;T≤t+Δt|T≥t)Δt=f(t)1−F(t)(1)h(t)=limΔt→0P(t&lt;T≤t+Δt|T≥t)Δt=f(t)1−F(t)(1)h(t)= \lim_{ \Delta t \rightarrow 0} \frac{P(t < T \leq t+\Delta t |T \geq t )}{ \Delta t} =\frac{f(t)}{1-F(t)} (1) wobei h(t)h(t)h(t) die Gefährdungsrate ist, f(t)=limΔt→0P(t&lt;T≤t+Δt)Δt(2)f(t)=limΔt→0P(t&lt;T≤t+Δt)Δt(2)f(t)=\lim_{\Delta t \rightarrow 0} \frac{P(t < T \leq t+\Delta t)}{ \Delta t}(2) …
11 survival 

4
Wie finden Sie kausale Zusammenhänge in Daten?
Nehmen wir an, ich habe eine Tabelle mit den Spalten "A", "B". Gibt es eine statistische Methode, um festzustellen, ob "A" "B" verursacht? Man kann Pearson's r nicht wirklich benutzen, weil: Es wird nur die Korrelation zwischen Werten getestet Korrelation ist keine Kausalität Pearsons r kann nur lineare Beziehungen korrelieren …


3
Erstellen automatisch korrelierter Zufallswerte in R.
Wir versuchen, automatisch korrelierte Zufallswerte zu erstellen, die als Zeitreihen verwendet werden. Wir haben keine vorhandenen Daten, auf die wir verweisen, und möchten den Vektor nur von Grund auf neu erstellen. Einerseits brauchen wir natürlich einen zufälligen Prozess mit Distribution und deren SD. Andererseits muss die den Zufallsprozess beeinflussende Autokorrelation …

3
Wie berechnet man die Differenz zweier Steigungen?
Gibt es eine Methode, um zu verstehen, ob zwei Linien (mehr oder weniger) parallel sind? Ich habe zwei Linien, die aus linearen Regressionen erzeugt wurden, und ich würde gerne verstehen, ob sie parallel sind. Mit anderen Worten, ich möchte die unterschiedlichen Steigungen dieser beiden Linien ermitteln. Gibt es eine R-Funktion, …


1
Testen simultaner und verzögerter Effekte in longitudinalen gemischten Modellen mit zeitlich variierenden Kovariaten
Kürzlich wurde mir gesagt, dass es nicht möglich ist, zeitvariable Kovariaten in longitudinale gemischte Modelle einzubeziehen, ohne eine Zeitverzögerung für diese Kovariaten einzuführen. Können Sie dies bestätigen / ablehnen? Haben Sie Hinweise zu dieser Situation? Ich schlage eine einfache Situation zur Klärung vor. Angenommen, ich habe quantitative Messungen (etwa 30 …

4
Was ist mit Erklärungen in Zeitreihen zu tun?
Nachdem ich bisher hauptsächlich mit Querschnittsdaten gearbeitet habe und erst kürzlich beim Durchsuchen gestolpert bin und durch eine Reihe einführender Zeitreihenliteratur gestolpert bin, frage ich mich, welche Rolle erklärende Variablen bei der Zeitreihenanalyse spielen. Ich möchte einen Trend erklären, anstatt den Trend zu verringern. Das meiste, was ich als Einführung …

6
Wie reduziere ich die Anzahl der Datenpunkte in einer Reihe?
Ich habe seit über 10 Jahren keine Statistik mehr studiert (und dann nur noch einen Grundkurs), daher ist meine Frage vielleicht etwas schwer zu verstehen. Auf jeden Fall möchte ich die Anzahl der Datenpunkte in einer Reihe reduzieren. Die x-Achse ist die Anzahl der Millisekunden seit Beginn der Messung und …

1
Wie gehen Sie mit „verschachtelten“ Variablen in einem Regressionsmodell um?
Stellen Sie sich ein statistisches Problem vor, bei dem Sie eine responseVariable haben, die Sie abhängig von einer explanatoryVariablen und einer nestedVariablen beschreiben möchten , wobei die verschachtelte Variable nur als sinnvolle Variable für bestimmte Werte der erklärenden Variablen auftritt . In Fällen, in denen die erklärende Variable keine aussagekräftige …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.