Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Was sind die vorhergesagten Werte, die von der Funktion dict () in R zurückgegeben werden, wenn Originaldaten als Eingabe verwendet werden?
Nachdem reg <- lm(y ~ x1 + x2, data=example)ich eine Regression des Formulars für ein Dataset ausgeführt habe, kann ich mithilfe von vorhergesagte Werte abrufen predict(reg, example, interval="prediction", level=0.95) Ich frage mich, worauf sich die vorhergesagten Werte tatsächlich beziehen, wenn ich die Regression verwende, um den tatsächlichen Datensatz vorherzusagen. Sollte …
11 r  regression 




1
Konfidenzintervalle für Zeitreihendifferenzen
Ich habe ein stochastisches Modell, das verwendet wird, um Zeitreihen eines Prozesses zu simulieren. Ich interessiere mich für den Effekt der Änderung eines Parameters auf einen bestimmten Wert und möchte den Unterschied zwischen der Zeitreihe (z. B. Modell A und Modell B) und einer Art simulationsbasiertem Konfidenzintervall zeigen. Ich habe …

3
Wie erstelle ich Waffel-Charts in R?
Gesperrt . Diese Frage und ihre Antworten sind gesperrt, da die Frage nicht zum Thema gehört, aber historische Bedeutung hat. Derzeit werden keine neuen Antworten oder Interaktionen akzeptiert. Wie kann ich ein Waffeldiagramm als Alternative zur Verwendung von Kreisdiagrammen in R zeichnen? help.search("waffle") No help files found with alias or …

7
Wenn Korrelation keine Kausalität impliziert, welchen Wert hat es dann, die Korrelation zwischen zwei Variablen zu kennen?
Angenommen, als Geschäftsinhaber (oder Marketingmitarbeiter oder jeder, der ein Streudiagramm versteht) wird ein Streudiagramm mit zwei Variablen angezeigt: Anzahl der Anzeigen im Vergleich zur Anzahl der Produktverkäufe pro Monat in den letzten 5 Jahren (oder eine andere Zeitskala, damit Sie habe mehr Proben. Ich habe mir gerade diese ausgedacht. Jetzt …

2
Richtige Verwendung und Interpretation von Gammamodellen ohne Inflation
Hintergrund: Ich bin ein Biostatistiker, der derzeit mit einem Datensatz zellulärer Expressionsraten ringt. Die Studie setzte eine Vielzahl von Zellen, die in Gruppen von verschiedenen Spendern gesammelt wurden, bestimmten Peptiden aus. Zellen exprimieren entweder bestimmte Biomarker als Reaktion oder sie tun dies nicht. Die Rücklaufquoten werden dann für jede Spendergruppe …

2
Finden Sie die Anzahl der Gaußschen in einer endlichen Mischung mit dem Satz von Wilks?
Angenommen, ich habe eine Reihe unabhängiger, identisch verteilter univariater Beobachtungen und zwei Hypothesen darüber, wie x erzeugt wurde:xxxxxx : x wird aus einer einzelnen Gaußschen Verteilung mit unbekanntem Mittelwert und unbekannter Varianz gezogen.H.0H.0H_0xxx : x wird aus einer Mischung von zwei Gaußschen mit unbekanntem Mittelwert, Varianz und Mischungskoeffizienten gezogen.H.EINH.EINH_Axxx Wenn …

8
Das Gefangenenparadoxon
Ich bekomme eine Übung und kann es nicht ganz herausfinden. Das GefangenenparadoxonDrei Gefangene in Einzelhaft, A, B und C, wurden am selben Tag zum Tode verurteilt. Da es jedoch einen Nationalfeiertag gibt, beschließt der Gouverneur, dass einem eine Begnadigung gewährt wird. Die Gefangenen werden darüber informiert, aber ihnen wird mitgeteilt, …

5
Reduziert die Standardisierung unabhängiger Variablen die Kollinearität?
Ich habe einen sehr guten Text über Bayes / MCMC gefunden. Die IT schlägt vor, dass eine Standardisierung Ihrer unabhängigen Variablen einen MCMC-Algorithmus (Metropolis) effizienter macht, aber auch die (Mehrfach-) Kollinearität verringert. Kann das wahr sein? Ist das etwas, was ich als Standard tun sollte? (Entschuldigung). Kruschke 2011, Bayesianische Datenanalyse. …

2
Sollte ich für jede Community separate Regressionen ausführen oder kann die Community einfach eine Kontrollvariable in einem aggregierten Modell sein?
Ich verwende ein OLS-Modell mit einer kontinuierlichen Asset-Index-Variablen als DV. Meine Daten werden aus drei ähnlichen Communities in enger geografischer Nähe zueinander zusammengefasst. Trotzdem hielt ich es für wichtig, die Community als Kontrollvariable zu verwenden. Wie sich herausstellt, ist die Community bei 1% signifikant (t-Score von -4,52). Community ist eine …

2
Was ist das Bayes'sche Gegenstück zu einem T-Test mit zwei Stichproben und ungleichen Varianzen?
Ich suche das bayesianische Gegenstück zum Zwei-Stichproben-T-Test mit ungleichen Varianzen (Welch-Test). Ich suche auch nach einem multivariaten Test wie der T-Statistik von Hotelling. Referenzen geschätzt. Nehmen wir für den multivariaten Fall an, dass wir und , wobei (bzw. ) eine Abkürzung für einen Stichprobenmittelwert, eine Stichprobenstandardabweichung und eine Anzahl von …



Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.