Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
Ist ein fetter Schwanz gleich wie Schräg
Ich höre diese Begriffe immer wieder und es scheint, dass sich beide auf dasselbe beziehen: eine größere Wahrscheinlichkeit, dass ein Ereignis bei den Extremwerten einer Verteilung auftritt, weit weg vom Mittelwert (mehr als 3 Standardabweichungen entfernt)

1
So passen Sie ein stückweise konstantes Modell (oder ein Schrittfunktionsmodell) an und vergleichen es mit dem logistischen Modell in R.
Ich habe x, y-Daten, wobei x die Position (entlang eines Transekts) und y eine kontinuierliche Variable (z. B. Temperatur) ist. x<-c(115,116,117,118,124,125,126,127,128,129,130,131,132,133,134,135,136,137,138,139,140,141,142,143,144,145,146,147,148,149,150,151) y<-c(68.3864344929207,69.3317985238957,70.5644430507252,68.7245413735345,68.2444929220624,69.2335442981487,68.9683874048675,69.7104166614154,70.6047681836632,71.1807115091657,70.3333333333333,70,69.735105818315,69.6487585375593,70,69.4943374527374,69,70.3590104484011,70.283981899468,68.9087146344906,68.6666666666667,68.5232663969658,68.088410889283,67.567883666713,66.9865494087022,66,66.3333333333333,66.0165138638852,65.6666666666667,65.7465975732667,66.3333333333333,66.6579079386334) Ich möchte ein lineares Modell, ein 4-Parameter-Logistikmodell und eine stückweise konstante Funktion (auch bekannt als Schrittfunktion) mit einem Haltepunkt an diese Daten anpassen und Modelle vergleichen, um festzustellen, …

1
Schrumpfung der Eigenwerte
Angenommen , wir haben Proben die unabhängig und identisch mit dem Mittelwert = 0 und unbekannte nicht-singulären Kovarianzmatrix verteilt . Jede Probe ist ein Vektor der Größe .nnnX.1, . . . ,X.nX1,...,XnX_1,..., X_nM.MMX.ichXiX_ip × 1p×1p\times 1 Ich möchte den "Stein-Haff-Schätzer" [Stein, C. 1975] anwenden, der durch Verkleinern seiner Eigenwerte schätzt …

2
Eine Frage zur effektiven Stichprobengröße in Lebenstabellen
Ich studiere derzeit grundlegende Methoden der Überlebensanalyse und bin auf diesen seltsamen Schätzer der effektiven Stichprobengröße in einem bestimmten Intervall gestoßen. Für das j-te Intervall ist der Schätzer gegeben durchn'jnj′n^{\prime}_j n'j=nj- -cj2nj′=nj−cj2n^{\prime}_j=n_j-\frac{c_j}{2} Dabei ist die Anzahl der Personen, bei denen zu Beginn des j-ten Intervalls das Risiko eines Todes besteht, …

1
Gibt es eine Bedeutung der Fläche unter Kurven im Lasso-Diagramm?
Das folgende Diagramm wird bei der Durchführung von LASSO mit dem glmnet-Paket erhalten: Gibt es eine Signifikanz der Fläche unter den Kurven (unter Verwendung von 0 als Basislinie) für die Berichterstattung über die Signifikanz der Variablen? Können wir sagen, dass die Bedeutung verschiedener Variablen für die Vorhersage der abhängigen Variablen …

3
Zur Stichprobenkomplexität der Mittelwertschätzung in -norm
Sei , sei eine Verteilung über und nehme an, dass seine Unterstützung in der Einheit -ball enthalten ist. Was ist die minimale Anzahl von iid-Stichproben , , die benötigt werden, um einen Schätzer des Mittelwerts mit der folgenden Garantie zu berechnen ?1≤p≤∞1≤p≤∞1\leq p\leq \inftyDD{\cal D}RdRd\mathbb{R}^dpppnnnWi∼DWi∼DW_i\sim {\cal D}i=1,…,ni=1,…,ni=1,\ldots,nW~W~\tilde W P{∥W~−EW∼D[W]∥p≤ε}≥1−δ.P{‖W~−EW∼D[W]‖p≤ε}≥1−δ. \mathbb{P}\{ …

3
Berechnung der Stichprobengröße für die Korrelationsstudie
Ich plane eine Studie, um die Korrelation zwischen wahrgenommenem Stress bei Medizinstudenten und ihrer akademischen Leistung zu bewerten. Nach einer Literaturrecherche scheint eine kürzlich durchgeführte Studie einen Korrelationskoeffizienten von 0,47 angegeben zu haben. Wenn ich diesen Wert jedoch verwende, um meine erforderliche Stichprobengröße über einige Online-Rechner zu berechnen, beträgt mein …

1
Warum ein Mischungsmodell mit RNN verwenden, anstatt nur reale Werte direkt vorherzusagen?
Alex Graves hat ein Modell erstellt, um Handschriftsequenzen zu generieren, die ein LSTM (Art Recurrent Neural Network) verwenden, um die Parameter für ein Mischungsmodell vorherzusagen. Das Mischungsmodell wird dann verwendet, um die nächste x-, y-Koordinate vorherzusagen und ob der Stift nach oben oder unten zeigt. Generieren von Sequenzen mit wiederkehrenden …

2
Warum passt eine logarithmische Normalverteilung gut zu den Serverantwortzeiten?
Ich fand heraus , dass Webserver Reaktionszeiten typischerweise als von einem Lognormalverteilung modelliert hier . Was ich nicht ganz verstehe, ist, warum dies der Fall ist! Insbesondere gibt Wikipedia an, dass eine Zufallsvariable X logarithmisch normal verteilt ist, wenn sie das Produkt mehrerer unabhängiger normaler Variablen ist. Was würden in …
7 lognormal  web 


3
Markov-Entscheidungsprozess in R für eine Song-Vorschlags-Software?
Wir haben einen Musik-Player mit unterschiedlichen Wiedergabelisten, der automatisch Titel aus der aktuellen Wiedergabeliste vorschlägt, in der ich mich befinde. Ich möchte, dass das Programm lernt, dass wenn ich den Titel überspringe, die Wahrscheinlichkeit verringert wird, dass er erneut in dieser Wiedergabeliste abgespielt wird . Ich denke, dies wird als …

2
Eine stetige Funktion einer Folge von Zufallsvektoren konvergiert mit der Wahrscheinlichkeit gegen die Funktion der Grenze
Satz: Wenn eine Folge von k-dimensionalen Zufallsvektoren st und wenn eine kontinuierliche Abbildung ist, dann ist .{Xn}{Xn}\{ X_n \}Xn→pXXn→pXX_n \overset{p}{\to} Xg:Rk→Rmg:Rk→Rmg: R^k \rightarrow R^mg(Xn)→pg(X)g(Xn)→pg(X)g(X_n) \overset{p}{\to} g(X) Beweis: Sei eine positive reelle Zahl. Dann geben wir ein wir haben KKKϵ>0ϵ>0\epsilon > 0 Ich verstehe nicht, warum einheitlich stetig ist und könnte …

2
Wie balanciere ich meinen Datensatz?
Ich habe 90% negative Beispiele und 10% positive Beispiele (13.000 Beobachtungen, 90 Variablen). Mein Modell zeigt mir, dass der Fehler bei der Fehlklassifizierung 0,1 beträgt, aber meine Verwirrungsmatrix zeigt mir, dass die Anzahl der TP sehr gering ist. Gibt es eine Möglichkeit, mein positives Beispiel zu übertasten oder meinen Datensatz …


4
Sehr unterschiedliche Ergebnisse der Hauptkomponentenanalyse in SPSS und Stata nach der Rotation
Für meine Doktorarbeit muss ich eine Hauptkomponentenanalyse (PCA) durchführen. Ich fand es in Stata nicht allzu schwierig und war glücklich, die Ergebnisse zu interpretieren (ich weiß, dass es einen Unterschied zwischen Faktor- und Hauptkomponentenanalyse gibt). Ich habe es jedoch mit einem Kollegen besprochen, der SPSS verwendet, also habe ich meine …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.