Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

3
So testen Sie formell, ob eine normale (oder eine andere) Verteilung „unterbrochen“ ist
In der Sozialwissenschaft kommt es häufig vor, dass Variablen, die beispielsweise normal verteilt werden sollten , eine Diskontinuität in ihrer Verteilung um bestimmte Punkte aufweisen. Wenn es beispielsweise bestimmte Grenzwerte wie "Bestehen / Nichtbestehen" gibt und diese Maßnahmen einer Verzerrung unterliegen, kann es an diesem Punkt zu einer Diskontinuität kommen. …

3
Statistiken für Online-Dating-Sites
Ich bin gespannt, wie ein Online-Dating-System Umfragedaten verwenden könnte, um Übereinstimmungen zu ermitteln. Angenommen, sie haben Ergebnisdaten aus vergangenen Spielen (z. B. 1 = glücklich verheiratet, 0 = kein 2. Datum). Nehmen wir als nächstes an, sie hätten zwei Präferenzfragen: "Wie sehr genießen Sie Outdoor-Aktivitäten? (1 = stark ablehnen, 5 …


1
Verteilung der Differenz zweier unabhängiger einheitlicher Variablen, abgeschnitten bei 0
Sei und zwei unabhängige Zufallsvariablen mit der gleichen Gleichverteilung mit DichteXXXYYYU(0,1)U(0,1)U(0,1) f(x)=1f(x)=1f(x)=1 wenn (und anderer Stelle).0≤x≤10≤x≤10≤x≤1000 Sei eine echte Zufallsvariable, definiert durch:ZZZ Z=X−YZ=X−YZ=X-Y wenn (und anderswo ).X>YX>YX>Y000 Leiten Sie die Verteilung von .ZZZ Berechnen Sie die Erwartung und die Varianz .E(Z)E(Z)E(Z)V(Z)V(Z)V(Z)

8
Welcher Algorithmus könnte verwendet werden, um den Verbrauch von Verbrauchsmaterialien anhand von Daten aus früheren Einkäufen vorherzusagen?
Wenn ich über ein vermeintlich einfaches, aber interessantes Problem nachdenke, möchte ich einen Code schreiben, um die Verbrauchsmaterialien vorherzusagen, die ich in naher Zukunft benötigen werde, angesichts der vollständigen Historie meiner vorherigen Einkäufe. Ich bin sicher, dass diese Art von Problem eine allgemeinere und besser untersuchte Definition hat (jemand schlug …

3
Wie werden longitudinale Variablen gruppiert?
Ich habe eine Reihe von Variablen, die Längsschnittdaten von Tag 0 bis Tag 7 enthalten. Ich suche nach einem geeigneten Clustering-Ansatz, mit dem diese Längsschnittvariablen (keine Fälle) in verschiedene Gruppen gruppiert werden können. Ich habe versucht, diesen Datensatz zeitlich getrennt zu analysieren, aber das Ergebnis war ziemlich schwer zu erklären. …
10 clustering 

2
Berichtsergebnisse einer einfachen linearen Regression: Welche Informationen müssen einbezogen werden?
Ich habe gerade eine (sehr) einfache lineare Regression in Genstat durchgeführt und möchte eine kurze und aussagekräftige Zusammenfassung der Ausgabe in meinen Bericht aufnehmen. Ich bin mir nicht sicher, was oder wie viele Informationen ich aufnehmen soll. Die Hauptbits meiner Genstat-Ausgabe sehen folgendermaßen aus: Summary of analysis Source d.f. s.s. …

1
Wie würden Sie Bayes'sche Schätzungen in eine Metaanalyse einbeziehen?
Inspiriert von dieser Frage und speziellem "Problem 3": Posteriore Verteilungen sind etwas schwieriger in eine Metaanalyse einzubeziehen, es sei denn, eine häufig verwendete, parametrische Beschreibung der Verteilung wurde bereitgestellt. Ich habe in letzter Zeit viel darüber nachgedacht, Metaanalysen in ein Bayes'sches Modell zu integrieren - hauptsächlich als Quelle für Prioritäten …

1
Wie kann ich Korrelationen zwischen Abstürzen und Systemumgebungen finden?
In meiner Freizeit arbeite ich an einem kleinen webbasierten System, das Absturzberichte (aber keine anderen, nicht abstürzenden Fehlerberichte) sammelt, die von Delphi Windows-Anwendungen gesendet werden. Zur Fehlerbehebung hätten Benutzer gerne eine Data-Mining-Funktion, um Beziehungen zwischen Hardware- oder Betriebssystemversionen und dem spezifischen Fehler und / oder Absturz zu finden. Als Beispiel, …

2
So führen Sie eine ROC-Analyse in R mit einem Cox-Modell durch
Ich habe einige Cox-Regressionsmodelle erstellt und möchte sehen, wie gut diese Modelle funktionieren. Ich dachte, dass möglicherweise eine ROC-Kurve oder eine c-Statistik nützlich sein könnte, ähnlich wie in diesem Artikel: JN Armitage und JH van der Meulen, "Identifizierung der Komorbidität bei chirurgischen Patienten unter Verwendung von Verwaltungsdaten mit dem Charlson …
10 r  survival  roc 

2
Hypothesentest und Gesamtvariationsabstand vs. Kullback-Leibler-Divergenz
Bei meiner Forschung bin ich auf das folgende allgemeine Problem gestoßen: Ich habe zwei Verteilungen und über dieselbe Domäne und eine große (aber endliche) Anzahl von Stichproben aus diesen Verteilungen. Die Proben sind unabhängig und identisch von einer dieser beiden Verteilungen verteilt (obwohl die Verteilungen verwandt sein können: Zum Beispiel …

2
Ein gutes Buch mit gleichem Schwerpunkt auf Theorie und Mathematik
Ich habe während meiner Schulzeit und an der Universität genug Kurse über Statistik gehabt. Ich habe ein gutes Verständnis für die Konzepte wie CI, p-Werte, Interpretation der statistischen Signifikanz, Mehrfachtests, Korrelation, einfache lineare Regression (mit kleinsten Quadraten) (allgemeine lineare Modelle) und alle Hypothesentests. Ich war in den früheren Tagen größtenteils …

1
Gute Praktiken bei der Vorhersage von Zeitreihen
Ich arbeite seit Monaten an kurzfristigen Lastprognosen und der Verwendung von Klima- / Wetterdaten, um die Genauigkeit zu verbessern. Ich habe einen Informatik-Hintergrund und aus diesem Grund versuche ich, keine großen Fehler und unfairen Vergleiche mit Statistik-Tools wie ARIMA-Modellen zu machen. Ich würde gerne Ihre Meinung zu ein paar Dingen …

2
Leistung für zwei Proben t Test
Ich versuche, die Leistungsberechnung für den Fall des t-Tests mit zwei unabhängigen Stichproben zu verstehen (ohne gleiche Varianzen anzunehmen, also habe ich Satterthwaite verwendet). Hier ist ein Diagramm, das ich gefunden habe, um den Prozess zu verstehen: Also nahm ich an, dass angesichts der folgenden Angaben zu den beiden Populationen …

1
Ist der Stichprobenmittelwert in gewissem Sinne die „beste“ Schätzung des Verteilungsmittelwerts?
Nach dem (schwachen / starken) Gesetz großer Zahlen bedeutet ihre Stichprobe bei einigen iid-Stichprobenpunkten einer Verteilung f ∗ ( { x i , i = 1 , …). , N } ) : = 1{xi∈Rn,i=1,…,N}{xi∈Rn,i=1,…,N}\{x_i \in \mathbb{R}^n, i=1,\ldots,N\}f∗({xi,i=1,…,N}):=1N∑Ni=1xif∗({xi,i=1,…,N}):=1N∑i=1Nxif^*(\{x_i, i=1,\ldots,N\}):=\frac{1}{N} \sum_{i=1}^N x_i konvergiert sowohl in der Wahrscheinlichkeit als auch als zum …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.