Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

1
Wie finde ich eine Dichte aus einer charakteristischen Funktion?
Eine Verteilung hat die charakteristische Funktion ϕ(t)=(1−t2/2)exp(−t2/4), −∞<t<∞ϕ(t)=(1−t2/2)exp⁡(−t2/4), −∞<t<∞\phi(t) = (1-t^2/2)\exp(-t^2/4),\ -\infty \lt t \lt \infty Zeigen Sie, dass die Verteilung absolut stetig ist, und schreiben Sie die Dichtefunktion der Verteilung. Versuch: ∫∞−∞|(1−t2/2)exp(−t2/4)|dt=(−2/t)(1−t2/2)exp(−t2/4)−2exp(−t2/ 4) |0- ∞∫−∞∞|(1−t2/2)exp⁡(−t2/4)|dt=(−2/t)(1−t2/2)exp⁡(−t2/4)−2exp⁡(−t2/4)|−∞0\int_{-\infty}^{\infty}|(1-t^2/2)\exp(-t^2/4)|dt =(-2/t)(1-t^2/2)\exp(-t^2/4)-2\exp(-t^2/4)|_{-\infty}^{0} Ähnliches Ergebnis für da t quadratisch ist.[ 0 , ∞ ][0,∞][0,\infty]ttt Ich bin …

2
Was ist die Rechtfertigung für eine unbeaufsichtigte Diskretisierung kontinuierlicher Variablen?
Eine Reihe von Quellen deuten darauf hin, dass die Diskretisierung (Kategorisierung) kontinuierlicher Variablen vor der statistischen Analyse viele negative Folgen hat (Referenzbeispiel [1] - [4] unten). Umgekehrt [5] wird vermutet, dass einige Techniken des maschinellen Lernens bekanntermaßen bessere Ergebnisse liefern, wenn kontinuierliche Variablen diskretisiert werden (wobei auch zu beachten ist, …

3
Interne Validierung über Bootstrap: Welche ROC-Kurve soll präsentiert werden?
Ich verwende den Bootstrap-Ansatz für die interne Validierung eines multivariaten Modells, das entweder mit einer logistischen Standardregression oder einem elastischen Netz erstellt wurde. Das Verfahren, das ich verwende, ist wie folgt: 1) Modell unter Verwendung des gesamten Datensatzes erstellen, vorhergesagte Werte erhalten und AUC berechnen (AUC_ap, offensichtlich) 2) Generieren Sie …


1
Warum repräsentiert zwischen zwei Variablen den Anteil der gemeinsamen Varianz?
Erstens schätze ich, dass Diskussionen über Allgemeinen Erklärungen zu (dh dem Bestimmungskoeffizienten in der Regression) hervorrufen . Das Problem, das ich beantworten möchte, besteht darin, dies auf alle Fälle der Korrelation zwischen zwei Variablen zu verallgemeinern.R 2r2r2r^2R2R2R^2 Ich bin also schon eine ganze Weile verwirrt über die gemeinsame Varianz. Ich …

2
Ist die Stichprobenverteilung für kleine Stichproben einer Normalbevölkerung normal oder t verteilt? [geschlossen]
Geschlossen . Diese Frage erfordert Details oder Klarheit . Derzeit werden keine Antworten akzeptiert. Möchten Sie diese Frage verbessern? Fügen Sie Details hinzu und klären Sie das Problem, indem Sie diesen Beitrag bearbeiten . Geschlossen vor 5 Jahren . Wenn ich weiß, dass die Population normal verteilt ist, und dann …


1
Ist in einem mit einer gewissen Effizienz gemessenen Poisson-Prozess die gemessene Anzahl immer noch Poisson?
Situation: Angenommen, ich habe einen Poisson-Prozess wie den radioaktiven Zerfall, bei dem R- Partikel pro Sekunde erzeugt werden. Ich messe mit einem Detektor. Es besteht eine Wahrscheinlichkeit P, dass ein Partikel vom Detektor erfasst wird. Dinge, die ich zu wissen glaube: Die Zwischenankunftszeit der Partikelemission ist exponentiell mit Parametern verteilt, …

1
Berechnung der inversen Wahrscheinlichkeitsgewichte - bedingte (multivariate) Dichteschätzung?
Die allgemeine Version: Ich muss schätzen, wobei und stetig und multivariat sind. Ich mache es lieber nichtparametrisch, weil ich keine gute funktionale Form im Sinn habe und so etwas wie unvoreingenommen sein muss. Ich wollte einen bedingten Kernel-Dichteschätzer verwenden, aber mir wurde klar, dass ich zuerst quantisieren musste . Dann …

1
Spezifikation der Paneldaten
Ich versuche, die beste Spezifikation für meinen Datensatz herauszufinden. Ich versuche, die Wirksamkeit der Sonderwirtschaftszonen in Polen im Sinne des Wirtschaftswachstums in drei ähnlichen Paneldatenmodellen für erläuterte Variablen zu untersuchen: a) registrierte Arbeitslosenquote b) BIP pro Kopf c) Bruttoanlageinvestitionen pro Kopf . Die Daten beziehen sich auf NUTS3-Unterregionen. Die erklärenden …


2
Clustering von Daten mit einer Mischung aus kontinuierlichen und kategorialen Variablen
Ich habe Daten, die einen Aspekt des menschlichen Verhaltens darstellen. Ich möchte es (unbeaufsichtigt) in irgendeine Art von Verhaltensprofilen gruppieren. Jetzt sind einige meiner Variablen kategorisch (mit 2 oder mehr Kategorien) und einige sind kontinuierlich (die meisten sind Prozentsätze). Einige Variablen sind noch komplexer, da eine Kategorie weiter kontinuierlich ist …

4
Clustering, das durch K-Mittel verursacht werden kann
Ich habe die folgende Frage als Testfrage für meine Prüfung erhalten und kann die Antwort einfach nicht verstehen. Ein Streudiagramm der auf die ersten beiden Hauptkomponenten projizierten Daten ist unten gezeigt. Wir möchten untersuchen, ob der Datensatz eine Gruppenstruktur enthält. Zu diesem Zweck haben wir den k-means-Algorithmus mit k = …

1
Interpretation eines gruppierten Restplots in der logistischen Regression
Ich eine logistische Regression mit unabhängigen Variablen und Beobachtungen durch. Ich bewerte die Modellanpassung, um festzustellen, ob die Daten den Modellannahmen entsprechen, und habe mit dem Paket das folgende gruppierte Restdiagramm erstellt:242424123,996123,996123,996arm R Offensichtlich gibt es einige schlechte Anzeichen in dieser Darstellung: Viele Punkte liegen außerhalb der Konfidenzbänder und die …


Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.