Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

4
Entwickeln Sie einen statistischen Test, um zwei Produkte zu unterscheiden
Ich habe einen Datensatz aus einer Kundenumfrage und möchte einen statistischen Test durchführen, um festzustellen, ob zwischen Produkt 1 und Produkt 2 ein Signifikanzunterschied besteht. Hier ist ein Datensatz mit Kundenbewertungen. Die Rate ist von sehr schlecht, schlecht, okay, gut bis sehr gut. customer product1 product2 1 very good very …

1
Frage zur Normalitätsannahme des t-Tests
Bei T-Tests wird nach den meisten Texten davon ausgegangen, dass die Bevölkerungsdaten normal verteilt sind. Ich verstehe nicht, warum das so ist. Erfordert ein T-Test nicht nur, dass die Stichprobenverteilung der Stichprobenmittel normal verteilt ist und nicht die Population? Wenn der T-Test letztendlich nur eine Normalität in der Stichprobenverteilung erfordert, …

3
R saisonale Zeitreihen
Ich benutze die decomposeFunktion in Rund überlege mir die 3 Komponenten meiner monatlichen Zeitreihen (Trend, Saison und Zufall). Wenn ich das Diagramm zeichne oder auf die Tabelle schaue, kann ich deutlich sehen, dass die Zeitreihe von der Saisonalität beeinflusst wird. Wenn ich jedoch die Zeitreihen auf die 11 saisonalen Dummy-Variablen …


2
Wie normalisiert das Protokoll (p (x, y)) die punktuelle gegenseitige Information?
Ich versuche, die normalisierte Form der punktuellen gegenseitigen Information zu verstehen. npmi=pmi(x,y)log(p(x,y))npmi=pmi(x,y)log(p(x,y))npmi = \frac{pmi(x,y)}{log(p(x,y))} Warum normalisiert die logarithmische Gelenkwahrscheinlichkeit die punktweise gegenseitige Information auf [-1, 1]? Die punktuelle gegenseitige Information ist: p m i = l o g( p ( x , y)p ( x ) p ( y))pmi=log(p(x,y)p(x)p(y))pmi = …

1
Entspricht eine Bayes'sche Schätzung mit einem „Flat Prior“ einer Maximum-Likelihood-Schätzung?
In der Phylogenetik werden phylogenetische Bäume häufig mithilfe von MLE- oder Bayes'schen Analysen konstruiert. In der Bayes'schen Schätzung wird häufig ein flacher Prior verwendet. Nach meinem Verständnis ist eine Bayes'sche Schätzung eine Wahrscheinlichkeitsschätzung, die einen Prior enthält. Meine Frage ist, wenn Sie eine Wohnung vor verwenden, unterscheidet sie sich von …

1
Was ist der Unterschied zwischen einem statistischen Nullhypothesentest und einem anderen Test?
Ein aktuelles heißes Diskussionsthema betrifft eine Zeitschrift, die die Verwendung von "statistischen Nullhypothesen-Testverfahren (NHSTPs)" aus Artikeln verbietet, die an die Zeitschrift übermittelt wurden. Ich sehe diesen Begriff von einigen Schriftstellern verwendet, aber ich verstehe nicht, welchen Unterschied sie machen wollen. Unterscheidet sich ein NHSTP von einem "Hypothesentest" oder einem "Signifikanztest"?

2
Trimmmittelwert gegen Median
Ich habe einen Datensatz mit allen Anrufen bei einem Rettungsdienst und den Reaktionszeiten der Krankenwagenabteilung. Sie gaben zu, dass es einige Fehler bei den Antwortzeiten gibt, da es Fälle gibt, in denen sie nicht mit der Aufnahme begonnen haben (der Wert ist also 0) oder in denen sie die Uhr …

1
Auswahl eines k-Werts für die LOF-Erkennungsanalyse (Local Outlier Factor)
Ich habe eine Reihe dreidimensionaler Daten und versuche, mithilfe der lokalen Ausreißerfaktoranalyse die eindeutigsten oder seltsamsten Werte zu identifizieren. Wie entscheidet man den k-Wert für die LOF-Analyse? Ich verstehe, was der k-Wert bestimmt, und bin daher nicht überrascht, dass ich mit unterschiedlichen k leicht unterschiedliche Ergebnisse sehe, aber ich bin …


6
Vorbereiten / Erstellen von Funktionen für die Erkennung von Anomalien (Netzwerksicherheitsdaten)
Mein Ziel ist es, Netzwerkprotokolle (z. B. Apache, Syslog, Active Directory-Sicherheitsüberwachung usw.) mithilfe von Clustering / Anomalieerkennung für Intrusion Detection-Zwecke zu analysieren. Aus den Protokollen habe ich viele Textfelder wie IP-Adresse, Benutzername, Hostname, Zielport, Quellport usw. (insgesamt 15-20 Felder). Ich weiß nicht, ob es einige Angriffe in den Protokollen gibt, …

3
Modellierung von Zähldaten, bei denen die Versatzvariable für einige Beobachtungen 0 ist
Ich versuche einem Studenten eines Kollegen zu helfen. Der Student beobachtete und zählte das Verhalten der Vögel (Anzahl der Anrufe) in einem Versuchsaufbau. Die Anzahl der Anrufe, die einem bestimmten beobachteten Vogel während jedes Experiments zugeordnet werden konnten, konnte nicht bestimmt werden, aber es war möglich, die Anzahl der Vögel …

1
Wendet Monte Carlo == einen zufälligen Prozess an?
Ich hatte nie einen formalen Statistikkurs, aber aufgrund meiner Forschungsrichtung stoße ich ständig auf Artikel, die verschiedene statistische Konzepte anwenden. Oft sehe ich eine Beschreibung eines Monte-Carlo- Prozesses, der auf eine bestimmte Situation angewendet wird, und für das, was ich 9 von 10 Mal erfassen kann, kommt es auf eine …


1
Wie fair ist es, das Wort „Vorhersagen“ für (logistische) Regression zu verwenden?
Mein Verständnis ist, dass selbst Regression keine Kausalität gibt. Es kann nur eine Assoziation zwischen y-Variablen und x-Variablen und möglicherweise eine Richtung geben. Hab ich recht? Ich habe oft Sätze gefunden, die "x sagt y voraus" ähneln, selbst in den meisten Lehrbüchern und auf verschiedenen Kursseiten online. Und Sie nennen …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.