Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

2
Interrater-Zuverlässigkeit für Ereignisse in einer Zeitreihe mit Unsicherheit über die Ereigniszeit
Ich habe mehrere unabhängige Programmierer, die versuchen, Ereignisse in einer Zeitreihe zu identifizieren. In diesem Fall sehen sie sich ein Video von Gesprächen von Angesicht zu Angesicht an, suchen nach bestimmten nonverbalen Verhaltensweisen (z. B. Kopfnicken) und codieren die Zeit und die Kategorie der einzelnen Ereignisse Veranstaltung. Diese Daten könnten …

3
Testen der Nichtlinearität in der logistischen Regression (oder anderen Formen der Regression)
Eine der Voraussetzungen für eine logistische Regression ist die Linearität des Logits. Sobald ich mein Modell zum Laufen gebracht habe, teste ich es mit dem Box-Tidwell-Test auf Nichtlinearität. Einer meiner kontinuierlichen Prädiktoren (X) wurde positiv auf Nichtlinearität getestet. Was soll ich als nächstes tun? Da dies einen Verstoß gegen die …


3
OLS ist BLAU. Aber was ist, wenn mir Unparteilichkeit und Linearität egal sind?
Das Gauß-Markov-Theorem besagt, dass der OLS-Schätzer der beste lineare unverzerrte Schätzer für das lineare Regressionsmodell ist. Angenommen, mir geht es nicht um Linearität und Unparteilichkeit. Gibt es dann einen anderen (möglichen nichtlinearen / voreingenommenen) Schätzer für das lineare Regressionsmodell, der unter den Gauß-Markov-Annahmen oder einer anderen allgemeinen Menge von Annahmen …

4
Wie ist die Verteilung von OR (Odds Ratio)?
Ich habe eine Reihe von Artikeln, in denen "OR" mit einem CI von 95% (Konfidenzintervalle) dargestellt wird. Ich möchte aus den Artikeln den P-Wert für den beobachteten OP abschätzen. Dafür brauche ich eine Annahme bezüglich der OP-Verteilung. Welche Distribution kann ich sicher übernehmen / nutzen?


4
Beste Möglichkeiten zum Aggregieren und Analysieren von Daten
Ich habe gerade erst angefangen, mir Maschinelles Lernen und Datenanalyse beizubringen, und stoße auf eine Mauer, in der es darum geht, große Datenmengen zu erstellen und abzufragen. Ich möchte Daten, die ich in meinem beruflichen und privaten Leben gesammelt habe, aufgreifen und analysieren, bin mir jedoch nicht sicher, wie ich …


3
Warum benötigen neuronale Netze die Auswahl / Entwicklung von Funktionen?
Insbesondere im Zusammenhang mit Kaggle-Wettbewerben habe ich festgestellt, dass es bei der Leistung des Modells ausschließlich um die Auswahl / Entwicklung von Funktionen geht. Ich kann zwar vollständig verstehen, warum dies bei den konventionelleren / altmodischen ML-Algorithmen der Fall ist, sehe aber nicht, warum dies bei Verwendung tiefer neuronaler Netze …

2
Warum den Logit-Link in der Beta-Regression verwenden?
Vor kurzem war ich daran interessiert, ein Beta-Regressionsmodell für ein proportionales Ergebnis zu implementieren. Beachten Sie, dass dieses Ergebnis nicht in einen Binomialkontext passt, da es in diesem Kontext kein aussagekräftiges Konzept für einen diskreten "Erfolg" gibt. Tatsächlich ist das Ergebnis tatsächlich ein Anteil der Dauer; Der Zähler ist die …

2
Warum ist es falsch, einen A / B-Test abzubrechen, bevor die optimale Stichprobengröße erreicht ist?
Ich bin dafür verantwortlich, die Ergebnisse von A / B-Tests (die auf Website-Variationen ausgeführt werden) in meinem Unternehmen zu präsentieren. Wir führen den Test einen Monat lang durch und überprüfen dann die p-Werte in regelmäßigen Abständen, bis wir die Signifikanz erreichen (oder geben auf, wenn die Signifikanz nach längerer Durchführung …

1
Ist es im Allgemeinen schwieriger, Schlussfolgerungen zu ziehen, als Vorhersagen zu treffen?
Meine Frage ergibt sich aus der folgenden Tatsache. Ich habe Beiträge, Blogs, Vorträge sowie Bücher über maschinelles Lernen gelesen. Mein Eindruck ist, dass Praktiker des maschinellen Lernens vielen Dingen, die Statistiker / Ökonometrie interessieren, gleichgültig gegenüberstehen. Insbesondere betonen Praktiker des maschinellen Lernens die Vorhersagegenauigkeit gegenüber der Inferenz. Ein solches Beispiel …



4
Warum funktioniert Propensity Score Matching für kausale Inferenz?
Propensity Score Matching wird verwendet, um kausale Schlussfolgerungen in Beobachtungsstudien zu ziehen (siehe das Rosenbaum / Rubin-Papier ). Was ist die einfache Intuition dahinter, warum es funktioniert? Mit anderen Worten, warum verschwinden die verwirrenden Effekte, wenn wir sicherstellen, dass die Wahrscheinlichkeit einer Teilnahme an der Behandlung für beide Gruppen gleich …

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.