Statistiken und Big Data

Fragen und Antworten für Personen, die sich für Statistik, maschinelles Lernen, Datenanalyse, Data Mining und Datenvisualisierung interessieren

5
Data Mining-Papiere / Beispiele
Ich suche nach mittelgroßen bis langen Artikeln / Websites / usw. zum Thema Data Mining, insbesondere dort, wo ein Datensatz von der Datenaufbereitung bis zum endgültigen Modell eingehend untersucht wird. Ich interessiere mich besonders für Diskussionen über die Anwendung von Algen des maschinellen Lernens und auch über die grundlegende Datenmodellierung. …
8 r  data-mining 

1
Warum funktioniert meine Replikation von Silver & Dunlap 1987 nicht?
Ich versuche Silver & Dunlap (1987) zu replizieren . Ich vergleiche nur die Mittelungskorrelationen oder die Mittelung der z-Transformationskorrelationen und die Rücktransformation. Ich scheine die Asymmetrie in der Verzerrung, die sie finden, nicht zu replizieren (rücktransformierte zs sind für mich nicht näher am Bevölkerungswert als rs). Irgendwelche Gedanken? Ist es …

1
Stichprobengröße und Kreuzvalidierungsmethoden für Cox-Regressionsvorhersagemodelle
Ich habe eine Frage, die ich der Community stellen möchte. Ich wurde kürzlich gebeten, statistische Analysen für eine Tumormarker-Prognosestudie bereitzustellen . Ich habe hauptsächlich diese beiden Referenzen verwendet, um meine Analyse zu leiten: McShane LM et al. Berichtsempfehlungen für prognostische Tumormarker-Studien (BEMERKUNG). J Natl Cancer Inst. 2005 Aug 17; 97 …

1
Softmax-Regressionsbias und vorherige Wahrscheinlichkeiten für ungleiche Klassen
Ich verwende die Softmax-Regression für ein Klassifizierungsproblem mit mehreren Klassen. Ich habe nicht für jede Klasse die gleichen vorherigen Wahrscheinlichkeiten. Ich weiß aus der logistischen Regression (Softmax-Regression mit 2 Klassen), dass die vorherigen Wahrscheinlichkeiten der Klassen implizit zum Bias addiert werden ( log(p0/p1)log⁡(p0/p1)\log(p_0/p_1) ). Normalerweise entferne ich diesen Begriff manuell …


5
Warum sagt ein lineares Regressionsmodell mit null Abschnitten besser voraus als ein Modell mit einem Abschnitt?
Viele Lehrbücher und Papiere sagten, dass das Abfangen nicht unterdrückt werden sollte. Kürzlich habe ich einen Trainingsdatensatz verwendet, um ein lineares Regressionsmodell mit oder ohne Achsenabschnitt zu erstellen. Ich war überrascht festzustellen, dass das Modell ohne Achsenabschnitt in einem unabhängigen Validierungsdatensatz eine bessere Vorhersage als das mit einem Achsenabschnitt in …

2
Wahrscheinlichkeit, dass gleichmäßig zufällige Punkte in einem Rechteck einen euklidischen Abstand haben, der unter einem bestimmten Schwellenwert liegt
Angenommen, wir haben Punkte in einem Rechteck mit gebundenen , und diese Punkte sind in dieser Ebene gleichmäßig verteilt. (Ich bin mit Statistiken nicht ganz vertraut, daher kenne ich den Unterschied zwischen der einheitlichen Auswahl eines Knotens im Bereich oder der einheitlichen Auswahl der Achse aus und Achse von unabhängig).nnn[0,a]×[0,b][0,a]×[0,b][0,a] …

3
Abstandsmetrik und Fluch der Dimensionen
In einigen Fällen habe ich einen Hinweis gelesen, dass Sie möglicherweise einen "Fluch der Dimensioalität" haben, wenn Sie viele Parameter und versuchen, eine "Ähnlichkeitsmetrik" zwischen diesen Vektoren zu finden. Ich glaube, es bedeutete, dass die meisten Ähnlichkeitswerte gleich sind und Ihnen keine nützlichen Informationen geben. Mit anderen Worten, fast alle …

2
Gutes Nachschlagewerk für Epidemiologie
Ich suche ein gutes Nachschlagewerk in Epidemiologie. Ich habe Rothmans Epidemiologie: Eine Einführung und Portas Ein Wörterbuch der Epidemiologie . Rothman's war eine große Enttäuschung, da es sehr simpel ist und alles fehlt, was nach dem Grundstudium nicht mehr offensichtlich ist. Ich habe gehört, dass seine moderne Epidemiologie gut ist, …

3
Wie werden Klassifikationen in einem Ensemble-Klassifikator zusammengeführt?
Wie verschmilzt ein Ensemble-Klassifikator die Vorhersagen seiner konstituierenden Klassifikatoren? Ich habe Schwierigkeiten, eine klare Beschreibung zu finden. In einigen Codebeispielen, die ich gefunden habe, mittelt das Ensemble nur die Vorhersagen, aber ich sehe nicht, wie dies zu einer "besseren" Gesamtgenauigkeit führen könnte. Betrachten Sie den folgenden Fall. Ein Ensemble-Klassifikator besteht …

1
Technische Variation gegenüber realem Signal
Ich teste auf Unterschiede in einem kontinuierlichen Ergebnis unter drei verschiedenen Bedingungen. Unter der Bedingung AI wird das Ergebnis gemessen. Ich mache das zweimal für die gleiche Probe. Beispielwerte könnten 2.2, 2.1 sein. Dies sind "technische" Replikate, die aus derselben biologischen Quelle stammen Ich mache dasselbe für vier "biologische" Replikate …
8 r  regression  anova 



3
Sind Ökologen die einzigen, die nicht wussten, dass der Arkussinus Asinin ist?
Proportions-, Verhältnis- und Prozentangaben sind in der Ökologie sehr verbreitet (z. B.% der bestäubten Blüten, Verhältnis von Männern zu Frauen,% Mortalität als Reaktion auf eine Behandlung,% der von einem Pflanzenfresser verzehrten Blätter). Kürzlich wurde von einigen angewandten Statistikern in der Zeitschrift Ecology ein Artikel mit dem Titel " Der Arkussinus …

3
Längsmodelle in R und WINBUGS oder JAGS
Ich habe versucht, R für einige Längsmodelle zu verwenden, hauptsächlich über lmerund nlmePakete. Es scheint jedoch, dass viele Standardmodelle fehlen, wie beispielsweise Antedependenzmodelle oder faktoranalytische Modelle für Kovarianzmatrizen. Diese Modelle sind in SAS leicht verfügbar. Würde jemand andere Pakete für den Job in R empfehlen? Es ist mir eigentlich egal, …
8 r  jags  panel-data 

Durch die Nutzung unserer Website bestätigen Sie, dass Sie unsere Cookie-Richtlinie und Datenschutzrichtlinie gelesen und verstanden haben.
Licensed under cc by-sa 3.0 with attribution required.