Routine clinical reports contain rich supervision signals—you can extract finding-to-frame correspondence at scale to train medical vision-language models without expensive frame-level annotation, turning existing documentation into training data.
EndoCLIP is a vision-language model trained on 280,000 colonoscopy reports to link clinical findings with individual video frames.