微软研究院发布CARE-X:具备辅助监督、奖励对齐学习与工具增强测量的放射学视觉语言模型
Microsoft
Google/DeepMind
微软研究院推出CARE-X,这是一个胸部X光片的视觉语言模型,统一了生成式报告撰写与结构化诊断预测。它利用辅助头提供校准的置信度分数,采用DAPO强化学习以保证临床正确性,并证明工具增强测量能显著提升对心脏肥大等依赖测量的病症的检测能力。
微软研究院开发了CARE-X,这是一种用于胸部X光片解读的研究模型,它结合了生成式与判别式能力,可支持从报告生成到疾病分类和解剖定位等一系列放射学任务。该模型基于SigLIP2视觉编码器和Phi-4-mini语言模型构建,并添加了特定于任务的辅助头,提供校准后的置信度分数,使临床医生能够调整灵敏度-特异性之间的权衡。该模型经过三个阶段的监督微调,随后采用DAPO强化学习,优化临床报告、诊断准确性和空间定位等方面的任务特定奖励。在MIMIC-CXR、IU-Xray、CheXpert-Plus和ReXGradient等基准测试中,CARE-X表现出色,并在ReXVQA基准上达到94%的准确率,超越了其他公开报告的模型。在另一项实验中,研究团队将Qwen3-VL-4B-Instruct与确定性测量工具配对,用于处理心脏肥大和主动脉增宽等定量评估,这显著优于仅依赖视觉近似的方法;例如,心脏肥大的F1分数从74.56提升到96.00。该模型在来自Narayana Health的真实世界印度临床数据(包括罕见ICU病理)上进行了验证,但它是一个研究模型,未被批准用于临床。
来源: Microsoft Research —
原文
