Microsoft Research presenta CARE-X: un modelo de visión-lenguaje para radiología con supervisión auxiliar, aprendizaje alineado por recompensas y medición aumentada por herramientas
Microsoft
Google/DeepMind
Microsoft Research presenta CARE-X, un modelo de investigación de visión-lenguaje para radiografías de tórax que unifica la redacción generativa de informes y las predicciones diagnósticas estructuradas. Utiliza cabezales auxiliares para proporcionar puntuaciones de confianza calibradas, aprendizaje por refuerzo DAPO para la corrección clínica, y demuestra que la medición aumentada por herramientas mejora significativamente la detección de afecciones dependientes de medición, como la cardiomegalia.
Microsoft Research ha desarrollado CARE-X, un modelo de investigación para la interpretación de radiografías de tórax que combina capacidades generativas y discriminativas para respaldar una amplia gama de tareas radiológicas, desde la generación de informes hasta la clasificación de enfermedades y el anclaje anatómico. Construido sobre un codificador visual SigLIP2 y el modelo de lenguaje Phi-4-mini, CARE-X añade cabezales auxiliares específicos para cada tarea que proporcionan puntuaciones de confianza calibradas, lo que permite a los clínicos ajustar los equilibrios entre sensibilidad y especificidad. El modelo se entrena en tres etapas de ajuste fino supervisado seguidas de aprendizaje por refuerzo DAPO, que optimiza las recompensas específicas de cada tarea para la elaboración de informes clínicos, la precisión diagnóstica y el anclaje espacial. En conjuntos de referencia como MIMIC-CXR, IU-Xray, CheXpert-Plus y ReXGradient, CARE-X logra un rendimiento sólido, y alcanza una precisión del 94% en el conjunto ReXVQA, superando a otros modelos publicados. En un experimento aparte, el equipo combinó Qwen3-VL-4B-Instruct con herramientas de medición deterministas para manejar evaluaciones cuantitativas como la cardiomegalia y el agrandamiento aórtico, lo que superó significativamente a la aproximación visual por sí sola; por ejemplo, el F1 para cardiomegalia mejoró de 74,56 a 96,00. El modelo fue validado con datos clínicos reales de la India de Narayana Health, incluyendo patologías raras de UCI, pero es un modelo de investigación no aprobado para uso clínico.
Fuente: Microsoft Research —
original
