Microsoft Research dévoile CARE-X : un modèle vision-langage en radiologie avec supervision auxiliaire, apprentissage aligné sur les récompenses et mesure augmentée par outils
Microsoft
Google/DeepMind
Microsoft Research présente CARE-X, un modèle de recherche vision-langage pour radiographies thoraciques qui unifie la rédaction générative de rapports et les prédictions diagnostiques structurées. Il utilise des têtes auxiliaires pour fournir des scores de confiance calibrés, un apprentissage par renforcement DAPO pour la correction clinique, et démontre que la mesure augmentée par outils améliore significativement la détection de conditions dépendantes de la mesure, comme la cardiomégalie.
Microsoft Research a développé CARE-X, un modèle de recherche pour l'interprétation des radiographies thoraciques qui combine des capacités génératives et discriminatives afin de prendre en charge un large éventail de tâches en radiologie, allant de la génération de comptes rendus à la classification des maladies en passant par l'ancrage anatomique. Construit sur un encodeur visuel SigLIP2 et le modèle de langage Phi-4-mini, CARE-X ajoute des têtes auxiliaires spécifiques aux tâches qui fournissent des scores de confiance calibrés, permettant aux cliniciens d'ajuster les compromis entre sensibilité et spécificité. Le modèle est entraîné en trois étapes de fine-tuning supervisé suivies d'un apprentissage par renforcement DAPO, qui optimise des récompenses spécifiques aux tâches pour la rédaction de comptes rendus cliniques, la précision diagnostique et l'ancrage spatial. Sur des référentiels tels que MIMIC-CXR, IU-Xray, CheXpert-Plus et ReXGradient, CARE-X obtient de bonnes performances, atteignant 94 % de précision sur le référentiel ReXVQA, surpassant ainsi d'autres modèles publiés. Dans une expérience distincte, l'équipe a associé Qwen3-VL-4B-Instruct à des outils de mesure déterministes pour traiter les évaluations quantitatives comme la cardiomégalie et l'élargissement aortique, ce qui a nettement surpassé l'approximation visuelle seule ; par exemple, le score F1 pour la cardiomégalie est passé de 74,56 à 96,00. Le modèle a été validé sur des données cliniques réelles indiennes provenant de Narayana Health, y compris des pathologies rares en soins intensifs, mais il s'agit d'un modèle de recherche non approuvé pour un usage clinique.
Source: Microsoft Research —
original
