срабатывания, путала классы и обращала внимание на артефакты кадра, а не на патологии. Вместо этого он выбрал предобученный кодировщик RAD-DINO-MAIRA-2 от Microsoft, обученный самообучением на 1,4 млн рентгенов. Кодировщик был заморожен, обучалась только голова из LayerNorm, Linear, GELU, Dropout и Linear (199 942 параметра из 86 780 422). Обучение велось на A100 80 ГБ на RunPod (около $300) с пакетом 64, точностью bf16 и ранней остановкой. Данные брались с Kaggle: VinBigData (15 000 снимков) и OpenI (7466 снимков, метки извлечены из текстов отчётов по правилам). Итоговый набор — 22 466 снимков, деление 85/15. Для OpenI использовался WeightedRandomSampler с весом 5×, для VinBigData — 1×. Функция потерь — взвешенная BCEWithLogitsLoss с pos_weight для каждого класса. Аугментации включали RandomResizedCrop, ShiftScaleRotate и RandomBrightnessContrast без горизонтального отражения, чтобы не ломать анатомию. Автор подчёркивает, что главное узкое место — не архитектура, а чистые данные, и рекомендует избегать грязных датасетов вроде NIH ChestX-ray14. В настоящее время он ищет организацию для клинических испытаний для регистрации изделия 3 класса риска в РФ.