обучение, когда потери уменьшаются, но модель не способна к обобщению. Команда разработала метод обнаружения подобных примеров и предложила технику для смягчения ложного обучения, что повышает надежность SFT.