заметили этого, а после корректировки на неопределенность сущностей показатели четырех открытых моделей упали более чем на 10%. Исследование под названием Verify with Caution протестировало пять метрик достоверности на одиннадцати наборах данных, выявив несоответствия и ошибки, особенно когда вспомогательный текст был далек от утверждения. В человеческих экспериментах помощь ИИ ускоряла проверку, но приводила к излишнему доверию, когда модель давала убедительные, но ошибочные объяснения; демонстрация плюсов и минусов снизила этот эффект, но не дала заметного преимущества перед поисковыми системами. В статье сравнивается проверка по разным областям: для кода существуют компиляторы и тесты, для математики — верификация формальных доказательств (например, AlphaProof и AlphaGeometry 2 решили четыре задачи на Международной математической олимпиаде 2024 года), а аналитику и стратегию проверять сложнее. Предлагаются следующие решения: сначала показывать источники, как в подходе Attribute First, then Generate, а также использовать пошаговые вознаграждения (ThinkPRM) для проверки шагов рассуждений. В статье также упоминается подход на основе рисков, предлагаемый NIST, и Европейский закон об ИИ, которые требуют больше документации и надзора для систем высокого риска.