Новый метод извлекает скрытые рассуждения из передовых моделей ИИ
Исследователи нашли способ извлекать скрытые рассуждения передовых моделей ИИ, что потенциально позволяет проводить атаки с дистилляцией и раскрывать частную информацию. Они выявили проблему в моделях OpenAI, Anthropic и Google, а также обнаружили, что китайская модель Kimi K3 генерирует поразительно похожие рассуждения на Claude Opus и GPT-5.6, хотя это не является окончательным доказательством дистилляции. Компании смягчили уязвимость, но не полностью устранили её.
Учёные-компьютерщики, среди которых Александр Панфилов (Alexander Panfilov) из Тюбингенского университета, обнаружили способ извлекать скрытые «рассуждения» передовых ИИ-моделей. Техника использует тот факт, что компании предлагают более компактные и менее «выровненные» (aligned) варианты моделей, которые используют тот же ключ дешифрования, но охотнее раскрывают внутренний ход рассуждений.
Показать ещё ↓
Источник: Wired AI —
оригинал
