краткого резюме, а провайдеры шифруют их, чтобы защитить интеллектуальную собственность. Команда выяснила, что зашифрованные процессы рассуждений переносимы между сессиями, пользователями и моделями внутри одного провайдера. Например, модель Haiku 4.5 компании Anthropic способна прочитать «мысли» модели Opus 4.8, а с помощью джейлбрейка — воспроизвести их буквально, не атакуя при этом более защищённую Opus напрямую. Тот же метод сработал и с моделями OpenAI и Gemini. Проблема тянется ещё с мая, когда криптограф Мэттью Грин (Matthew Green) обратил внимание на то, что зашифрованные блоки рассуждений можно воспроизвести за пределами исходного контекста, однако провайдеры не увидели в этом угрозы безопасности. Новое исследование показывает, что такая оценка была ошибочной. Переносимость токенов также вызывает опасения по поводу дистилляции рассуждений: китайская модель Kimi-K3, если её «предзаполнить» несколькими токенами из следов рассуждений Opus, заметно смещала свои ответы в сторону стиля Opus, а анализ на предмет запоминания показал, что отдельные фрагменты рассуждений Claude и GPT извлекаются из Kimi-K3 на до шести порядков легче, чем из аналогичных моделей, что указывает на обучение на этих следах. Публичное раскрытие таких сессий рискует привести к утечке персональных данных: при сканировании около 7000 публичных следов рассуждений было найдено 62 ключа API, 33 адреса электронной почты, 33 пароля и другие конфиденциальные данные. Стоимость атаки составляет около 720 долларов США для декодирования 10 000 следов. Исследователи раскрыли уязвимость ответственно, и лаборатории уже устранили несколько проблем.
Показать ещё ↓