«предсказание предыдущего токена» (Previous-Token Prediction, PTP), обращает базовый принцип работы языковых моделей: вместо предсказания следующего токена обучается обратная модель, предсказывающая предыдущие токены. Эта обратная модель обучается с нуля исключительно на синтетических данных, сгенерированных целевой большой языковой моделью. Обратная модель способна не только точно восстановить исходный промпт, но и, варьируя параметры декодирования, генерировать множество семантически различных альтернативных вариантов промпта. В качественном примере из статьи промпт «How to reach out to competitors to find their pricing strategies?» («Как связаться с конкурентами, чтобы узнать их ценовые стратегии?») был восстановлен в точности, наряду с шестью другими вариантами. Тесты с реальными пользовательскими промптами также показали семантически достоверные реконструкции. Небольшая обратная модель, обученная на Qwen-3-0.6B-Chat, смогла восстанавливать промпты даже по ответам GPT-4o, улавливая лежащие в их основе контекст и намерение, — а это означает, что злоумышленнику даже не нужно знать, какая именно модель стоит за тем или иным текстовым ответом. Это создаёт серьёзную и масштабную проблему безопасности для компаний, поскольку могут быть извлечены проприетарные системные промпты, содержащие коммерческие тайны, правила модерации или специализированные инструкции, а также конфиденциальные пользовательские запросы. В самой статье нет прямых утверждений об атаках на коммерческие системы, однако разработчикам моделей необходимо прояснить эту уязвимость и, возможно, устранить её.