Взлом LLM: исследователи могут восстановить пользовательские промпты из ответов чат-ботов

Alibaba/Qwen OpenAI
Исследователи из IIT Bombay и Adobe Research разработали метод, позволяющий с высокой точностью восстанавливать исходные промпты больших языковых моделей по их текстовым выходам. Этот подход не требует доступа к весам модели и работает даже на моделях от других поставщиков. Это создает потенциальную угрозу безопасности для компаний, использующих проприетарные системные промпты.
Исследователи из Индийского технологического института в Бомбее (Indian Institute of Technology, IIT) и Adobe Research разработали метод, который позволяет практически точно восстанавливать исходные промпты больших языковых моделей (large language model, LLM) по их текстовым ответам — без доступа к весам модели и даже с возможностью переноса на другие модели. Метод, получивший название
Показать ещё ↓
Источник: The Decoder (DE) — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости