Hacking de LLM: Pesquisadores Conseguem Reconstruir Prompts de Usuários a partir de Respostas de Chatbots
Alibaba/Qwen
OpenAI
Pesquisadores do IIT Bombay e da Adobe Research desenvolveram um método para reconstruir os prompts originais de grandes modelos de linguagem a partir de suas saídas de texto com alta precisão. A abordagem não requer acesso aos pesos do modelo e funciona até mesmo em modelos de outros fornecedores. Isso representa um risco de segurança potencial para empresas que usam prompts de sistema proprietários.
Pesquisadores do IIT Bombay e da Adobe Research desenvolveram um método que pode reconstruir quase exatamente os prompts de entrada de grandes modelos de linguagem a partir de suas saídas de texto, funcionando sem acesso aos pesos do modelo e até mesmo transferindo para outros modelos. O método, chamado 'Predição de Token Anterior' (PTP), inverte o princípio básico dos modelos de linguagem ao treinar um modelo inverso para prever tokens anteriores em vez do próximo token. Este modelo inverso é treinado do zero usando exclusivamente dados sintéticos gerados pelo LLM alvo. O modelo inverso não só pode restaurar o prompt original exatamente, mas também gerar múltiplas alternativas de prompt semanticamente diferentes ao variar os parâmetros de decodificação. Em um exemplo qualitativo do artigo, o prompt 'Como entrar em contato com concorrentes para descobrir suas estratégias de preços?' foi reconstruído exatamente, juntamente com seis outras variantes. Testes com prompts reais de usuários também mostraram reconstruções semanticamente fiéis. Um pequeno modelo inverso treinado no Qwen-3-0.6B-Chat também conseguiu reconstruir prompts de respostas do GPT-4o, capturando o contexto e a intenção subjacentes, o que significa que um atacante não precisaria nem saber qual modelo está por trás de uma saída de texto. Isso apresenta um amplo problema de segurança para empresas, pois prompts de sistema proprietários com segredos de negócios, regras de moderação ou instruções especializadas poderiam ser extraídos, assim como entradas confidenciais de usuários. O artigo em si não faz declarações explícitas sobre ataques a sistemas comerciais, mas os fabricantes de modelos precisam esclarecer e potencialmente remediar essa vulnerabilidade.
Fonte: The Decoder (DE) —
original
