Engenharia de Contexto: O Que É, Como Trabalhar com o Contexto de Agentes LLM e Por Que Você é Pago por Isso
Anthropic
OpenAI
Google/DeepMind
Alibaba/Qwen
LangChain
A engenharia de contexto é um conjunto de técnicas para coletar e manter o contexto ideal ao trabalhar com LLMs. Ela difere da engenharia de prompt (que lida apenas com instruções) e complementa o RAG (entrega de conhecimento) e o MCP (integração de ferramentas). O artigo detalha as camadas do contexto de um agente, quatro cenários típicos de falha (envenenamento, distração, confusão, conflito) e uma abordagem de gerenciamento de contexto por meio de escrever, selecionar, comprimir, isolar.
Engenharia de contexto é um conjunto de estratégias para coletar e manter o contexto ideal durante a inferência de LLMs, sendo o contexto ideal o conjunto mínimo de tokens úteis. Diferencia-se da engenharia de prompt, que lida apenas com instruções, enquanto a engenharia de contexto gerencia tudo que o modelo recebe junto com a instrução: histórico, documentos, ferramentas, memória e estado. RAG (Geração Aumentada por Recuperação) traz conhecimento externo, MCP (Protocolo de Contexto de Modelo) padroniza conexões com dados e ferramentas, e a engenharia de contexto decide como montar tudo isso para o próximo passo do agente. O contexto de um agente consiste em várias camadas: consulta do usuário, prompt do sistema, ferramentas, exemplos few-shot, dados do RAG, histórico de mensagens e chamadas de ferramentas, memória e estado atual (rascunho). Embora LLMs modernos tenham grandes janelas de contexto, o relatório da Chroma 'Context Rot' mostrou que, à medida que o contexto usado cresce, a qualidade pode degradar até em tarefas simples. Drew Breunig identificou quatro cenários típicos de falha de contexto: envenenamento de contexto (um erro entra e se repete), distração de contexto (informações necessárias se perdem entre dados irrelevantes), confusão de contexto (o modelo se confunde entre ferramentas/documentos similares) e choque de contexto (dados conflitantes sem regras de prioridade). A LangChain propõe quatro ações para gerenciar o contexto: escrever (salvar informações importantes no estado externo), selecionar (escolher conteúdo relevante), comprimir (comprimir) e isolar (mover para um contexto separado).
Fonte: Habr — хаб NLP —
original
