Código Aberto 🇷🇺 13.08.2026 16:02

Traduzindo um Livro Inteiro: Como Construí um Pipeline com LLM

AnthropicAnthropic OpenAIOpenAI Google/DeepMindGoogle/DeepMind
Um desenvolvedor criou o BookTrans, um pipeline de código aberto que traduz livros inteiros usando assinaturas pagas de LLM, com suporte para Claude Code, Antigravity CLI e Codex. O pipeline garante a qualidade da tradução por meio de um processo de várias etapas: reconhecimento, tradução sequencial e edição cega, com verificações automatizadas de integridade e medidas de segurança contra injeção de prompts.
O autor foi motivado pela falta de traduções para o russo de dois livros de ficção científica, 'Usurpation' de Sue Burke e 'Singularity's Ring' de Paul Melko. Com base na ideia de ajudar os outros, eles passaram algumas semanas desenvolvendo o BookTrans, um pipeline de código aberto que traduz livros usando assinaturas pagas de LLM. O pipeline suporta Claude Code, Antigravity CLI e Codex, e usa dois modelos por agente: o mais forte para trabalho intelectual e o segundo mais forte para tarefas técnicas. Antes da tradução, ele realiza verificações baratas, como detecção de idioma e codificação, e usa um modelo barato para mapear tags e estilos para tipos de conteúdo. O processo de tradução tem três estágios principais: reconhecimento (o modelo escaneia o livro para criar um glossário e referência de mundo), tradução sequencial (os capítulos são traduzidos em ordem, com contexto dos capítulos anteriores) e edição cega (um modelo editor revisa a tradução sem ver o original, focando no russo natural). O pipeline também lida com poemas, reconhece citações e usa notas de rodapé para erros e termos obscuros. Ele divide os capítulos em fragmentos de 2000 a 3000 palavras, e cada parágrafo recebe um número estável para verificar se há parágrafos faltando ou inventados. Verificações automatizadas confirmam a integridade dos parágrafos, termos do glossário, números e estrutura. A segurança é uma prioridade: o texto do livro é tratado como dados não confiáveis, e o pipeline para se encontrar tentativas de injeção de prompt. Os agentes são executados com ferramentas desabilitadas, sandboxes e acesso limitado ao sistema de arquivos. A busca na web é desabilitada para evitar vazamento de dados. O autor também comparou prompts em russo e inglês e não encontrou diferença significativa de qualidade, então escreveu os prompts em russo.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas