Traduire un livre entier : comment j'ai construit un pipeline propulsé par les LLM
Anthropic
OpenAI
Google/DeepMind
Un développeur a créé BookTrans, un pipeline open source qui traduit des livres entiers en utilisant des abonnements payants aux LLM, prenant en charge Claude Code, Antigravity CLI et Codex. Le pipeline garantit la qualité de la traduction grâce à un processus en plusieurs étapes : reconnaissance, traduction séquentielle et révision en aveugle, avec des contrôles d'intégrité automatisés et des mesures de sécurité contre l'injection de prompts.
L'auteur a été motivé par le manque de traductions russes pour deux livres de science-fiction, « Usurpation » de Sue Burke et « L'Anneau de Singularité » de Paul Melko. S'appuyant sur l'idée d'aider les autres, il a passé quelques semaines à développer BookTrans, un pipeline open-source qui traduit des livres à l'aide d'abonnements payants à des LLM. Le pipeline prend en charge Claude Code, Antigravity CLI et Codex, et utilise deux modèles par agent : le plus puissant pour le travail intellectuel et le suivant pour les tâches techniques. Avant la traduction, il effectue des vérifications peu coûteuses comme la détection de la langue et l'encodage, et utilise un modèle bon marché pour mapper les balises et les styles aux types de contenu. Le processus de traduction comporte trois étapes principales : la reconnaissance (le modèle scanne le livre pour créer un glossaire et une référence du monde), la traduction séquentielle (les chapitres sont traduits dans l'ordre avec le contexte des chapitres précédents), et la révision à l'aveugle (un modèle éditeur examine la traduction sans voir l'original, en se concentrant sur un russe naturel). Le pipeline gère également les poèmes, reconnaît les citations et utilise des notes de bas de page pour les erreurs et les termes obscurs. Il divise les chapitres en fragments de 2000 à 3000 mots, et chaque paragraphe reçoit un numéro stable pour vérifier les paragraphes manquants ou inventés. Des vérifications automatisées valident l'intégrité des paragraphes, les termes du glossaire, les chiffres et la structure. La sécurité est une priorité : le texte du livre est traité comme des données non fiables, et le pipeline s'arrête s'il détecte des tentatives d'injection de prompt. Les agents sont exécutés avec des outils désactivés, des sandbox et un accès limité au système de fichiers. La recherche web est désactivée pour éviter les fuites de données. L'auteur a également comparé les prompts en russe et en anglais et n'a trouvé aucune différence de qualité significative, il a donc écrit les prompts en russe.
Source: Habr — хаб ИИ —
original
