Ein ganzes Buch übersetzen: So habe ich eine LLM-gestützte Pipeline gebaut
Anthropic
OpenAI
Google/DeepMind
Ein Entwickler hat BookTrans entwickelt, eine Open-Source-Pipeline, die ganze Bücher mithilfe kostenpflichtiger LLM-Abonnements übersetzt und Claude Code, Antigravity CLI und Codex unterstützt. Die Pipeline gewährleistet Übersetzungsqualität durch einen mehrstufigen Prozess: Erkundung, sequenzielle Übersetzung und blindes Lektorat, mit automatisierten Integritätsprüfungen und Sicherheitsmaßnahmen gegen Prompt-Injection.
Der Autor wurde durch das Fehlen russischer Übersetzungen für zwei Science-Fiction-Bücher motiviert, 'Usurpation' von Sue Burke und 'Singularity's Ring' von Paul Melko. Aufbauend auf der Idee, anderen zu helfen, verbrachte er ein paar Wochen damit, BookTrans zu entwickeln, eine Open-Source-Pipeline, die Bücher mithilfe kostenpflichtiger LLM-Abonnements übersetzt. Die Pipeline unterstützt Claude Code, Antigravity CLI und Codex und verwendet zwei Modelle pro Agent: das stärkste für intellektuelle Arbeit und das nächststärkste für technische Aufgaben. Vor der Übersetzung führt sie kostengünstige Prüfungen wie Spracherkennung und Kodierung durch und verwendet ein günstiges Modell, um Tags und Stile den Inhaltstypen zuzuordnen. Der Übersetzungsprozess hat drei Hauptphasen: Aufklärung (das Modell scannt das Buch, um ein Glossar und eine Weltreferenz zu erstellen), sequenzielle Übersetzung (Kapitel werden der Reihe nach mit Kontext aus früheren Kapiteln übersetzt) und blindes Lektorat (ein Editor-Modell überprüft die Übersetzung, ohne das Original zu sehen, und konzentriert sich auf natürliches Russisch). Die Pipeline behandelt auch Gedichte, erkennt Zitate und verwendet Fußnoten für Fehler und obskure Begriffe. Sie teilt Kapitel in Fragmente von 2000-3000 Wörtern auf, und jeder Absatz erhält eine stabile Nummer, um fehlende oder erfundene Absätze zu überprüfen. Automatisierte Prüfungen verifizieren die Absatzintegrität, Glossarbegriffe, Zahlen und Struktur. Sicherheit hat Priorität: Der Buchtext wird als nicht vertrauenswürdige Daten behandelt, und die Pipeline stoppt, wenn sie Prompt-Injection-Versuche findet. Agenten werden mit deaktivierten Tools, Sandboxes und eingeschränktem Dateisystemzugriff ausgeführt. Websuche ist deaktiviert, um Datenlecks zu verhindern. Der Autor verglich auch russische und englische Prompts und stellte keinen signifikanten Qualitätsunterschied fest, also schrieb er die Prompts auf Russisch.
Quelle: Habr — хаб ИИ —
Original
