deusyu/translate-book

Agent skill for Codex, Claude Code, and OpenClaw that translates entire books (PDF/DOCX/EPUB) into any language using parallel subagents.

何を解決するか

LLMを使用して本全体(PDF、DOCX、EPUB)を翻訳すると、コンテキストウィンドウのオーバーフロー、出力の切り詰め、用語の不整合(同じ名前が異なる章で異なるように翻訳される)が発生しやすいです。このプロジェクトは、言語的一貫性と構造的整合性を維持しながら、大規模なドキュメントを並列で翻訳する自動化パイプラインを提供します。

動作方法

このシステムは、Codex、Claude Code、OpenClawなどのランタイム向けのエージェントスキルとして動作します。以下のマルチステップパイプラインに従います:

  1. 変換:CalibreとPandocを使用して、入力された本をMarkdownチャンク(約6,000文字ずつ)に変換します。
  2. 用語集生成:本から固有名詞や繰り返し出現する語をサンプリングし、すべてのチャンクで一貫した翻訳を保証する標準用語集を作成します。
  3. 並列翻訳:デフォルトで8つのサブエージェントを展開して、チャンクを同時に翻訳します。各サブエージェントは関連する用語集と隣接チャンクの短い抜粋を受け取り、代名詞やエンティティの解決を行います。
  4. 検証:マニフェストファイルを介してSHA-256ハッシュを使用し、すべての元のチャンクに対応する空でない翻訳が存在することを検証します。
  5. 再構成:翻訳されたチャンクを統合し、PandocとCalibreを使用して最終結果をHTML、DOCX、EPUB、PDF形式にエクスポートします。

対象ユーザー

  • フォーマットを保持しながら長文ドキュメントや電子書籍を翻訳したいユーザー。
  • AIエージェントフレームワーク(Codex、Claude Code、OpenClaw)を使用している開発者で、ワークフローに高容量翻訳機能を追加したい人。

特徴

  • 並列処理:コンテキストの蓄積を防ぎ、翻訳を高速化するため、独立したサブエージェントを使用します。
  • 一貫性ツール:用語集システムと隣接コンテキストの抜粋を実装し、用語のずれや代名詞の誤りを防止します。
  • 再開可能なワークフローrun_state.json を介して状態を追跡し、中断された実行を再開できるほか、用語集の変更に影響を受けたチャンクのみを再翻訳できます。
  • 多形式対応:PDF、EPUB、DOCXなど、幅広い入出力形式を扱います。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト