wxyhgk/retain-pdf
在保留版面、公式与结构的前提下进行 PDF 翻译,适用于科研与技术文档
何を解決するか
RetainPDF は、元のレイアウトを厳密に保持するように設計された翻訳ツールです。スキャンされた画像ベースのPDFの扱い、複雑なインライン数式のレンダリング、コードブロックの誤翻訳を防ぐなど、PDF翻訳における一般的な失敗を特に解決します。
動作方法
このプロジェクトは、フロントエンド、バックエンド、処理パイプラインを分離したフルスタックアーキテクチャを使用しています。スキャンされたドキュメントの正規化にはOCRを統合し、翻訳エンジンとレンダリングシステムを組み合わせて、翻訳されたテキストを元のレイアウトに再挿入します。バックエンドはタスクとプロバイダーを管理するRust APIで構成され、PythonパイプラインがOCR、翻訳、PDF処理の重い処理を担当します。
対象ユーザー
学術論文(SCI論文など)、技術書、スキャンされたドキュメントを翻訳する必要がある研究者、学生、専門家に最適です。元のファイルの構造的整合性や数式表記を損なうことなく翻訳できます。
主な特徴
- 包括的なPDF対応: デジタルPDFとスキャン/画像ベースのPDFの両方を対応。
- レイアウトの保持: 元のフォーマット、フォントサイズ、全体的な構造を維持する重点を置く。
- 技術的正確性: インライン数式やコードブロックが翻訳中に破損しないように特に最適化。
- 柔軟なデプロイ: デスクトップアプリ(Windows、macOS、Linux)またはDockerによるチーム/LAN環境でのデプロイに対応。
- カスタマイズ可能: 翻訳戦略やルールベースの設定をカスタマイズ可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト