Google DeepMind Aeneas: 古代碑文の文脈化のためのAI

Google DeepMindは、歴史家が断片的なラテン碑文を解釈・属性付け・復元するのを支援するために設計された、マルチモーダル生成ニューラルネットワークであるAeneasを発表しました。テキストおよび文脈的な類似点の自動識別により、Aeneasは風化や損傷が多い古代テキストの年代測定と配置のプロセスを加速します。

碑文分析のための高度な機能

Aeneasは、前モデルであるIthaca(古代ギリシャ碑文に焦点を当てた)を含む、いくつかの重要な技術的進歩を提供します。その主な機能は以下の通りです:

  • Parallels Search: モデルは各テキストに対して「歴史的指紋」(埋め込み)を作成し、膨大なラテン碑文コレクション全体で深い結びつきを特定します。これにより、歴史家は断片をより広い文脈に位置付けることができます。
  • Multimodal Provenance Determination: Aeneasは、テキストデータと碑文の画像などの視覚情報の両方を分析して地理的出所を判定する初のモデルです。
  • Flexible Text Restoration: 欠損部分の長さが不明なテキストでも復元でき、重度に損傷した資料の処理において大きな改善となります。
  • State-of-the-Art Performance: Aeneasは、碑文の年代・場所予測および損傷テキストの復元において新たなベンチマークを設定します。

技術アーキテクチャとトレーニング

Aeneasは、テキストと画像入力をトランスフォーマーベースのデコーダで処理するマルチモーダル生成ニューラルネットワークです。

データソースとLatin Epigraphic Dataset (LED)

モデルの訓練のために、研究者はLatin Epigraphic Dataset (LED) を作成しました。これは、3つの主要なデジタルコレクションから176,000件以上のラテン碑文を統合したものです。

  1. The Epigraphic Database Roma (EDR)
  2. The Epigraphic Database Heidelberg (EDH)
  3. The Epigraphic Database Clauss Slaby (EDCS-ELT)

モデルメカニズム

モデルはテキストに基づく文字復元と年代測定のための専門ネットワークを利用し、地理的属性付けには画像データを組み込みます。文脈化メカニズムは埋め込みを用いて言語、内容、出所、碑文間の関係をエンコードし、デコーダがLEDから類似のパラレルを取得・順位付けできるようにします。

パフォーマンスベンチマークと検証

Aeneasは、汎用ラテンLLMと比較して年代別のグルーピングにおいて優れた性能を示します。主な指標は以下の通りです:

  • Restoration Accuracy: 10文字までの欠損に対してTop-20精度73%、復元長が不明な場合は58%の精度を達成しています。
  • Geographical Attribution: 視覚データを用いて62の古代ローマ州のいずれかに碑文を属性付けする精度は72%です。
  • Dating Precision: モデルは通常、歴史家が提示した年代範囲から13年以内にテキストを配置します。
  • Interpretability: モデルはサリエンシーマップを提供し、予測に影響を与えた具体的な入力をハイライトします。

歴史的議論への応用:Res Gestae

実際の研究議論でモデルをテストするため、AeneasはRes Gestae Divi Augusti(皇帝アウグストゥスの業績記録)に適用されました。単一の日付を提示する代わりに、Aeneasは二つのピークを持つ確率分布を生成しました:小さなピークは紀元前10〜1年、 大きなピークは紀元後10〜20年です。この定量的アプローチは、テキスト中の微妙な言語的特徴や公式称号に基づく学術的仮説を捉えました。

協働的インパクトとアクセシビリティ

23人の歴史家を対象とした研究では、専門家がAeneasの文脈的パラレルと復元・属性予測を併用したときに最も効果的な結果が得られました。歴史家は、このツールが作業を加速し、特定の碑文に対する認識を変える新たなパラレルを特定するのに役立ったと報告しています。

利用可能性と教育統合

Google DeepMindは、以下のチャネルを通じてAeneasを提供しています:

  • Interactive Tool: 無料でpredictingthepast.comから利用可能です。
  • Open Source: コードとデータセットはGitHubで入手可能です。
  • Ithaca Upgrade: 古代ギリシャ語モデルのIthacaはAeneasにより強化され、文脈化機能と復元能力が向上しました。
  • Education: 技術的AIスキルと歴史的思考を橋渡しする新しい教育シラバスが共同設計され、欧州委員会、UNESCO、OECDのフレームワークに合わせています。

Sources