Claude 2 リリースノート

Anthropicは、推論、コーディング、および安全性において大幅な改善を実現し、コンテキストウィンドウを大幅に拡張した新しいモデル、Claude 2のリリースを発表しました。このアップデートにより、モデルは数百ページの技術文書を処理し、単一の出力でより長い文書を生成することが可能になります。

拡張されたコンテキストと出力機能

Claude 2は、1プロンプトあたり最大100Kトークンの入力容量をサポートしています。この拡張されたコンテキストウィンドウにより、モデルは単一のやり取りの中で、本一冊全体や包括的な技術文書などの広範なデータセットを分析することが可能になります。さらに、モデルは、物語、手紙、メモなど、数千トークンに及ぶより長い出力を生成できるようになりました。

パフォーマンス・ベンチマークと技術的改善

Claude 2は、前身であるClaude 1.3と比較して、推論、数学、およびコーディングにおいて測定可能な改善を示しています。

  • Legal Reasoning: Claude 2は、Bar examの選択肢問題セクションで76.5%を記録し、73.0%から上昇しました。
  • Coding: Codex HumanEval Pythonコーディングテストにおいて、Claude 2は56.0%から71.2%に上昇しました。
  • Mathematics: GSM8k小学校数学問題セットにおいて、モデルは85.2%であったClaude 1.3と比較して、88.0%を記録しました。
  • Academic Testing: Claude 2は、大学院志願者と比較した場合、GRE reading and writing試験において上位90パーセンタイル以上のスコアを獲得し、計量的な推論においては中央値の志願者と同等のパフォーマンスを発揮します。

安全性と無害性

Anthropicは、Claude 2を攻撃的または危険な出力に対してより耐性を持たせるため、反復的な安全性改善を実施しました。自動テストと、有害なプロンプトの代表的なセットに対する手動チェックを用いた内部レッドチーミング評価に基づくと、Claude 2はClaude 1.3よりも無害な回答を提供する能力が2倍向上しています。これらの改善は、広範なレッドチーミングと、ジェイルブレイクの可能性を低減するために設計された特定の安全性技術の結果です。

利用可能性と統合

Claude 2は、企業向けにClaude 1.3と同じ価格帯でAPI経由で利用可能です。また、claude.aiにおける公開ベータ版チャット体験を支えており、米国と英国のユーザーが利用可能です。

Enterprise Partnerships

2つの主要なパートナーが、すでにClaude 2を自社のプラットフォームに統合しています。

  • Jasper: この生成AIプラットフォームは、長文かつ低レイテンシのユースケースにClaude 2を利用しており、3倍に拡大されたコンテキストウィンドウを活用して既存のコンテンツをリミックスし、複雑なプロンプトに対する推論を向上させています。
  • Sourcegraph: コーディングアシスタントのCodyは、100Kコンテキストウィンドウを通じてより多くのコードベースのコンテキストを渡すことで、より正確な回答を提供するためにClaude 2を利用しています。Codyはまた、Claude 2のより新しいデータによるトレーニングの恩恵を受けており、新しいフレームワークやライブラリに関する知識を提供します。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch