AIの安全性と研究のためのAnthropicシリーズB資金調達

Anthropicは、計算負荷の高いAIモデルの安全性特性を向上させるための大規模な実験用インフラストラクチャを開発するために、シリーズBで5億8000万ドルを調達しました。この資金調達により、同社は、より制御可能で、堅牢で、解釈可能なシステムを構築しながら、能力と安全性の問題が大規模にどのように発生するかを探求することが可能になります。

Core Research Objectives

Anthropicの研究は、トレーニング後の介入を必要としない、より優れた暗黙的なセーフガードを備えた大規模モデルの作成に焦点を当てています。同社は、これらのモデルの内部動作を検査して、安全性のセーフガードが意図した通りに機能していることを検証するためのツールを開発することを目指しています。

Interpretability

Anthropicは、小規模な言語モデルの挙動を数学的にリバースエンジニアリングすること、および大規模言語モデルにおけるパターンマッチング挙動のソースを研究することに取り組んできました。

Steerability and Robustness

モデルをより「helpful and harmless(役に立ち、かつ無害)」にするために、Anthropicはベースライン技術を開発し、強化学習を利用してこれらの特性を強化してきました。同社はまた、他の研究室が人間の好みに沿ったモデルをトレーニングするのを支援するためのデータセットを公開しました。

Scaling and Safety

Anthropicは、大規模言語モデルにおける性能の突然の変化に関する分析を公開しており、安全性の問題を大規模に研究する必要性を強調しています。CEOのDario Amodeiは、同社がこの資金を、機械学習システムの予測可能なスケーリング特性を探求し、モデルの成長に伴って安全性の問題が予測不能な形でどのように発生するかを調査するために使用すると述べています。

Organizational Growth and Governance

Anthropicは、サンフランシスコの約40人のチームを拡大しており、成長段階において安全なAIシステムの責任ある開発を確実にするための文化とガバナンス構造の確立に焦点を当てています。

Funding Details

2021年の1億2400万ドルのシリーズAラウンドに続き、今回のシリーズBラウンドはSam Bankman-Fried (CEO of FTX) が主導し、Caroline Ellison、Jim McClave、Nishad Singh、Jaan Tallinn、およびCenter for Emerging Risk Research (CERR) が参加しました。

Sources

関連