The Anthropic Institute 研究計畫

The Anthropic Institute (TAI) 是一個研究計畫,旨在透過內部對模型開發與部署資料的存取,探討前沿人工智慧系統對社會、經濟與安全的影響。TAI 的目標是發表這些研究成果,協助政府、外部組織與公眾在人工智慧發展方面做出明智決策。

核心研究支柱

TAI 的研究計畫分為四個主要領域,每個領域皆針對強大人工智慧部署所帶來的特定風險與機會。

經濟擴散

此支柱關注人工智慧部署如何改變全球經濟,以及如何確保這些改變能造福大眾。TAI 將利用並擴展 Anthropic 經濟指數,提供高頻率、細緻的勞動力影響與人工智慧使用資料。

關鍵研究議題包括:

  • 人工智慧採用:探討全球人工智慧可及性的決定因素、企業如何採用此技術,以及人工智慧是否遵循過去「通用技術」的模式。
  • 生產力與成長:分析人工智慧對創新速率的影響,並探索事前或再分配機制,以擴散經濟利益。
  • 勞動市場影響:研究人工智慧如何自動化既有任務、新工作如何出現,以及當人工智慧吸收原本用於培訓專家的初階任務時,專業人才培育管道會受到何種影響。
  • 工作場所的演變:研究若人工智慧大幅降低工作在人類生活中的核心地位,人類社會應如何應對此轉變。

威脅與韌性

TAI 的研究聚焦於人工智慧的「雙重用途」特性,即能提升健康或教育的能力,同時也可能被用於監控或生物武器。目標是發展早期警報系統,並提升社會韌性。

關鍵研究議題包括:

  • 風險評估:建立可見性工具,以偵測人工智慧被用於壓迫的行為,並發展市場導向的方法,為可預測的威脅(如人工智慧增強的網路攻擊)定價風險。
  • 攻防平衡:分析人工智慧是否在網路與生物領域,或指揮與控制系統中,結構性地有利於攻擊方。
  • 危機緩解:規劃涉及人工智慧系統的危機情境下,企業與國家之間或企業與企業之間的地理政治基礎設施。
  • 防禦機制:探討如何縮小人工智慧快速進步(以月為單位)與監管與基礎設施回應較慢(以年為單位)之間的差距。

人工智慧系統在現實世界中的應用

此領域探討人類、組織與人工智慧系統之間的互動,聚焦於這些互動如何改變人類行為與制度結構。

關鍵研究議題包括:

  • 個人與社會影響:研究「群體知識論」(共享人工智慧使用如何影響信念與問題解決方式),以及因過度依賴人工智慧判斷而導致的人類批判性思考能力退化。
  • 人機管理:研究人類如何管理由人類與人工智慧組成的團隊,反之亦然。
  • 治理與可靠性:將現有法律(如關於棄船的海事法)適應於自主人工智慧代理,並確保代理具有獨特且可靠的身分。
  • 模型價值:衡量人工智慧「憲法」對已部署模型行為的影響。

人工智慧驅動的研發

TAI 正在研究「人工智慧驅動的人工智慧研發」,即使用人工智慧系統來開發自身後繼版本,可能導致遞歸自我改進。

關鍵研究議題包括:

  • 人工智慧研發治理:確定人類如何在人工智慧自主改進的情況下,維持對其的可見性與控制。
  • 加速控制:識別可干預的節點,以減緩或改變「智慧爆炸」的速率,並決定應由何種實體(政府或企業)掌握此權力。
  • 遠端監測:開發指標,以衡量人工智慧研發的整體速度,作為遞歸自我改進的早期警報信號。
  • 一般科學研究:分析人工智慧驅動研究的「技術樹」,觀察哪些科學領域加速最快,並解決藥物發現在等領域的社會外部性問題。

與 Anthropic 運營的整合

The Anthropic Institute 的研究成果將直接影響 Anthropic 的企業決策,包括資料分享(如經濟指數)與技術發布方式(如 Project Glasswing 的網路威脅分析)。

此外,TAI 的工作亦作為 長期利益信託(LTBT) 的輸入,該信託負責確保 Anthropic 的行動能最優化人類的長期利益。為支持此研究,Anthropic 提供四個月資助的 Anthropic 研究員計畫,讓研究人員在 TAI 的指導下,專注於這些特定議題。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch