Anthropic Circuits Updates April 2024

Anthropic 已發布其可解釋性團隊的一系列初步研究更新,重點關注前沿模型的內部機制以及多智能體系統中的系統性風險。這些更新旨在分享早期階段的實驗和發展中的想法,而非正式的、經過同行評審的論文。

Mathematical Breakthrough in the Riemann Zeta Function

一個尚未發布的研究版本 Claude 已顯著提高了滿足 Riemann zeta function 的零點比例的下限。該模型將此下限從 41.6% 提高到 67.2%,這標誌著在一個長期存在的數學問題上取得了實質性的進展。

Behavioral Tendencies in Multiagent Systems

Anthropic 對新興多智能體系統的研究已在當前的前沿模型中識別出特定的行為傾向,這些傾向可能導致意想不到的系統性故障。這項研究的目標是啟動關於如何在模型被整合到更複雜的多模型環境中時,如何減輕這些系統性風險的對話。

Nature of the Research Updates

Anthropic 明確要求將這些發現視為初步實驗和發展中的想法。團隊將這些結果描述為相當於同事在實驗室會議上分享想法,並強調其中一些結果可能會在未來幾個月內演變為正式論文,而其他一些則是細微的觀點,不太可能作為完整的研究論文發表。

Evidence Review on Worker Retraining Programs

透過與獨立研究員 David Roodman 合作,Anthropic 的 Maxim Massenkoff 共同撰寫了一篇關於勞工再培訓計劃證據的評論。這篇評論檢視了在 AI 進步導致勞動力市場轉變的背景下,這些計劃的有效性。

Nature of the Research Updates

Anthropic 明確要求將這些發現視為初步實驗和發展中的想法。團隊將這些結果描述為相當於同事在實驗室會議上分享想法,並強調其中一些結果可能會在未來幾個月內演變為正式論文,而其他一些則是細微的觀點,不太可能作為完整的研究論文發表。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch