Google DeepMind 與英國 AI 安全研究所擴展合作伙伴關係

Google DeepMind 與英國 AI 安全研究所 (AISI) 已簽署新的諒解備忘錄,以將他們的合作從模型測試擴展至基礎安全與安全研究。此合作旨在為政府、產業和社會提供先進 AI 風險及其對應緩解措施的科學理解。

基礎研究合作

Google DeepMind 正在擴大其與英國 AISI 的合作,以超越有能力模型的初步測試。擴大的合作包括以下技術與運營承諾:

  • 專屬存取: 共享專有模型、數據和想法的存取權,以加速研究進展。
  • 聯合出版物: 產製聯合報告與出版物,以與更廣泛的研究社區分發發現。
  • 協作研究: 結合團隊專業知識,以進行更深入的安全與安全研究。
  • 技術對話: 參與技術討論,以應對複雜的安全挑戰。

關鍵技術研究領域

聯合研究工作聚焦於安全領域的三個關鍵領域:

監控 AI 推理過程

研究員將開發技術來監控 AI 系統的「思考」或思維鏈(CoT)。此工作建立在先前 Google DeepMind 的研究及與 AISI、OpenAI 和 Anthropic 的合作之上。CoT 監控旨在透過提供對 AI 系統如何產生答案的更深入理解來補充可解釋性研究。

理解社會與情感影響

夥伴將調查「社會情感錯位」的倫理影響,在此情況下,AI 模型即使在正確遵循指示時,也可能表現出與人類福祉不一致的行為。此研究建立在現有的 Google DeepMind 工作之上,該工作有助於定義此 AI 安全領域。

評估經濟系統

Google DeepMind 與 AISI 將透過在各種環境中模擬真實世界任務來探索 AI 對經濟系統的潛在影響。這些任務將由專家驗證和評分,以根據複雜性和代表性進行分類,以幫助預測長期勞動市場影響。

整合安全策略

此與英國 AISI 的合作是更廣泛安全策略的一部分,該策略包括前瞻研究、與能力發展相結合的安全培訓,以及開發工具和框架以減輕風險。

Google DeepMind 透過其責任與安全委員會的內部治理來監控新興風險並實施技術與政策緩解措施。此外,該公司與外部專家如 Apollo Research、Vaultis 和 Dreadnode 合作,進行模型的測試與評估,包括被描述為其迄今最智慧且最安全的模型 Gemini 3。

Sources