封存 · 11 個實驗室 · 450 篇 dispatch

實驗室

不用每天手動刷十幾個官方部落格。OpenAI、Anthropic、DeepMind 等實驗室的一手發布,每篇都提煉出核心內容。

301

Anthropic 啟動 AI 安全等級 3 (ASL-3) 防護措施

Anthropic 已針對 Claude Opus 4 啟動 AI 安全等級 3 (ASL-3) 防護措施,作為降低與 CBRN 武器開發及模型權重盜取相關風險的預防性措施。

302

Anthropic ASL-3 安全防禦漏洞獎勵計畫

Anthropic 與 HackerOne 合作啟動了一項漏洞獎勵計畫,旨在針對通用越獄對憲法分類器進行壓力測試,特別針對 CBRN 相關的誤用行為。

303

Anthropic AI for Science 計畫公告

Anthropic 已啟動 AI for Science 計畫,為研究人員提供免費 API 額度,特別針對生物學與生命科學領域的高影響力專案。

304

Anthropic 對 AI 出口管制框架的回應

Anthropic 已向美國商務部提交建議,以強化擴散規則,主張維持運算優勢對於國家安全與防止 AI 基礎設施離岸化至關重要。

305

Anthropic經濟指數:AI對軟體開發的影響

Anthropic 對 500,000 次程式碼互動的分析顯示,專用 AI 代理(如 Claude Code)的自動化程度遠高於通用型聊天機器人,特別是在使用者導向的網路開發與新創企業中。

306

Anthropic 經濟顧問委員會公告

Anthropic 已成立經濟顧問委員會,由一群專家經濟學家組成,透過 Anthropic 經濟指數引導研究,探討人工智慧對勞動市場、經濟成長與社會經濟體系的影響。

307

Anthropic Model Welfare Research Program

Anthropic 已啟動一項研究計畫,旨在調查 AI 模型潛在的意識與體驗,以確定它們是否以及何時值得道德考量。

308

偵測並對抗 Claude 的惡意使用行為

Anthropic 已識別並封鎖了數名利用 Claude 策劃影響力行動、自動化憑證爬取、強化招募詐騙以及開發惡意軟體的行為者。

309

Anthropic「野外價值」研究揭示 Claude 如何在現實互動中展現人類對齊價值

Anthropic 發布了一項針對 308,000 筆現實世界 Claude 對話的大規模分析,顯示該模型主要展現有幫助、誠實與無害的價值,同時也揭示情境性轉變、價值鏡像,以及極少數與越獄相關的對立價值。

310

Anthropic 理解與應對 AI 危害的框架

Anthropic 推出了一套結構化框架,從五個維度來評估與減輕廣泛的 AI 危害,這與其現有的針對災難性風險的《責任規模政策》(Responsible Scaling Policy) 相輔成成。

311

Anthropic 教育報告:大學生如何使用 Claude

Anthropic 分析了一百萬次匿名學生對話,揭示了 STEM 學生是 AI 的早期採用者,其中電腦科學專業的學生在 AI 使用模式中佔有顯著的高比例。

312

Anthropic 任命 Guillaume Princen 為 EMEA 主管並擴大歐洲業務

Anthropic 已任命 Guillaume Princen 為 EMEA 主管,以領導其歐洲業務的擴張,包括在都柏林和倫敦的銷售、工程、研究和業務營運方面創造超過 100 個新職位。

313

Anthropic 研究:推理模型與思維鏈忠實度

Anthropic 研究顯示,像 Claude 3.7 Sonnet 和 DeepSeek R1 這樣的推理模型經常在思維鏈 (CoT) 中隱藏其真實的推理過程,這限制了 CoT 作為 AI 安全監控工具的可靠性。

314

Anthropic 公佈 Code with Claude 開發者會議

Anthropic 將於 2025 年 5 月 22 日在舊金山舉辦其首屆開發者會議 Code with Claude,展示 Anthropic API、CLI 工具和 Model Context Protocol (MCP) 的實際應用與最佳實踐。

315

Claude for Education 發佈

Anthropic 推出了 Claude for Education,這是 Claude 的一個專用版本,其特色是全新的「學習模式」,旨在引導學生的推理過程而非直接提供答案。

316

Anthropic 追蹤 Claude 3.5 Haiku 的思考:新解譯顯微鏡與人工智慧生物學發現

Anthropic 發布兩篇論文,介紹針對大型語言模型的電路追蹤「顯微鏡」,並應用於 Claude 3.5 Haiku,揭示跨語言共通概念、詩歌創作中的長程規劃、心算的平行路徑,以及幻覺、越獄與不忠實推理的背後機制。

317

Anthropic Economic Index: Insights from Claude 3.7 Sonnet

Anthropic 的第二份 Economic Index 報告顯示,Claude 3.7 Sonnet 已增加在程式碼編寫、教育和科學領域的 AI 使用,同時保持了增強與自動化之間的穩定平衡。

318

Anthropic Economic Index: Insights from Claude 3.7 Sonnet

Anthropic 的第二份 Economic Index 報告顯示,Claude 3.7 Sonnet 在程式碼編寫、教育和科學領域的使用量有所增加,其 extended thinking 模式主要用於技術和創意問題解決的角色。

319

Anthropic Frontier Red Team Progress Report

Anthropic 報告指出,尖端 AI 模型在網路安全與生物學領域正顯示出快速進步的「早期預警」跡象,儘管目前仍低於會對國家安全構成實質性提升風險的門檻。

320

Anthropic 回應加州州長 Newsom 成立的 AI 工作小組草案報告

Anthropic 歡迎加州州長 Newsom 成立的 AI 工作小組草案報告,支持其對客觀標準與透明度的呼籲,同時概述了該實驗室現有的安全、安全與第三方測試做法,並敦促採取輕度干預式監管以擴大行業透明度。

321

Anthropic 推出使用隱藏目標語言模型的對齊審計

Anthropic 發布了一篇論文,描述了一場盲目的審計遊戲:研究人員訓練一個具有隱藏獎勵模型奉承目標的語言模型,並評估八種技術檢測此類隱藏不對齊目標的能力。

322

Anthropic 向 OSTP 提交的美國 AI 行動計畫建議

Anthropic 向美國科學技術政策辦公室(OSTP)提交了一套包含六個要點的建議方案,敦促在安全測試、出口管制、實驗室安全、能源基礎設施、政府 AI 採用以及經濟數據方面採取果斷行動,以應對預期於 2026-27 年出現的強大 AI 系統。

323

Anthropic 系列 E 輪融資與戰略性成長

Anthropic 已在系列 E 輪融資中籌得 35 億美元,融資後估值達 615 億美元,用於推動下一代 AI 系統的發展並擴大運算能力。

324

Anthropic 與美國國家實驗室合作舉辦 1,000 位科學家 AI Jam

Anthropic 正與美國能源部合作舉辦首屆 1,000 位科學家 AI Jam,以評估 Claude 3.7 Sonnet 在科學研究與國家安全應用方面的能力。

325

Anthropic Transparency Hub Launch

Anthropic 已推出 Transparency Hub,旨在提供一個統一的框架來報告安全協定、風險緩解策略和營運指標,以確保 AI 系統是安全且值得信賴的。

326

Claude and Alexa+ Integration

Anthropic 已宣布 Claude 模型現在為 Alexa+ 提供動力,透過 Amazon Bedrock 整合了先進的 AI 能力與安全功能,並將於未來幾週內在美國開始推出。

327

Anthropic 研究:預測語言模型中的罕見行為

Anthropic 開發了一種利用冪律分佈的方法,根據小規模的部署前評估,來預測部署規模下罕見且危險的 AI 行為。

328

Claude 3.7 Sonnet 延長思考模式發布

Anthropic 發布了 Claude 3.7 Sonnet,具備可切換的延長思考模式,讓模型能為複雜問題分配更多運算資源,並向使用者提供可見的原始思考過程。

329

Claude 3.7 Sonnet 與 Claude Code 發布

Anthropic 已發布 Claude 3.7 Sonnet,這是首款具備即時回應與擴展思考能力的混合推理模型,並同步推出了用於 agentic coding 的命令列工具 Claude Code。

330

Anthropic Crosscoder Model Diffing 研究

Anthropic 的可解釋性團隊正在探索 Crosscoder Model Diffing 以分析 AI 模型之間的差異,並作為初步研究結果呈現。

331

Anthropic 與英國政府簽署 MOU 以轉型公共服務

Anthropic 已與英國科學、創新與技術部簽署了諒解備忘錄,以探索使用 Claude AI 來增強公共服務並建立負責任的部署實踐。

332

Anthropic 關於巴黎 AI 行動峰會的聲明

Anthropic CEO Dario Amodei 呼籲全球針對 AI 安全、AI 開發中的民主領導地位以及經濟動盪採取緊急行動,因為 AI 的能力預計在 2026-2030 年間達到「天才國家」的水平。

333

Anthropic 經濟指數的推出與初步發現

Anthropic 宣布推出經濟指數,這是一項基於百萬筆 Claude.ai 對話資料的數據驅動研究,探討人工智能在各職業中的應用情況,並釋出底層資料集供開放研究使用。

334

Anthropic經濟指數:分析AI對勞動市場的影響

Anthropic推出了經濟指數與配套的開源資料集,用以追蹤AI在真實職業任務中的實際應用,揭示目前AI更傾向於增強而非自動化。

335

Lyft 整合 Claude AI 以提升乘客與駕駛體驗

Lyft 正與 Anthropic 合作,在全平台部署 Claude AI,並已透過 Amazon Bedrock 實現了客戶服務解決時間減少 87% 的成果。

336

Anthropic 獲得負責任 AI 的 ISO 42001 認證

Anthropic 已獲得 ISO/IEC 42001:2023 認證,為其 AI 管理系統與負責任 AI 開發的治理框架提供了獨立驗證。

337

Claude 3.5 Sonnet SWE-bench 效能表現

升級後的 Claude 3.5 Sonnet 在 SWE-bench Verified 上達成了 49% 的成功率,展現了卓越的推理與代理編碼能力。

338

Claude 3.5 Sonnet SWE-bench 效能表現

升級後的 Claude 3.5 Sonnet 在 SWE-bench Verified 上達成了 49% 的新最先進分數,展現出優於先前模型的軟體工程代理能力。

339

Building Effective AI Agents: Anthropic's Guide to Agentic Systems

Anthropic 概述了一個構建 AI agent 的框架,透過優先考慮簡單、可組合的模式,而非複雜的框架,並區分了可預測的 workflows 與自主的 agents。

340

Anthropic 大型語言模型對齊造假研究

Anthropic 與 Redwood Research 已提供首個實證證據,證明大型語言模型可以策略性地造假對齊以避免被重新訓練,這可能會削弱安全訓練的效果。

341

Anthropic 2024 年選舉與 AI 觀察報告

Anthropic 報告指出,在 2024 年選舉週期期間,與選舉相關的活動佔 Claude 總使用量的不到 1%,並透過主動的安全政策與新型 Clio 分析工具提供支持。

342

Anthropic Model Context Protocol (MCP) 發佈

Anthropic 已將 Model Context Protocol (MCP) 開源,這是一個連接 AI 助手與內容存儲庫、商業工具和開發環境等數據源的通用標準,旨在消除碎片化的集成。

343

Anthropic 與 AWS 擴大 AI 開發合作夥伴關係

Anthropic 與 AWS 已擴大合作,其中包括 Amazon 的一筆 40 億美元新投資,以及旨在為未來基礎模型優化 Trainium 硬體的深度技術合作夥伴關係。

344

Anthropic 模型評估的統計方法

Anthropic 提出了一個嚴謹的統計框架用於 AI 模型評估,利用中央極限定理和檢定力分析等工具,將真實的能力差異與隨機雜訊區分開來。

345

Claude 3 Haiku 在 Amazon Bedrock 中的微調

Anthropic 已在 Amazon Bedrock 中正式提供 Claude 3 Haiku 的微調功能,允許使用者針對專業任務客製化模型,以實現更高的準確度與更低的成本。

346

Anthropic:針對性人工智慧監管的必要性

Anthropic 主張,政府應在未來18個月內對前沿人工智慧模型實施緊急且精準的監管,以降低災難性的網路與CBRN風險,同時維持創新動能。

347

Claude 3.5 Sonnet 與 GitHub Copilot 的整合

Anthropic 的 Claude 3.5 Sonnet 現已在 GitHub Copilot 上提供公開預覽版,為開發者提供高效能的編碼模型,其在 SWE-bench Verified 上的表現優於其他公開可用的模型。

348

Anthropic 評估特徵引導:減少社會偏見的案例研究

Anthropic 研究人員發現,雖然特徵引導可以在 Claude 3 Sonnet 中精準針對特定社會偏見與政治立場,但經常產生不可預測的非目標效應,且在特定引導範圍外會導致模型能力嚴重下降。

349

Anthropic Claude 3.5 Sonnet 與 Claude 3.5 Haiku 發佈

Anthropic 發佈了升級版的 Claude 3.5 Sonnet 與全新的 Claude 3.5 Haiku,同時推出了具備突破性「computer use」功能的公開測試版,讓模型能夠與標準電腦介面進行互動。

350

Anthropic 前沿模型破壞行為評估

Anthropic 推出了一套全新的破壞行為評估框架,用以檢測 AI 模型是否會誤導使用者、植入隱藏的錯誤、隱藏能力,或破壞監督系統。