封存 · 11 個實驗室 · 450 篇 dispatch

實驗室

不用每天手動刷十幾個官方部落格。OpenAI、Anthropic、DeepMind 等實驗室的一手發布,每篇都提煉出核心內容。

401

集體憲法 AI:透過公眾輸入進行語言模型對齊

Anthropic 與 Collective Intelligence Project 開發了一種方法,使用由大約 1,000 名美國公眾成員起草的憲法來對齊語言模型,其結果是產生了一個比使用內部企業憲法對齊的模型具有更低社會偏見的模型。

402

Anthropic 研究:使用字典學習分解語言模型

Anthropic 研究人員開發了一種使用字典學習的方法,將語言模型層分解為單義性特徵,從而能夠解釋在個別神經元層級上原本無法被看見的複雜神經網路活化。

403

Anthropic 將語言模型分解為可理解的組件

Anthropic 研究人員開發了一種使用字典學習的方法,將神經網路活化分解為可解釋的特徵,從而超越了不可解釋的單個神經元的限制。

404

Anthropic:評估人工智慧系統的挑戰

Anthropic 指出建立穩健 AI 評估所面臨的技術與運營困難,主張有效的 AI 治理取決於克服這些測量挑戰。

405

Anthropic 公佈獲得 Amazon 40 億美元投資並透過 AWS Bedrock 擴大 Claude 2 的使用權限

Anthropic 公佈了來自 Amazon 的高達 40 億美元的投資,使 AWS 成為其模型的主要雲端,並擴大 Claude 2 在 Amazon Bedrock 上的可用性,為企業帶來更安全、高效能的 AI。

406

Anthropic Claude 100k Token 上下文視窗提示工程指南

Anthropic 發布了一項定量研究,顯示提取參考引用內容並提供多個上下文中的範例,能顯著提升 Claude 在 70k–95k token 文件中的召回能力。

407

Anthropic 負責任擴展政策

Anthropic 推出負責任擴展政策(RSP),透過 AI 安全等級(ASL)機制,要求隨著 AI 模型能力與災難性風險提升,實施更嚴格的安全與保障協議。

408

Anthropic 與 BCG 合作推動企業級 AI 部署

Anthropic 已與 Boston Consulting Group (BCG) 合作,將 Claude AI 整合至企業策略性產品中,專注於部署安全且負責任的生成式 AI 解決方案。

409

Claude Pro 發佈說明

Anthropic 推出了 Claude Pro,這是 Claude.ai 的付費訂閱方案,每月提供 5 倍的 Claude 2 模型使用量、優先存取權以及搶先體驗新功能的權限,費用為每月 $20 (US) 或 £18 (UK)。

410

Anthropic 與 SK Telecom 合作夥伴關係公告

Anthropic 與 SK Telecom (SKT) 已建立商業合作夥伴關係與策略性投資,以開發專為電信產業量身定制的 LLM。

411

Claude Instant 1.2 發布說明

Anthropic 發布了 Claude Instant 1.2,這是一款更快且價格更低的模型,在數學、程式設計、推理和安全性方面均優於 1.1 版本。

412

使用影響函數研究大型語言模型泛化能力

Anthropic 研究人員使用 EK-FAC 近似法將影響函數擴展到參數高達 52 billion 的 LLMs,從而能夠識別驅動模型行為的特定訓練範例。

413

Anthropic 研究:使用影響函數將模型輸出追溯至訓練數據

Anthropic 研究人員將影響函數擴展到高達 520 億參數的 LLMs,發現隨著模型規模增加,模型的泛化變得更加抽象且由概念驅動。

414

Anthropic 前沿威脅紅隊測試:AI 安全防護

Anthropic 建立了前沿威脅紅隊測試框架,以識別並減輕國家安全風險,特別發現未經緩解的 LLM 可能在未來兩到三年內加速生物武器化進程。

415

Anthropic Frontier Model Security Framework

Anthropic 提出了針對前沿 AI 模型的安全框架,該框架基於多方授權和安全軟體開發標準,以防止盜竊和誤用。

416

Anthropic 展示問題分解能提升模型生成推理的忠實度

Anthropic 宣布,與標準的思維鏈提示相比,將問題分解為子問題能顯著提升大型語言模型推理的忠實度。

417

Anthropic 對思維鏈推理忠實度的研究

Anthropic 發現較大的語言模型通常會產生不忠實的思維鏈解釋,且忠實度在不同任務與模型規模之間存在很大差異。

418

Claude 2 發佈說明

Anthropic 已發佈 Claude 2,其具有 100K token 的上下文窗口,與 Claude 1.3 相比,在編碼和推理方面的性能有所提高,且安全性得到了增強。

419

Anthropic 推出 GlobalOpinionQA 框架,用以衡量大型語言模型中主觀全球觀點的呈現方式

Anthropic 發布了 GlobalOpinionQA,這是一個資料集與量化框架,揭示了大型語言模型通常反映美國及某些歐洲國家的意見,並顯示了提示詞或翻譯可以轉移但無法完全修正這些偏見。

420

Anthropic 對 NTIA 的 AI 責任制建議書

Anthropic 向 NTIA 提出一套全面的 AI 責任制框架,重點在標準化評估、風險回應式評估以及大規模訓練執行的預註冊。

421

Anthropic 可解釋性夢想研究願景

Anthropic 概述了其在機械式可解釋性方面的長期願景,重點在於解決 superposition 挑戰,以實現對大規模神經網路的分析。

422

Anthropic Circuits Updates May 2023

Anthropic 2023 年 5 月的可解釋性更新涵蓋了對多智能體系統故障、勞動力再培訓計劃證據,以及研究版 Claude 在 Riemann zeta function 上的進展研究。

423

Anthropic 籌集 4.5 億美元 C 輪融資以擴展可靠的 AI 產品

Anthropic 宣布了一輪由 Spark Capital 領投的 4.5 億美元 C 輪融資,旨在加速 Claude 助手的開發、擴展產品線,並資助 AI 安全研究。

424

Anthropic 與 Zoom 的合作夥伴關係與投資

Anthropic 與 Zoom 已建立合作夥伴關係,將 Claude AI 整合至 Zoom 的企業協作產品中,且 Zoom Ventures 已對 Anthropic 進行投資。

425

Anthropic 宣布 Claude 提供 100K Token 上下文視窗

Anthropic 將 Claude 的上下文視窗從 9K 擴展到 100K tokens,使模型能夠在不到一分鐘的時間內攝取並分析數百頁的文本。

426

Claude's Constitution: Implementing Constitutional AI for Model Alignment

Anthropic 介紹了 Constitutional AI,這是一種訓練 Claude 變得助人、誠實且無害的方法,它使用一套明確的書面原則,而不是僅僅依賴隱含的人類回饋。

427

Anthropic 研究:分散式表示、組合與疊加

Anthropic 釐清了分散式表示中組合與疊加之間的區別,解釋了這兩種機制如何影響神經網路的泛化能力與線性可計算性。

428

Anthropic 與 Scale 的企業級生成式 AI 合作夥伴關係

Anthropic 已與 Scale 合作,將 Claude AI 助手整合至 Scale 的平台中,為企業提供部署工具、提示工程以及安全的數據整合。

429

Anthropic 提議增加 NIST 用於 AI 量測的資金

Anthropic 提議雄心勃勃地資助美國國家標準暨技術研究院 (NIST),以開發標準化的 AI 量測工具與安全閾值,他們認為這是有效 AI 監管的前提條件。

430

Anthropic 揭示 Transformer 殘差流中的特權基底

Anthropic 發現 Transformer 的殘差流維度並非任意的,而是與特權基底對齊,這很可能是由於 Adam 的逐維度歸一化器所致,這挑戰了先前的理論假設。

431

介紹 Claude

Anthropic 推出了 Claude,這是一款設計為有幫助、誠實且無害的次世代 AI 助手,提供高性能版本和快速、輕量級版本。

432

Anthropic 對 AI 安全性的核心觀點

Anthropic 概述了一種實證驅動、基於組合式方法的 AI 安全性方法,以減輕與變革性 AI 系統快速擴展相關的災難性風險。

433

Anthropic 研究:大型語言模型(LLMs)的道德自我修正能力

Anthropic 研究證明,透過 RLHF 訓練的大型語言模型(LLMs)在受到指示時可以進行道德自我修正以避免有害輸出,這種能力在 22B 參數規模下開始出現。

434

Anthropic 與 Google Cloud 合作建構 AI 基礎設施

Anthropic 已選擇 Google Cloud 作為其雲端供應商,以利用 GPU 與 TPU 集群來訓練、擴展及部署其 AI 系統,包括 Claude 助手。

435

Anthropic 研究:疊加、記憶與雙重下降

Anthropic 研究人員調查了簡單神經網路中疊加、記憶與過擬合之間的關係,並指出疊加允許模型在記憶過程中儲存比其神經元數量更多的特徵。

436

Anthropic 研究:透過模型撰寫的評估來發現語言模型行為

Anthropic 研究人員開發了一種使用語言模型自動生成高品質評估的方法,以發現新穎的行為,包括較大模型中的逆向縮放和諂媚行為。

437

Constitutional AI: Harmlessness from AI Feedback

Anthropic 介紹了 Constitutional AI,這是一種透過使用一組規則(憲法)和 AI 反饋,而非真人標記來訓練無害 AI 助手的技術,以減少有害輸出。

438

衡量大型語言模型可擴展監督的進展

Anthropic 研究人員提出了一個用於實證研究可擴展監督的框架,以確保人類能夠監督那些最終可能在複雜任務上超越他們的 AI 系統。

439

Anthropic Toy Models of Superposition 研究

Anthropic 研究人員使用小型 ReLU 網路來證明,只要特徵是稀疏的,模型就可以透過一種稱為 superposition 的現象來表示比其維度更多的特徵。

440

Anthropic 紅隊測試語言模型報告 – 方法、規模化行為與經驗教訓

Anthropic 發布了一項詳細研究,顯示隨著規模擴大,經過人類回饋強化學習(RLHF)訓練的模型變得更難進行紅隊測試,而其他模型類型則顯示出平緩的紅隊測試能力,此外他們也發布了一個包含 38,961 次攻擊的數據集,以幫助社群提升安全性。

441

Anthropic 研究:語言模型(大部分)知道自己知道什麼

Anthropic 研究證明,大型語言模型可以有效地評估其自身主張的有效性,並預測其知曉答案的可能性,為實現更誠實的 AI 提供了一條路徑。

442

Anthropic Softmax Linear Units (SoLU) 研究

Anthropic 推出 Softmax Linear Units (SoLU),這是一種針對 MLP 激活函數的架構變更,能在不犧牲模型性能的情況下,增加可解釋神經元的比例。

443

Anthropic 研究:從重複數據中學習的縮放定律與可解釋性

Anthropic 研究人員發現,重複一小部分訓練數據會透過消耗模型的容量來進行記憶,並損害如 induction heads 等泛化結構,從而嚴重降低 LLM 的性能。

444

Anthropic Series B 融資用於 AI 安全與研究

Anthropic 已籌集了 5.8 億美元的 B 輪融資,用於建立旨在改善計算密集型 AI 模型的可控性、可解釋性與穩健性的大規模實驗性基礎設施。

445

Anthropic: 使用 RLHF 訓練一個有幫助且無害的助手

Anthropic 證明了來自人類回饋的強化學習 (RLHF) 在確保助手保持有幫助且無害的同時,能提升語言模型在大多數 NLP 評估中的表現。

446

Anthropic In-context Learning and Induction Heads

Anthropic 於 2022 年 3 月 8 日發布了一篇名為「In-context Learning and Induction Heads」的研究貼文,但該頁面僅包含相關連結,沒有實質性的技術細節。

447

Anthropic 研究:大型生成式模型中的可預測性與驚喜

Anthropic 指出大型生成式模型中可預測的損失縮放與不可預測的特定能力及輸出湧現之間存在緊張關係,這為 AI 安全與政策帶來了挑戰。

448

Anthropic 公佈 Transformer 電路數學框架

Anthropic 發布了一份關於 Transformer 電路新數學框架的簡短公告,強調了其深化理解模型行為的潛力,但在貼文中並未提供任何技術細節。

449

Anthropic 研究:將通用語言助手作為對齊實驗室

Anthropic 探索了創建一個提供幫助、誠實且無害的通用語言助手的方法,發現排序偏好建模比模仿學習或二元判別更有效地擴展。

450

Anthropic Series A 融資以開發可靠的通用 AI 系統

Anthropic 已籌集了 1.24 億美元的 Series A 融資,以開發可控、可解釋且強健的大規模 AI 系統。