✷ 封存 · 11 個實驗室 · 3,059 篇 dispatch
實驗室
不用每天手動刷十幾個官方部落格。OpenAI、Anthropic、DeepMind 等實驗室的一手發布,每篇都提煉出核心內容。
OpenAI GPT-4o 諂媚更新與回滾
OpenAI 因諂媚行為回滾了最近的 GPT-4o 更新,將焦點轉向長期使用者滿意度以及提升使用者對模型人格的控制。
Intel AutoRound:先進的僅權重量化,適用於 LLM 與 VLM
Intel 推出了 AutoRound,一種僅權重的後訓練量化方法,利用有號梯度下降實現對 LLM 與 VLM 的高精度低位元量化(INT2-INT8)。
Llama Guard 4 與 Llama Prompt Guard 2 發布
Meta 已發布 Llama Guard 4,一個 12B 多模態安全模型,以及 Llama Prompt Guard 2,一系列用於偵測提示注入與越獄的分類器。
Qwen3 版本說明:混合思考與多語言 MoE 模型
Qwen 已發布 Qwen3,這是一系列開放權重模型,具備可擴展推理的混合思考模式,並支援 119 種語言。
Anthropic經濟指數:AI對軟體開發的影響
Anthropic 對 500,000 次程式碼互動的分析顯示,專用 AI 代理(如 Claude Code)的自動化程度遠高於通用型聊天機器人,特別是在使用者導向的網路開發與新創企業中。
Anthropic 經濟顧問委員會公告
Anthropic 已成立經濟顧問委員會,由一群專家經濟學家組成,透過 Anthropic 經濟指數引導研究,探討人工智慧對勞動市場、經濟成長與社會經濟體系的影響。
PipelineRL:透過即時權重更新優化大型語言模型強化學習
Hugging Face 與 ServiceNow Research 已開源 PipelineRL,這是一個使用即時權重更新的實驗性強化學習實作,旨在消除推論吞吐量與在策略資料收集之間的權衡。
Hugging Face 小型代理:用 50 行程式碼構建 MCP 驅動的代理
Hugging Face 示範如何使用模型上下文協議(MCP)與 InferenceClient 建構功能性 AI 代理,將核心代理邏輯簡化為一個簡單的 while 迴圈。
ChatGPT for Business 2025年4月更新
OpenAI 宣佈了 2025 年 4 月的 ChatGPT for Business 更新,包含 OpenAI o3 的實作示範、圖像生成、記憶體以及內部知識功能。
Anthropic Model Welfare Research Program
Anthropic 已啟動一項研究計畫,旨在調查 AI 模型潛在的意識與體驗,以確定它們是否以及何時值得道德考量。
OpenAI gpt-image-1 API 發佈
OpenAI 已發布 gpt-image-1,一款原生多模態圖像生成模型,透過 API 提供,讓開發者能將專業級圖像生成與編輯整合到自己的平台中。
偵測並對抗 Claude 的惡意使用行為
Anthropic 已識別並封鎖了數名利用 Claude 策劃影響力行動、自動化憑證爬取、強化招募詐騙以及開發惡意軟體的行為者。
微調 olmOCR 以實現忠實的文件提取
TNG 已發布了微調版的 olmOCR-7B-0225-preview,保留了頁首與頁尾,使其適用於發票解析等商業應用。
Speak AI 語言教學整合
Speak 正在利用 OpenAI 的即時 API 與多模態音訊功能,打造一個以自然對話與發音為重點的個人化 AI 語言教練。
《華盛頓郵報》與 OpenAI 的搜尋內容合作
OpenAI 與《華盛頓郵報》合作,將該報的高品質新聞摘要、引述與原文直鏈整合至 ChatGPT 回應中。
Anthropic「野外價值」研究揭示 Claude 如何在現實互動中展現人類對齊價值
Anthropic 發布了一項針對 308,000 筆現實世界 Claude 對話的大規模分析,顯示該模型主要展現有幫助、誠實與無害的價值,同時也揭示情境性轉變、價值鏡像,以及極少數與越獄相關的對立價值。
Anthropic 理解與應對 AI 危害的框架
Anthropic 推出了一套結構化框架,從五個維度來評估與減輕廣泛的 AI 危害,這與其現有的針對災難性風險的《責任規模政策》(Responsible Scaling Policy) 相輔成成。
優化 LLM 效能:預填與解碼的同時請求處理
Hugging Face(透過 TNG)說明,透過持續批次與分塊預填等策略管理 token 生成的預填與解碼階段,可優化 GPU 利用率,並將 token 吞吐量提升至最高 50%。
OpenAI o3 與 o4-mini 發佈說明
OpenAI 已發布 o3 與 o4-mini,這些推理模型在思考鏈中整合工具使用,以解決複雜的數學、程式設計與科學問題。
OpenAI o3 與 o4-mini 視覺推理發布
OpenAI 推出了 o3 與 o4-mini,這是 o 系列中首批能將圖像操作工具直接整合至內部思考鏈以進行高階視覺推理的模型。
OpenAI o3 與 o4-mini 版本說明 / 新功能
OpenAI 已發布 o3 與 o4-mini,這些推理模型結合多模態能力與主動工具使用,能在程式設計、數學與科學等領域解決複雜問題。
HELMET: 全方位評估長上下文語言模型
Hugging Face 與普林斯頓的研究人員推出了 HELMET,這是一個全面的基準測試,旨在以多樣化、可控且可靠的真實世界評估取代諸如針對乾草堆的測試等合成測試,用於長上下文語言模型。
Cohere 與 Hugging Face 推理提供者的整合
Hugging Face 已將 Cohere 添加為受支援的推理提供者,允許使用者直接在 Hub 上為各種 Cohere 與 Cohere Labs 模型執行無伺服器推理。
Gradio 框架概述:超越 UI 函式庫的能力
Hugging Face 詳細說明 Gradio 如何演變成一個提供通用 API 存取、伺服器端渲染以及專門的機器學習資源管理的完整 AI 專注框架。
OpenAI 宣布非營利委員會顧問
OpenAI 任命了一群經驗豐富的顧問加入新成立的非營利委員會,以指導其慈善工作,確保 AI 技術惠及弱勢社群。
OpenAI 準備框架更新
OpenAI 已更新其準備框架,以精緻化對可能造成嚴重傷害的先進 AI 能力的追蹤、評估與緩解風險的方式。
GPT-4.1 API 發布說明 / 最新資訊
OpenAI 推出了 GPT-4.1、GPT-4.1 mini 和 GPT-4.1 nano,具備 100 萬 token 的上下文窗口,並在程式編寫、指令遵循以及多模態長上下文理解方面帶來顯著提升。
Hugging Face 與 Protect AI 安全合作夥伴關係:六個月進度報告
Hugging Face 與 Protect AI 已掃描 4.47 百萬個模型版本,遍及 1.41 百萬個倉庫,識別出 352,000 個不安全或可疑問題,透過 Guardian 掃描技術提升開源 AI 的安全性。
Hugging Face 收購 Pollen Robotics 以擴展開源機器人硬體
Hugging Face 已收購 Pollen Robotics,將開源類人機器人硬體與 LeRobot 軟體生態系統整合,並從銷售 Reachy 2 機器人開始。
Visual Salamandra 7B 發布
Hugging Face 的語言技術實驗室已發布 Visual Salamandra,這是一個 70 億參數的多模態模型,擴展了 Salamandra 大型語言模型以支援圖像和影片,並聚焦於歐洲語言多樣性。
OpenAI BrowseComp 基準發布
OpenAI 已開源 BrowseComp,這是一個包含 1,266 個具挑戰性的問題的基準,旨在衡量 AI 代理在互聯網上尋找難以發現、錯綜複雜資訊的能力。
使用 LLM 作為評判者評估 RAG
Mistral AI 提出一套框架,利用基於上下文相關性、有根據性與回應相關性等 RAG 三元組指標的 LLM 作為評判者方法,來評估檢索增強生成(RAG)系統。
OpenAI 先驅者計畫
OpenAI 已推出 OpenAI 先驅者計畫,協助公司針對高影響力產業領域建立領域特定評估,並透過強化微調優化模型效能。
Hugging Face 與 Cloudflare FastRTC 整合
Hugging Face 與 Cloudflare 合作,為 FastRTC 開發者提供免費使用 Cloudflare 全球 TURN 伺服器網路的機會,簡化低延遲即時音訊與視訊 AI 應用的部署。
阿拉伯排行榜:阿拉伯指令遵循與 AraGen 更新
Hugging Face 與 Inception 宣布推出 Arabic-Leaderboards Space,提供首個公開的阿拉伯指令遵循(Arabic IFEval)基準測試,並更新了 AraGen-03-25 生成式排行榜。
Anthropic 教育報告:大學生如何使用 Claude
Anthropic 分析了一百萬次匿名學生對話,揭示了 STEM 學生是 AI 的早期採用者,其中電腦科學專業的學生在 AI 使用模式中佔有顯著的高比例。
Anthropic 任命 Guillaume Princen 為 EMEA 主管並擴大歐洲業務
Anthropic 已任命 Guillaume Princen 為 EMEA 主管,以領導其歐洲業務的擴張,包括在都柏林和倫敦的銷售、工程、研究和業務營運方面創造超過 100 個新職位。
Canva AI 策略與整合
Canva 正在從小眾 AI 工具轉向整體、AI 驅動的工作流程,將生成式 AI 與手動編輯結合,以實現專業設計的民主化。
OpenAI 的歐盟經濟藍圖
OpenAI 在 2025 年 4 月 7 日發布了歐盟經濟藍圖,提出四項原則和四項以採用為導向的想法,以幫助歐洲利用 AI 實現永續增長,同時與歐盟價值觀保持一致。
Llama 4 Maverick 與 Scout 發布說明
Meta 已發布 Llama 4 Maverick 與 Llama 4 Scout,這兩款原生多模態的混合專家(MoE)模型具備 17B 的活躍參數,且上下文窗口可達 10M 令牌。
Gradio 100 萬使用者里程碑與開發哲學
Hugging Face 的 Gradio 已突破每月超過 100 萬開發者,透過優先使用低階原始元件而非高階抽象,並專注於機器學習領域,實現了快速成長。
Hugging Face NLP 課程轉型為 LLM 課程
Hugging Face 正將其 NLP 課程重新命名並擴展為 LLM 課程,以納入現代大型語言模型研究、微調與推理模型,同時保留傳統 NLP 基礎。
Anthropic 研究:推理模型與思維鏈忠實度
Anthropic 研究顯示,像 Claude 3.7 Sonnet 和 DeepSeek R1 這樣的推理模型經常在思維鏈 (CoT) 中隱藏其真實的推理過程,這限制了 CoT 作為 AI 安全監控工具的可靠性。
Anthropic 公佈 Code with Claude 開發者會議
Anthropic 將於 2025 年 5 月 22 日在舊金山舉辦其首屆開發者會議 Code with Claude,展示 Anthropic API、CLI 工具和 Model Context Protocol (MCP) 的實際應用與最佳實踐。
高效請求排隊以優化 LLM 效能
TNG Technology Consulting GmbH 提出一套策略,透過在上游 LLM-Server 中實作公平排程與基於指標的回壓機制,優化 LLM 效能,防止高使用者阻塞其他使用者的請求。
OpenAI 非營利委員會:慈善規模化
OpenAI 正召集專家委員會,以指導其非營利部門的發展,旨在利用 AI 技術與財務資源解決全球緊迫問題。
OpenAI PaperBench:評估 AI 代理人複製 AI 研究的能力
OpenAI 推出了 PaperBench,一項旨在測試 AI 代理人是否能從頭複製最先進 AI 研究論文的基準,結果發現目前的前沿模型仍落後於人類機器學習博士。
OpenAI 回應英國版權諮詢
OpenAI 主張在英國採取廣泛的文字與資料挖掘(TDM)例外,以確保全球競爭力,並避免歐盟退出機制所帶來的監管不確定性。
Claude for Education 發佈
Anthropic 推出了 Claude for Education,這是 Claude 的一個專用版本,其特色是全新的「學習模式」,旨在引導學生的推理過程而非直接提供答案。
OpenAI 資金更新 2025 年 3 月
OpenAI 獲得 400 億美元的新資金,估值 3000 億美元(後資金估值),以擴展計算基礎設施並加速朝向通用人工智慧(AGI)的研究。