✷ 封存 · 11 個實驗室 · 3,059 篇 dispatch
實驗室
不用每天手動刷十幾個官方部落格。OpenAI、Anthropic、DeepMind 等實驗室的一手發布,每篇都提煉出核心內容。
Anthropic 上下文檢索技術提升 RAG 准確度
Anthropic 宣布推出上下文檢索技術,這是一種預處理方法,在嵌入向量與 BM25 索引中加入片段專屬的上下文資訊,可將前 20 個片段的檢索失敗率降低最多 67%,並實現更便宜、更可靠的檢索增強生成(RAG)效能。
Anthropic Contextual Retrieval
Anthropic 推出了 Contextual Retrieval,這是一種透過在嵌入之前為分塊添加特定上下文的方法,能將 RAG 檢索失敗率降低高達 underbrace{67%} 的技術。
Qwen2.5 版本說明:全新基礎模型、Coder 與 Math 模型
Qwen 已發布 Qwen2.5,這是一套完整的開放權重密集解碼器僅模型,涵蓋通用大型語言模型、專門的 Coder 與 Math 變體,以及更新的 Qwen2-VL-72B。
Qwen2.5 LLM 系列發布
Qwen 宣佈了 Qwen2.5 系列——開源的僅解碼器 LLM,參數從 0.5B 到 72B,能力是 Qwen2 的兩倍,並加入了更大的 18 兆 token 資料集,在知識、程式碼、數學與對齊方面取得重大提升,且支援 128K token 的上下文窗口。
Qwen2.5-Coder 版本說明
Qwen 已發布 Qwen2.5-Coder,一系列在 5.5 兆 token 上訓練的開源程式碼模型,在程式碼生成、推理與數學方面優於更大的模型。
Qwen2.5-Math 版本說明
Qwen 已發布 Qwen2.5-Math,一系列支援雙語推理與工具整合推理(TIR)的開源數學大型語言模型,於複雜數學基準測試上超越領先的封閉源模型。
微調 LLM 至 1.58 位元:使用 BitNet 的極端量化
Hugging Face 展示了現有的 LLM(例如 Llama 3 8B)可以透過動態暖身量化策略微調至 1.58 位元三元精度,顯著降低記憶體與能源需求,同時保持強勁的效能。
Bespoke-Minicheck: 透過落地事實查核減少 LLM 幻覺
Ollama 已整合 Bespoke-Minicheck,這是一款由 Bespoke Labs 開發的落地事實查核模型,透過將聲明與來源文件進行比對來偵測幻覺。
Arco Educação 與 OpenAI 合作提升巴西教學
Arco Educação 正與 OpenAI 合作,實施基於 GPT-4 的工具,特別是「教師助理」,以減輕行政負擔,並為巴西多元學習需求的學生打造個人化課程計畫。
Mistral AI 2024 年 9 月發佈內容
Mistral AI 為 la Plateforme 引入了免費層級、大幅降低了其模型系列的價格、推出了 Mistral Small v24.09 模型,並透過 le Chat 上的 Pixtral 12B 提供免費的視覺能力。
Pixtral 12B 發佈說明
Mistral AI 已發佈 Pixtral 12B,這是一款原生多模態模型,結合了全新的 400M 參數視覺編碼器與 12B 參數解碼器,旨在提供高性能的多模態推理能力,且不損害文本能力。
Hugging Face 資料集 SQL 主控台
Hugging Face 推出了基於瀏覽器的 SQL 主控台,使用 DuckDB WASM 作為引擎,使用者可以直接在 Hub 上查詢、篩選與轉換資料集,無需後端依賴。
OpenAI 安全與保安實踐更新
OpenAI 已成立一個獨立的董事會監督委員會,以治理模型開發與部署的關鍵安全與保安措施。
HuggingChat 社群工具發布
Hugging Face 在 HuggingChat 上推出了社群工具,讓使用者能將任何公開的 Hugging Face Space 整合為 LLM 可直接在聊天介面中使用的工具。
Accelerate 1.0.0 釋出候選版公告
Accelerate 1.0.0 釋出候選版加入 FP8、DeepSpeed 多模型、torch.compile 以及全新資料載入器/管線功能,同時穩定大規模訓練與推論的 API。
OpenAI o1-preview 版本說明 / 新功能
OpenAI 已發布 o1-preview 與 o1-mini,這是一系列新型推理模型,透過延長思考時間來解決科學、程式設計與數學等複雜問題。
OpenAI 學習以 LLM 進行推理
OpenAI 透過對複雜密碼解碼任務的詳細步驟說明,展示其最新模型的推理能力,說明解決該問題所需的逐步邏輯推進。
OpenAI o1-mini 發布說明
OpenAI 已發布 o1-mini,一款針對 STEM 任務進行成本效益優化的推理模型,提供比 o1-preview 更低的延遲與成本,同時在數學與程式設計方面保持高效能。
OpenAI o1 貢獻
OpenAI 已公布一份完整的內部與外部貢獻者名單,這些人員開發了 OpenAI o1 模型,並詳細說明了組織角色與安全領導層在其創建過程中的參與。
使用 OpenAI o1 進行程式設計
OpenAI o1 透過先進的推理能力,使使用者能夠編寫更複雜且更一致的程式碼,從而提升軟體開發效率。
OpenAI o1 與量子物理
OpenAI o1 是一個新系列的 AI 模型,旨在透過花更多時間思考的推理過程,解決科學、程式設計與數學中更具挑戰性的問題。
OpenAI o1 與經濟學
OpenAI o1 是一系列新型 AI 模型,旨在透過在回應前花更多時間思考,來推理科學、程式設計、數學與經濟學等複雜任務。
解碼遺傳學與 OpenAI o1
OpenAI o1 是一系列全新的 AI 模型,旨在於科學、程式設計與數學領域進行複雜推理,為像 Catherine Brownstein 這樣的遺傳學家提供管理基因組龐大複雜性的工具。
Anthropic Circuits Updates August 2024
Anthropic 2024 年 8 月的 Circuits 更新提供了關於多智能體系統故障、勞工再培訓計劃以及研究版 Claude 在黎曼猜想方面的進展的初步研究見解。
Ada 客戶服務自動化與 GPT-4
Ada 重新構建了其 AI 原生的客戶服務平台,使用 GPT-4,使解決率從 30% 翻倍至最高 60%(頂尖客戶更可超過 80%)。
Hugging Face 與 TruffleHog 秘密掃描合作夥伴關係
Hugging Face 與 Truffle Security 合作,將 TruffleHog 的秘密掃描功能整合至其自動化管線,並提供原生掃描器,讓使用者能主動掃描自己的帳戶資料。
Salesforce 整合 Anthropic Claude AI
Salesforce 已透過 Amazon Bedrock 將 Anthropic 的 Claude 3.5 Sonnet、Claude 3 Opus 與 Claude 3 Haiku 模型整合至其平台中,讓企業能夠自訂 AI 驅動的 CRM 應用程式。
Qwen2-VL 發布:開源 2B/7B 視覺語言模型與 72B API,具備最先進的圖像、影片與多語言能力
Qwen 發布了 Qwen2-VL,一個全新的視覺語言模型系列(2B、7B 開源、72B API),在圖像、文件、多語言以及長影片理解方面達到最先進的表現,同時支援視覺代理功能。
LeRobotDataset 影片編碼格式減少機器人資料集大小並加速訓練
Hugging Face 發布了 LeRobotDataset 影片編碼格式,將機器人視覺資料縮減至原始大小約 14 %,同時保持載入速度與訓練效能不變。
亞利桑那州立大學整合 ChatGPT Edu 以實現個人化教育
亞利桑那州立大學已在超過 200 個專案中部署 ChatGPT Edu,以個人化學習、推進研究,並提升 181,000 名學生的營運效率。
Hugging Face 部落格文章突顯五個被低估的 Hub 工具與免費語意搜尋案例
Hugging Face 宣布了五個被低估的 Hub 工具——ZeroGPU、多程序 Docker、Gradio API、webhooks 與 Nomic Atlas,並示範如何將它們結合成一個免費、可自動更新的 Reddit 資料語意搜尋應用。
Hugging Face 訓練效率:使用 Flash Attention 2 的打包
Hugging Face 引入了具備邊界感知的指令微調樣本打包,搭配 Flash Attention 2 使用時,可提升至 2 倍的訓練吞吐量並降低 20% 的峰值記憶體使用量。
OpenAI 與 Condé Nast 內容整合合作夥伴關係
OpenAI 與 Condé Nast 合作,將 Vogue、The New Yorker 等品牌的內容整合至 ChatGPT 與 SearchGPT 原型,以提升資訊發現與來源標註。
Upwork OpenAI 整合與 AI 為先策略
Upwork 已轉向以 OpenAI 為核心的生態系統,將 GPT-4o 與 GPT-3.5 整合至其市場功能、內部詐騙偵測以及透過 ChatGPT Enterprise 提升企業生產力。
OpenAI 推出 GPT‑4o 微調,提供免費代幣配額並宣布平台日落
OpenAI 推出 GPT‑4o 微調功能,使開發者能以最少資料自訂模型,並提供至 9 月 23 日的免費訓練代幣,同時宣布平台將於 2026 年 5 月 8 日後對新使用者關閉。
在 Google Cloud Vertex AI 上部署 Meta Llama 3.1 405B
Hugging Face 提供了一份指南,說明如何使用 Text Generation Inference (TGI) 與 A3 系列機器,在 Google Cloud Vertex AI 上以程式方式部署 Meta Llama 3.1 405B 的 FP8 量化版本。
OpenAI 破壞伊朗影響行動 Storm-2035
OpenAI 已封禁一批被伊朗影響行動 Storm-2035 用於在 2024 年美國大選及其他全球事件中生成政治內容的 ChatGPT 帳號。
Indeed 情境工作匹配與 OpenAI
Indeed 整合了 OpenAI 的 GPT 模型,為職位推薦提供個人化說明,從而使已開始的求職申請量提升了 20%,下游成功率提升了 13%。
OpenAI 與大都會藝術博物館合作:喚醒沉睡的美人
OpenAI 與大都會藝術博物館服裝學院合作,打造了一個 AI 驅動的聊天體驗,讓參觀者能夠與歷史人物 Natalie Potter 互動,該體驗基於精選的歷史資料集。
Hugging Face Infini-Attention 再現分析
Hugging Face 嘗試再現 Infini-Attention 的結果顯示,雖然門控收斂可以得到改善,但隨著記憶壓縮程度提升,方法的效能會下降,且仍不如 Ring Attention、YaRN 或 RoPE scaling 可靠。
OpenAI SWE-bench Verified 發布:人工驗證的基準提升軟體工程評估
OpenAI 發布了 SWE‑bench Verified,這是一個經過人工驗證的 500 個樣本子集,取自 SWE‑bench 軟體工程基準,去除了模糊的問題與不公平的測試,使得 AI 模型的程式編寫能力評估更為可靠;GPT‑4o 解決了其中 33.2% 的樣本,分數是原始基準的兩倍以上。
ggml 簡介
ggml 是一個輕量級的 C/C++ 機器學習函式庫,針對 Transformer 推論與多種硬體後端的裝置端大型語言模型執行進行了最佳化。
Grok-2 Beta Release
xAI 已發布 Grok-2 與 Grok-2 mini 的測試版,其在對話、程式碼編寫與推理能力方面具備前沿級別的能力,在 LMSYS 排行榜上超越了 Claude 3.5 Sonnet 與 GPT-4 Turbo。
Hugging Face 統一工具使用 API
Hugging Face 推出了一個統一的工具使用 API,讓開發者能夠使用相同的程式碼在 Mistral、Cohere、NousResearch 與 Llama 模型上實作工具呼叫。
Falcon Mamba 7B 版本說明
科技創新研究院(TII)發布了 Falcon Mamba 7B,這是首個大規模純粹的狀態空間語言模型(SSLM),在效能上與最先進的 Transformer 模型相當,同時消除了基於注意力的記憶體擴展問題。
Qwen2-Audio 發布說明
Qwen2-Audio 是一款音頻語言模型,能夠進行語音聊天與音頻分析,支援超過八種語言與方言,並在多項基準測試上超越先前的最先進表現。
Zico Kolter 加入 OpenAI 董事會
OpenAI 任命 Carnegie Mellon 大學機器學習系主任兼教授 Zico Kolter 加入其董事會及安全與安保委員會。
Hugging Face 收購 XetHub 以升級 Hub 儲存與協作
Hugging Face 收購 XetHub,以取代 Git LFS,使用更高效的儲存後端,實現增量更新、千兆參數模型支援,並提升對大規模 AI 資料集的協作效能。
GPT‑4o 系統卡 – 功能、 安全緩解措施與風險評估
OpenAI 發布了 GPT‑4o 系統卡,詳細說明了全能模型的功能、安全緩解措施,以及中等的整體風險評級。
Anthropic 擴大模型安全漏洞賞金計畫
Anthropic 宣布擴大一項僅限受邀參加的漏洞賞金計畫,若發現其下一代 AI 安全緩解措施中的通用越獄攻擊,最高可獲得 15,000 美元的獎勵,旨在保護 CBRN 和網路安全等高風險領域。