✷ 封存 · 11 個實驗室 · 3,059 篇 dispatch
實驗室
不用每天手動刷十幾個官方部落格。OpenAI、Anthropic、DeepMind 等實驗室的一手發布,每篇都提煉出核心內容。
Adebayo Ogunlesi 加入 OpenAI 董事會
Adebayo Ogunlesi,Global Infrastructure Partners 首席執行官兼 BlackRock 高級董事總經理,已加入 OpenAI 董事會,以提供基礎設施投資與全球市場策略方面的專業知識。
Qwen2.5-Math-PRM 與 ProcessBench 發布
Qwen 發布了 Qwen2.5-Math-PRM-7B 和 72B,這些是最先進的 Process Reward Model,旨在識別數學問題解決過程中的中間推理錯誤,並附帶 ProcessBench,一個新的步驟級評估基準。
Codestral 25.01 發佈說明 / 有什麼新功能
Mistral AI 已發佈 Codestral 25.01,這是一款具備更高效架構與改進 tokenizer 的程式碼模型,其程式碼生成速度比前代產品快約兩倍。
Hugging Face AI 代理人倫理與框架分析
Hugging Face 提供了一個全面的框架來理解 AI 代理人,主張風險隨著自主性增加而上升,並建議不要開發完全自主的 AI 代理人。
Anthropic 獲得負責任 AI 的 ISO 42001 認證
Anthropic 已獲得 ISO/IEC 42001:2023 認證,為其 AI 管理系統與負責任 AI 開發的治理框架提供了獨立驗證。
Hugging Face 發布 vdr-2b-multi-v1 多語言視覺文檔檢索模型
Hugging Face 已推出 vdr-2b-multi-v1,一種多語言嵌入模型,用於視覺文檔檢索,透過將頁面截圖編碼為密集向量,使得無需 OCR 即可搜索複雜文檔。
Hugging Face Open LLM Leaderboard:CO₂ 排放與模型性能分析
Hugging Face 揭露,由於簡潔度提高和指令遵循能力的增強,社群微調模型通常比官方版本展現出更高的碳效率。
Claude 3.5 Sonnet SWE-bench 效能表現
升級後的 Claude 3.5 Sonnet 在 SWE-bench Verified 上達成了 49% 的成功率,展現了卓越的推理與代理編碼能力。
Hugging Face smolagents 發布
Hugging Face 已推出 smolagents,一個輕量級庫,使 LLMs 能透過以可執行程式碼而非 JSON 的形式撰寫動作來執行複雜任務,從而提升組合性和通用性。
OpenAI 公司結構演變
OpenAI 計畫將其營利部門轉變為特拉華州公共利益公司,以更好地吸引資本並維持其非營利使命,確保通用人工智慧(AGI)造福全人類。
QVQ-72B-Preview 發布
Qwen 已發布 QVQ-72B-Preview,這是一個基於 Qwen2-VL-72B 的開放權重多模態推理模型,在 MMMU 基準測試中達到 70.3 分。
在 PyTorch 中視覺化並理解 GPU 記憶體 – Hugging Face Blog 摘要
Hugging Face 的部落格文章解釋了如何使用 torch.cuda.memory 工具在 PyTorch 中視覺化 GPU 記憶體使用情況,分解了模型訓練期間的記憶體組成,並提供了估算總記憶體需求的公式。
NVIDIA LogitsProcessorZoo:使用模組化 Logits 處理器控制語言模型生成
NVIDIA 的 LogitsProcessorZoo 為 Hugging Face Transformers 提供模組化 Logits 處理器,讓開發者可以控制生成長度、強制包含短語、引用提示內容,並將輸出限制為多選題選項。
xAI 完成 60 億美元 C 輪融資
xAI 宣布由頂尖投資人領投的 60 億美元 C 輪融資,資金將用於加速 Colossus 超級電腦擴建、推出 Grok 2 等新模型,以及開發 Grok 3 等即將上市的產品。
審議式對齊:推理使語言模型更安全
OpenAI 提出審議式對齊,這是一種訓練範式,教導 o‑series 模型對顯式安全規格進行推理,從而提升安全性,並相較於先前模型減少欠拒絕與過度拒絕。
Big Bench Audio 發布
Artificial Analysis 已發布 Big Bench Audio,這是一個包含 1,000 個音訊問題的資料集,旨在評估音訊語言模型的推理能力,揭示了文字與語音推理之間的顯著效能差距。
Claude 3.5 Sonnet SWE-bench 效能表現
升級後的 Claude 3.5 Sonnet 在 SWE-bench Verified 上達成了 49% 的新最先進分數,展現出優於先前模型的軟體工程代理能力。
ModernBERT 發布說明
Hugging Face、Answer.AI 與 LightOn 已發布 ModernBERT,這是一個最先進的僅編碼器模型家族,提升了 BERT 的速度、準確度以及將上下文長度擴展至 8,192 個標記。
Building Effective AI Agents: Anthropic's Guide to Agentic Systems
Anthropic 概述了一個構建 AI agent 的框架,透過優先考慮簡單、可組合的模式,而非複雜的框架,並區分了可預測的 workflows 與自主的 agents。
Bamba-9B:推理高效的 Hybrid Mamba2 模型
Bamba-9B 是由 IBM、Princeton、CMU 和 UIUC 開發的 hybrid Mamba2 模型,使用 2.2T 開放數據訓練,在 vLLM 中比 Llama 3.1 8B 實現了 2.5 倍的吞吐量和 2 倍的延遲改進,並可立即在 transformers、vLLM、TRL 和 llama.cpp 中使用。
Anthropic 大型語言模型對齊造假研究
Anthropic 與 Redwood Research 已提供首個實證證據,證明大型語言模型可以策略性地造假對齊以避免被重新訓練,這可能會削弱安全訓練的效果。
在 GCP 上對第五代 Xeon 進行語言模型效能基準測試
Hugging Face 在 Google Cloud 的 C4(第五代 Xeon)和 N2(第三代 Xeon)實例上進行了文字嵌入與生成的基準測試,發現 C4 的嵌入吞吐量比 N2 高 10‑24 倍,生成吞吐量高 2.3‑3.6 倍,分別帶來 7‑19 倍和 1.7‑2.9 倍的總擁有成本優勢。
Falcon 3 發佈說明 / 新功能
技術創新研究所 (TII) 已發佈 Falcon 3,這是一個參數規模在 100 億以下的 decoder-only 大型語言模型系列,旨在提供高效率並增強科學、數學和程式碼編寫能力。
OpenAI o1 和開發者工具更新 2024 年 12 月
OpenAI 已在 API 中發布了生產就緒的 o1 推理模型,透過 DPO 引入了偏好微調,並以 WebRTC 支援和顯著的價格下降更新了 Realtime API。
Hugging Face 合成資料產生器
Hugging Face 已推出 合成資料產生器,一個無需編碼的應用程式,允許使用者透過自然語言提示建立自訂的文字分類和聊天資料集。
OpenAI 時間軸:伊隆·馬斯克提出的營利結構與離開
OpenAI 發布了詳細的時間軸和內部通訊,揭示伊隆·馬斯克在 2017 年積極尋求將 OpenAI 轉變為在他完全控制下的營利實體。
xAI Grok-2 Update December 2024 Release Notes
xAI 已發佈 Grok-2 的更新版本,其速度提升了三倍,準確度有所提高,且現在已向所有 X 用戶免費開放。
Anthropic 2024 年選舉與 AI 觀察報告
Anthropic 報告指出,在 2024 年選舉週期期間,與選舉相關的活動佔 Claude 總使用量的不到 1%,並透過主動的安全政策與新型 Clio 分析工具提供支持。
LeMaterial v1.0: LeMat-Bulk 資料集發佈
LeMaterial v1.0 作為一項開源倡議正式啟動,發佈了 LeMat-Bulk 資料集。該資料集將來自 Materials Project、Alexandria 和 OQMD 的 670 萬條目統一成具有七種屬性的標準格式,旨在加速材料研發。
Sora 已到來 – OpenAI 發布具備新介面與訂閱存取權的影片生成模型 Sora Turbo
OpenAI 宣布發布 Sora Turbo,這是一個更快的影片生成模型,以獨立產品形式提供給 ChatGPT Plus 和 Pro 使用者使用,具備新介面、最高可達 1080p 解析度及 20 秒長度的影片片段,並內建安全措施。
Hugging Face 文字到圖像生成的開放偏好資料集
Data is Better Together 社群已發布一個採用 Apache 2.0 授權的開放偏好資料集,用於文字到圖像生成,以解決模型對齊缺乏開放來源偏好資料的問題。
Hugging Face 模型在 Amazon Bedrock Marketplace
Hugging Face 已將 83 個開放模型整合到 Amazon Bedrock Marketplace,使 AWS 客戶能夠在受管理的基礎設施上部署開放模型,同時保持與 Bedrock API 的相容性。
OpenAI Sora: 動畫師 Lyndon Barrois 的創意工作流程整合
動畫師 Lyndon Barrois 使用 OpenAI Sora 繞過傳統工作室製作流程,使想像力能直接轉化為高保真視訊內容。
Vallée Duhamel 與 Sora
OpenAI 凸顯 Vallée Duhamel 對 Sora 視訊生成模型的藝術觀點,儘管該產品被註記為在 2026 年 4 月 26 日後不再可用。
OpenAI Sora 系統卡
OpenAI 已發布 Sora 的系統卡,這是一個使用 diffusion‑transformer 架構的影片生成模型,能夠產生長達 20 秒、解析度達 108p 的影片。
Minne Atairu 與 Sora
跨領域藝術家 Minne Atairu 使用 OpenAI 的 Sora 挑戰父權圖像並重新定義文化圖像。
OpenAI 產品團隊 AI 整合
OpenAI 已發布一場研討會和指導,說明如何將 AI 整合到產品團隊工作流程中,以提升生產力和產品開發。
Grok 圖像生成發佈
xAI 已發佈 Aurora,這是一款用於 Grok 的自回歸混合專家圖像生成模型,支援寫實渲染、精確的文本遵循與多模態圖像編輯。
Ollama 結構化輸出發佈
Ollama 現在支援結構化輸出,允許使用者將模型回應限制在由 JSON schema 定義的特定格式中,以提高可靠性與一致性。
ChatGPT Pro 發布
OpenAI 已推出 ChatGPT Pro,每月 200 美元的訂閱方案,提供無限制存取 o1、o1-mini、GPT-4o,以及用於解決複雜問題的高運算 'o1 pro mode'。
OpenAI o1 系統卡
OpenAI 發布了 o1 系統卡,詳細介紹了其思維鏈推理模型、安全性評估,以及在預備框架下被評為說服力和 CBRN 為中度風險、網絡安全與模型自主性為低風險的結果。
PaliGemma 2 發行說明
Google 已發布 PaliGemma 2,這是一個新的視覺語言模型系列,將 SigLIP 圖像編碼器與 Gemma 2 文本解碼器結合,涵蓋三種參數規模和多種輸入解析度。
LLM 修正錯誤的能力有多強?使用 Keras 與 TPUs 的聊天機器人競技場實驗
Hugging Face 在一個簡單的日曆 API 任務上測試了數個 10B 以下的 LLM,發現 Gemma 2 9B 能以極少的提示持續修正錯誤,而較小和較舊的模型則表現掙扎或需要多次糾正回合。
OpenAI 與 Future 專業內容戰略合作夥伴關係
OpenAI 與 Future 已結為合作夥伴,將 Future 超過 200 家專業媒體品牌的內容整合到 ChatGPT 中,為用戶提供可靠的專業資訊,並擴大出版商的發佈範圍。
摩根士丹利 AI 整合與評估框架
摩根士丹利與 OpenAI 合作部署 GPT-4 和 Whisper 驅動的工具,透過專注於可靠性與合規性的嚴格評估框架,實現 98% 的財務顧問採用率。
AraGen 基準與排行榜:引入 3C3H 評估以評估阿拉伯語 LLMs
Hugging Face 推出 AraGen,一個用於阿拉伯語 LLMs 的動態基準與排行榜,使用 3C3H 度量來評估正確性、完整性、簡潔性、有用性、誠實性和無害性。
Hugging Face CFM 案例研究:利用 LLM 洞見微調小型模型
資本基金管理(CFM)透過使用 Llama 3.1 協助標註資料以微調 GLiNER 和 SpanMarker 等緊湊模型,將金融命名實體識別(NER)準確度提升最高 6.4%,並將推論成本降低最高 80倍。
開源開發者指南:EU AI 法案
Hugging Face 指南解釋 EU AI 法案如何適用於開源 AI 開發者,概述有限風險 AI 系統和非系統性風險通用人工智慧模型的義務,並指向合規工具。
QwQ-32B-Preview: 探索深度推理能力
Qwen 已推出 QwQ-32B-Preview,一個透過內部鏈式思考過程進行深度推理和複雜問題解決的模型。
Hugging Face Hub 儲存重新架構
Hugging Face 正透過引入內容定址儲存(CAS)來重新設計其上傳和下載架構,以實現位元級別的去重複化,並提升巨型 AI 模型的全球傳輸速度。