OpenAI gpt-image-1 API 發佈
OpenAI 已發布 gpt-image-1,一款原生多模態圖像生成模型,透過 API 提供,讓開發者能將專業級圖像生成與編輯整合到自己的平台中。
微調 olmOCR 以實現忠實的文件提取
TNG 已發布了微調版的 olmOCR-7B-0225-preview,保留了頁首與頁尾,使其適用於發票解析等商業應用。
Speak AI 語言教學整合
Speak 正在利用 OpenAI 的即時 API 與多模態音訊功能,打造一個以自然對話與發音為重點的個人化 AI 語言教練。
《華盛頓郵報》與 OpenAI 的搜尋內容合作
OpenAI 與《華盛頓郵報》合作,將該報的高品質新聞摘要、引述與原文直鏈整合至 ChatGPT 回應中。
優化 LLM 效能:預填與解碼的同時請求處理
Hugging Face(透過 TNG)說明,透過持續批次與分塊預填等策略管理 token 生成的預填與解碼階段,可優化 GPU 利用率,並將 token 吞吐量提升至最高 50%。
OpenAI o3 與 o4-mini 發佈說明
OpenAI 已發布 o3 與 o4-mini,這些推理模型在思考鏈中整合工具使用,以解決複雜的數學、程式設計與科學問題。
OpenAI o3 與 o4-mini 視覺推理發布
OpenAI 推出了 o3 與 o4-mini,這是 o 系列中首批能將圖像操作工具直接整合至內部思考鏈以進行高階視覺推理的模型。
OpenAI o3 與 o4-mini 版本說明 / 新功能
OpenAI 已發布 o3 與 o4-mini,這些推理模型結合多模態能力與主動工具使用,能在程式設計、數學與科學等領域解決複雜問題。
HELMET: 全方位評估長上下文語言模型
Hugging Face 與普林斯頓的研究人員推出了 HELMET,這是一個全面的基準測試,旨在以多樣化、可控且可靠的真實世界評估取代諸如針對乾草堆的測試等合成測試,用於長上下文語言模型。
Cohere 與 Hugging Face 推理提供者的整合
Hugging Face 已將 Cohere 添加為受支援的推理提供者,允許使用者直接在 Hub 上為各種 Cohere 與 Cohere Labs 模型執行無伺服器推理。
Gradio 框架概述:超越 UI 函式庫的能力
Hugging Face 詳細說明 Gradio 如何演變成一個提供通用 API 存取、伺服器端渲染以及專門的機器學習資源管理的完整 AI 專注框架。
OpenAI 宣布非營利委員會顧問
OpenAI 任命了一群經驗豐富的顧問加入新成立的非營利委員會,以指導其慈善工作,確保 AI 技術惠及弱勢社群。
OpenAI 準備框架更新
OpenAI 已更新其準備框架,以精緻化對可能造成嚴重傷害的先進 AI 能力的追蹤、評估與緩解風險的方式。
GPT-4.1 API 發布說明 / 最新資訊
OpenAI 推出了 GPT-4.1、GPT-4.1 mini 和 GPT-4.1 nano,具備 100 萬 token 的上下文窗口,並在程式編寫、指令遵循以及多模態長上下文理解方面帶來顯著提升。
Hugging Face 與 Protect AI 安全合作夥伴關係:六個月進度報告
Hugging Face 與 Protect AI 已掃描 4.47 百萬個模型版本,遍及 1.41 百萬個倉庫,識別出 352,000 個不安全或可疑問題,透過 Guardian 掃描技術提升開源 AI 的安全性。
Hugging Face 收購 Pollen Robotics 以擴展開源機器人硬體
Hugging Face 已收購 Pollen Robotics,將開源類人機器人硬體與 LeRobot 軟體生態系統整合,並從銷售 Reachy 2 機器人開始。
Visual Salamandra 7B 發布
Hugging Face 的語言技術實驗室已發布 Visual Salamandra,這是一個 70 億參數的多模態模型,擴展了 Salamandra 大型語言模型以支援圖像和影片,並聚焦於歐洲語言多樣性。
OpenAI BrowseComp 基準發布
OpenAI 已開源 BrowseComp,這是一個包含 1,266 個具挑戰性的問題的基準,旨在衡量 AI 代理在互聯網上尋找難以發現、錯綜複雜資訊的能力。
OpenAI 先驅者計畫
OpenAI 已推出 OpenAI 先驅者計畫,協助公司針對高影響力產業領域建立領域特定評估,並透過強化微調優化模型效能。
Hugging Face 與 Cloudflare FastRTC 整合
Hugging Face 與 Cloudflare 合作,為 FastRTC 開發者提供免費使用 Cloudflare 全球 TURN 伺服器網路的機會,簡化低延遲即時音訊與視訊 AI 應用的部署。
阿拉伯排行榜:阿拉伯指令遵循與 AraGen 更新
Hugging Face 與 Inception 宣布推出 Arabic-Leaderboards Space,提供首個公開的阿拉伯指令遵循(Arabic IFEval)基準測試,並更新了 AraGen-03-25 生成式排行榜。
Canva AI 策略與整合
Canva 正在從小眾 AI 工具轉向整體、AI 驅動的工作流程,將生成式 AI 與手動編輯結合,以實現專業設計的民主化。
OpenAI 的歐盟經濟藍圖
OpenAI 在 2025 年 4 月 7 日發布了歐盟經濟藍圖,提出四項原則和四項以採用為導向的想法,以幫助歐洲利用 AI 實現永續增長,同時與歐盟價值觀保持一致。
Llama 4 Maverick 與 Scout 發布說明
Meta 已發布 Llama 4 Maverick 與 Llama 4 Scout,這兩款原生多模態的混合專家(MoE)模型具備 17B 的活躍參數,且上下文窗口可達 10M 令牌。
Gradio 100 萬使用者里程碑與開發哲學
Hugging Face 的 Gradio 已突破每月超過 100 萬開發者,透過優先使用低階原始元件而非高階抽象,並專注於機器學習領域,實現了快速成長。
Hugging Face NLP 課程轉型為 LLM 課程
Hugging Face 正將其 NLP 課程重新命名並擴展為 LLM 課程,以納入現代大型語言模型研究、微調與推理模型,同時保留傳統 NLP 基礎。
高效請求排隊以優化 LLM 效能
TNG Technology Consulting GmbH 提出一套策略,透過在上游 LLM-Server 中實作公平排程與基於指標的回壓機制,優化 LLM 效能,防止高使用者阻塞其他使用者的請求。
OpenAI 非營利委員會:慈善規模化
OpenAI 正召集專家委員會,以指導其非營利部門的發展,旨在利用 AI 技術與財務資源解決全球緊迫問題。
OpenAI PaperBench:評估 AI 代理人複製 AI 研究的能力
OpenAI 推出了 PaperBench,一項旨在測試 AI 代理人是否能從頭複製最先進 AI 研究論文的基準,結果發現目前的前沿模型仍落後於人類機器學習博士。
OpenAI 回應英國版權諮詢
OpenAI 主張在英國採取廣泛的文字與資料挖掘(TDM)例外,以確保全球競爭力,並避免歐盟退出機制所帶來的監管不確定性。
OpenAI 資金更新 2025 年 3 月
OpenAI 獲得 400 億美元的新資金,估值 3000 億美元(後資金估值),以擴展計算基礎設施並加速朝向通用人工智慧(AGI)的研究。
Hugging Face 機密管理擴展與 Infisical
Hugging Face 將機密管理遷移至 Infisical,以在多雲環境中集中管理機密,消除機密散落,並透過自動化的 Kubernetes 整合與 RBAC 提升安全性。
文本生成推理 (TGI) Intel Gaudi 整合
Hugging Face 已將 Intel Gaudi 硬體支援直接整合至文本生成推理 (TGI) 主程式碼庫,提供在 Intel AI 加速器上部署 LLM 的生產等級服務解決方案。
QVQ-Max 視覺推理模型發布
Qwen 已發布 QVQ-Max,一款能夠分析圖像與影片,解決數學、程式設計與創意任務等複雜問題的視覺推理模型。
Zendesk 與 OpenAI:向主動式 AI 代理人轉型以提升客服服務
Zendesk 正在試行一種由 OpenAI 模型驅動、使用生成式推理與多代理人架構的全新 AI 代理人,以自動化高達 80% 的客服解決方案。
DeepSeek-V3-0324 發佈說明
DeepSeek 已發佈 DeepSeek-V3-0324,這是 R1 的基礎模型更新版本,在 MIT 授權下具備改進的指令遵循、程式碼與數學能力。
Qwen2.5‑Omni 發布:即時互動的端到端多模態模型
Qwen 已發布 Qwen2.5‑Omni,一款端到端多模態模型,能處理文字、圖像、音訊與影片,並即時產生串流文字與自然語音回應。
OpenAI 針對 AGI 開發的安全策略
OpenAI 正在實施一個多層次的安全框架,結合 AI 驅動的防禦、持續的紅隊測試以及零信任架構,以保護基礎設施和新興的 AI 代理,並在邁向 AGI 的過程中提供防護。
使用 Sentence Transformers 訓練與微調重新排序模型
Hugging Face 提供了透過 Sentence Transformers 訓練與微調 Cross Encoder 重新排序模型的完整指南與框架,以優化領域特定檢索效能。
OpenAI GPT-4o 影像生成發布
OpenAI 已將原生影像生成整合至 GPT-4o,使其能在單一多模態模型中實現精確文字渲染、多輪細化以及高保真寫實影像。
GPT-4o 圖像生成系統卡片附錄
OpenAI 已在 GPT-4o 中原生嵌入一項新的圖像生成功能,使其能夠產生照片級真實感的輸出、進行圖像到圖像的轉換,以及精確渲染文字。
Hebbia Matrix:使用多代理 AI 自動化金融與法律工作流程
Hebbia 推出 Matrix,一個由 OpenAI 的 o1、o3-mini 與 GPT-4o 提供動力的多代理 AI 平台,透過克服離線資料的 RAG 限制,將金融與法律工作自動化至最高 90%。
OpenAI 2025 年 3 月領導層更新
OpenAI 擴大了 Mark Chen、Brad Lightcap 與 Julia Villagra 的職務,以更好地整合研究與產品開發,並擴大全球營運規模。
Gradio Dataframe 更新:新功能與增強
Hugging Face 已更新 Gradio 中的 gr.Dataframe 元件,加入多儲存格選取、欄位固定、搜尋與篩選功能,以及提升的可及性。
Qwen2.5-VL-32B 發布說明
Qwen 已發布 Qwen2.5-VL-32B-Instruct,一款透過強化學習優化的視覺語言模型,具備卓越的數學推理能力、細緻的影像理解以及符合人類偏好的回應。
OpenAI 與 MIT Media Lab 關於 ChatGPT 情感使用的研究
OpenAI 與 MIT Media Lab 針對情感使用(與 AI 的情緒互動)進行了研究,發現雖然此類使用在實際使用中較為罕見,但其對福祉的影響會因使用者行為、互動模式與個人情況而有所不同。
Hugging Face 推理端點分析更新
Hugging Face 已更新其推理端點分析儀表板,加入即時指標、可自訂時間範圍以及詳細的副本生命週期檢視,以提升監控與除錯效能。
Booking.com 與 OpenAI 個人化整合
Booking.com 已整合 OpenAI 的 GPT 模型,透過 AI 旅行規劃師、智慧篩選與自動化評論摘要,改變旅遊探索與預訂方式。
OpenAI 次世代音訊模型 API 發佈
OpenAI 在其 API 中發布了全新的語音轉文字與文字轉語音模型,具備提升的轉錄準確度以及可操控的合成聲音,供語音代理人使用。
Open R1:在本機執行 OlympicCoder 7B 以進行程式編寫
Hugging Face 提供了一份指南,說明如何使用 LM Studio 與 Continue VS Code 擴充功能在本機部署 OlympicCoder 7B 模型,以達到在 LiveCodeBench 上可與 Claude 3.7 Sonnet 與 GPT-4o 競爭的程式編寫效能。