Zendesk 與 OpenAI:向主動式 AI 代理人轉型以提升客服服務
Zendesk 正在試行一種由 OpenAI 模型驅動、使用生成式推理與多代理人架構的全新 AI 代理人,以自動化高達 80% 的客服解決方案。
DeepSeek-V3-0324 發佈說明
DeepSeek 已發佈 DeepSeek-V3-0324,這是 R1 的基礎模型更新版本,在 MIT 授權下具備改進的指令遵循、程式碼與數學能力。
Qwen2.5‑Omni 發布:即時互動的端到端多模態模型
Qwen 已發布 Qwen2.5‑Omni,一款端到端多模態模型,能處理文字、圖像、音訊與影片,並即時產生串流文字與自然語音回應。
OpenAI 針對 AGI 開發的安全策略
OpenAI 正在實施一個多層次的安全框架,結合 AI 驅動的防禦、持續的紅隊測試以及零信任架構,以保護基礎設施和新興的 AI 代理,並在邁向 AGI 的過程中提供防護。
使用 Sentence Transformers 訓練與微調重新排序模型
Hugging Face 提供了透過 Sentence Transformers 訓練與微調 Cross Encoder 重新排序模型的完整指南與框架,以優化領域特定檢索效能。
OpenAI GPT-4o 影像生成發布
OpenAI 已將原生影像生成整合至 GPT-4o,使其能在單一多模態模型中實現精確文字渲染、多輪細化以及高保真寫實影像。
GPT-4o 圖像生成系統卡片附錄
OpenAI 已在 GPT-4o 中原生嵌入一項新的圖像生成功能,使其能夠產生照片級真實感的輸出、進行圖像到圖像的轉換,以及精確渲染文字。
Hebbia Matrix:使用多代理 AI 自動化金融與法律工作流程
Hebbia 推出 Matrix,一個由 OpenAI 的 o1、o3-mini 與 GPT-4o 提供動力的多代理 AI 平台,透過克服離線資料的 RAG 限制,將金融與法律工作自動化至最高 90%。
OpenAI 2025 年 3 月領導層更新
OpenAI 擴大了 Mark Chen、Brad Lightcap 與 Julia Villagra 的職務,以更好地整合研究與產品開發,並擴大全球營運規模。
Gradio Dataframe 更新:新功能與增強
Hugging Face 已更新 Gradio 中的 gr.Dataframe 元件,加入多儲存格選取、欄位固定、搜尋與篩選功能,以及提升的可及性。
Qwen2.5-VL-32B 發布說明
Qwen 已發布 Qwen2.5-VL-32B-Instruct,一款透過強化學習優化的視覺語言模型,具備卓越的數學推理能力、細緻的影像理解以及符合人類偏好的回應。
OpenAI 與 MIT Media Lab 關於 ChatGPT 情感使用的研究
OpenAI 與 MIT Media Lab 針對情感使用(與 AI 的情緒互動)進行了研究,發現雖然此類使用在實際使用中較為罕見,但其對福祉的影響會因使用者行為、互動模式與個人情況而有所不同。
Hugging Face 推理端點分析更新
Hugging Face 已更新其推理端點分析儀表板,加入即時指標、可自訂時間範圍以及詳細的副本生命週期檢視,以提升監控與除錯效能。
Booking.com 與 OpenAI 個人化整合
Booking.com 已整合 OpenAI 的 GPT 模型,透過 AI 旅行規劃師、智慧篩選與自動化評論摘要,改變旅遊探索與預訂方式。
OpenAI 次世代音訊模型 API 發佈
OpenAI 在其 API 中發布了全新的語音轉文字與文字轉語音模型,具備提升的轉錄準確度以及可操控的合成聲音,供語音代理人使用。
Open R1:在本機執行 OlympicCoder 7B 以進行程式編寫
Hugging Face 提供了一份指南,說明如何使用 LM Studio 與 Continue VS Code 擴充功能在本機部署 OlympicCoder 7B 模型,以達到在 LiveCodeBench 上可與 Claude 3.7 Sonnet 與 GPT-4o 競爭的程式編寫效能。
Hugging Face 回應白宮 AI 行動計畫資訊徵求
Hugging Face 主張開源與開放科學在 AI 發展中的根本角色,指出開放模型在效能與效率上正日益匹敵或超越封閉的商業系統。
EliseAI: 透過 OpenAI 提升住房與醫療效率
EliseAI 利用 OpenAI 的 GPT-4 和 Whisper 模型,自動化住房與醫療產業中的複雜對話工作流程,以提升運營效率。
ChatGPT for Business 三月 2025 更新
OpenAI 在 2025 年三月為 ChatGPT for Business 引入了新功能,包括 Canvas、深度研究工具和 OpenAI o1 pro 模式。
NVIDIA GTC 2025 Physical AI 發布: Cosmos Transfer, Physical AI Dataset, 和 Isaac GR00T N1
NVIDIA 已發布 Cosmos Transfer 用於可控世界場景生成,一個 15TB Physical AI Dataset,以及 Isaac GR00T N1,這是首個用於通用類人機器人推理的開放基礎模型。
Hugging Face Xet 儲存整合
Hugging Face 已開始將儲存庫從 LFS 遷移至 Xet 儲存,利用內容定義分塊顯著減少大型 AI 模型與資料集的上傳與下載時間。
OpenAI 對埃隆·馬斯克訴訟法院裁決的回應
OpenAI 宣布,法院已駁回埃隆·馬斯克對初步禁令的請求,並駁回其多項主張,進一步肯定 OpenAI 維持其非營利實體的承諾。
LY Corporation 與 OpenAI 合作
LY Corporation 正利用 OpenAI 的 API 和 GPT-4o 在其 LINE 和 Yahoo! JAPAN 平台上整合生成式 AI,預計年度銷售額增加 110B 日元,生產力提升 10B 日元。
Gemma 3 版本說明 / 新功能
Google 已發布 Gemma 3,這是一個多模態、多語言的開放權重 LLM 家族,參數規模從 1B 到 27B,上下文視窗可達 128k 個 token。
OpenAI 新工具用於建構代理
OpenAI 已發布一套新的代理構建工具,包括 Responses API、開源 Agents SDK,以及用於網頁搜尋、檔案搜尋和電腦使用的內建工具。
LeRobot L2D: 世界最大的開源自駕數據集
Hugging Face 和 Yaak 已發布 Learning to Drive (L2D),一個多模態自駕數據集,包含來自 30 個德國城市的超過 5,000 小時駕駛數據,以實現端到端的空間智能訓練。
OpenAI 鏈式思維監控用於獎勵駭客檢測
OpenAI 發現監控鏈式思維(CoT)推理可以檢測前沿模型中的獎勵駭客和錯誤行為,但直接優化 CoT 以抑制不良思維可能導致模型隱藏其意圖。
Nubank 整合 OpenAI GPT-4o 用於客戶服務與詐騙偵測
Nubank 正利用 OpenAI 的 GPT-4o 與 GPT-4o mini 自動化處理 55% 的 Tier 1 客戶詢問,將聊天回覆時間縮短 70%,並透過視覺分析增強詐騙偵測。
邊緣 LLM 推理:透過 React Native 執行本地 LLM
Hugging Face 提供一份全面指南,使用 React Native 和 llama.rn 在 Android 和 iOS 上本地運行量化的 GGUF 模型,以構建注重隱私的移動應用程式。
Factory 軟體開發平台搭載 OpenAI 推理模型
Factory 利用 OpenAI o1、o3-mini 和 GPT-4o 將功能開發週期加速 2-4 倍,並將情境切換時間減少 60%。
QwQ-32B 版本說明 / 新功能
Qwen 已發布 QwQ-32B,這是一個 320 億參數的推理模型,利用縮放強化學習來達到與更大的 DeepSeek-R1 相媲美的性能。
LaunchDarkly 的 AI 驅動產品管理方法
LaunchDarkly 的產品與技術總監 Claire Vo 說明 AI 如何自動化傳統產品管理任務,並將角色推向商業總經理或整合技術領導的方向。
OpenAI NextGenAI 聯盟啟動
OpenAI 已啟動 NextGenAI,這是一個由 15 家研究機構組成的聯盟,獲得 $50 million 的研究補助金、運算資金和 API 存取權的支持,以加速 AI 驅動的研究與教育。
Aya Vision: 以 8B 與 32B 模型推進多語言多模態
Cohere For AI 已發布 Aya Vision,一系列支援 23 種語言的開放權重視覺語言模型(8B 與 32B),在多語言多模態任務中優於更大的模型。
Hugging Face 與 JFrog 合作以提升 AI 模型安全性
Hugging Face 已將 JFrog 的掃描器整合到 Hugging Face Hub,以減少誤報並偵測模型權重中各種序列化格式內的惡意程式碼。
OpenAI 與美國國家實驗室 1,000 位科學家 AI Jam Session
OpenAI 與美國能源部在九個國家實驗室舉辦「1,000 位科學家 AI Jam Session」,利用前沿 AI 模型(如 o3-mini)加速科學發現。
追蹤與評估 smolagents 與 Arize Phoenix
Hugging Face 示範如何結合 Arize Phoenix 與 smolagents,實作即時追蹤與 LLM-as-a-judge 評估,以支援代理工作流程的可觀測性與效能衡量。
Mercari 與 GPT-4o mini 的 AI 整合
Mercari 已將 GPT-4o mini 與其他 OpenAI 模型整合,以自動化產品列表生成並優化銷售建議,從而提升列表轉換率和每位使用者的平均銷售額。
OpenAI GPT-4.5 研究預覽
OpenAI 已發布 GPT-4.5,這是一個大規模通用模型,旨在提供更廣泛的知識、提升情感智能並減少幻覺,相較於 GPT-4o。
使用 o1 和 o3-mini 建構自主財務分析師
Endex 正利用 OpenAI 的 o1 和 o3-mini 推理模型來構建一個能夠進行複雜資料合成、多模態分析和精確財務推理的自主 AI 財務分析師。
Hugging Face 與 IISc 合作開源 Vaani 資料集
Hugging Face 已與印度科學學院(IISc)和 ARTPARK 合作,提供全球存取 Vaani 的途徑,Vaani 是一個龐大的多模態、多語言資料集,旨在代表印度的語言多樣性。
OpenAI Deep Research 系統卡
OpenAI 已推出 Deep Research,這是一種由早期版本 o3 優化以進行網頁瀏覽的代理能力,用於執行複雜任務的多步驟網際網路研究。
FastRTC:Python 即時通訊函式庫
Hugging Face 發布了 FastRTC,這是一個 Python 函式庫,旨在透過處理 WebRTC 與 WebSocket 通訊層,簡化即時音訊與視訊 AI 應用程式的開發。
QwQ-Max-Preview 發布
Qwen 已推出 QwQ-Max-Preview,這是一個基於 Qwen2.5-Max 的預覽推理模型,在數學、編碼和 Agent 相關工作流程中表現出色。
Hugging Face 遠端 VAEs 用於推理端點
Hugging Face 推出了一項實驗功能,將 VAE 解碼過程委派給遠端端點,以降低在消費級 GPU 上進行高解析度圖像和影像合成所需的 VRAM 需求。
OpenAI 阻斷惡意使用 AI
OpenAI 已發布一份報告,詳細說明其為阻斷惡意使用 AI 所做的努力,重點在於防止國家關聯的威脅行為者和威權政權利用 AI 進行隱密影響行動和網路活動。
SigLIP 2 版本說明 / 新功能
Google 已發布 SigLIP 2,這是一系列多語言視覺-語言編碼器,在零樣本分類、圖像-文本檢索以及 VLM 轉移性能方面,在所有規模上都優於原始 SigLIP。
Uber AI 整合適用於隨需服務
Uber 使用 OpenAI 的技術來個人化使用者互動、自動化複雜的市場解決方案,並透過 AI 驅動的副駕駛提升員工生產力。
SmolVLM2: 讓每台設備都能理解影片
Hugging Face 已發布 SmolVLM2,這是一系列高效的視覺與影片語言模型,參數規模為 2.2B、500M 和 256M,旨在讓從手機到伺服器的設備能夠在本地進行影片理解。
PaliGemma 2 Mix 發布說明
Google 已發布 PaliGemma 2 mix,一系列在包括 OCR、字幕生成和物體偵測等多樣化任務上進行微調的視覺語言模型,以展示 PaliGemma 2 預訓練檢查點的潛力。