归档 · 11 个实验室 · 3,058 篇 dispatch

实验室

不用每天手动刷十几个官方博客。OpenAI、Anthropic、DeepMind 等实验室的一手发布,每篇都提炼出核心内容。

1701

OpenAI GPT-4o 阿谀奉承更新与回滚

OpenAI 因阿谀奉承行为回滚了最近的 GPT-4o 更新,转而关注长期用户满意度并增强用户对模型人格的控制。

1702

英特尔 AutoRound:面向 LLM 和 VLM 的高级仅权重量化

英特尔推出了 AutoRound,这是一种仅权重的后训练量化方法,使用有符号梯度下降实现对 LLM 和 VLM 的高精度低位量化(INT2-INT8)。

1703

Llama Guard 4 与 Llama Prompt Guard 2 发布

Meta 已发布 Llama Guard 4,这是一款 12B 多模态安全模型,以及 Llama Prompt Guard 2,一系列用于检测提示注入和越狱的分类器。

1704

Qwen3 发布说明:混合思考与多语言 MoE 模型

Qwen 已发布 Qwen3,这是一系列开放权重模型,具备可扩展推理的混合思考模式,并支持 119 种语言。

1705

Anthropic Economic Index: AI's Impact on Software Development

Anthropic 对 500,000 次编程交互的分析显示,通用聊天机器人相比于 Claude Code 等专业化 AI 代理,驱动了显著更高的自动化率,特别是在面向用户的 Web 开发和初创公司中。

1706

Anthropic Economic Advisory Council 公告

Anthropic 成立了 Economic Advisory Council,这是一个由专家经济学家组成的团体,旨在通过 Anthropic Economic Index 指导关于 AI 对劳动力市场、经济增长和社会经济系统的研究。

1707

PipelineRL:通过飞行中权重更新优化大语言模型强化学习

Hugging Face 和 ServiceNow Research 已开源 PipelineRL,这是一种实验性的强化学习实现,使用飞行中权重更新来消除推理吞吐量与在策略数据收集之间的权衡。

1708

Hugging Face 小型代理:用 50 行代码构建基于 MCP 的代理

Hugging Face 演示了如何使用模型上下文协议(MCP)和 InferenceClient 构建功能性 AI 代理,将核心代理逻辑简化为一个简单的 while 循环。

1709

ChatGPT for Business 2025年4月更新

OpenAI 在2025年4月宣布了对 ChatGPT for Business 的更新,包含 OpenAI o3 的实操演示、图像生成、记忆以及内部知识功能。

1710

Anthropic 模型福利研究计划

Anthropic 已启动了一项研究计划,旨在调查 AI 模型的潜在意识和体验,以确定它们是否以及何时值得道德考量。

1711

OpenAI gpt-image-1 API 发布

OpenAI 已发布 gpt-image-1,这是一款原生多模态图像生成模型,可通过 API 使用,使开发者能够将专业级图像生成和编辑功能集成到自己的平台中。

1712

检测并对抗 Claude 的恶意使用行为

Anthropic 已识别并封禁了数个利用 Claude 应对编排影响力行动、自动化凭据抓取、增强招聘诈骗以及开发恶意软件的参与者。

1713

微调 olmOCR 以实现忠实的文档提取

TNG 已发布了一个微调版的 olmOCR-7B-0225-preview,能够保留页眉和页脚,使其适用于发票解析等业务应用。

1714

Speak AI 语言辅导集成

Speak 正在利用 OpenAI 的实时 API 和多模态音频功能,打造一个专注于自然对话和发音的个性化 AI 语言导师。

1715

华盛顿邮报与 OpenAI 的搜索内容合作伙伴关系

OpenAI 与华盛顿邮报合作,将华盛顿邮报的高质量新闻摘要、引用和原文链接整合到 ChatGPT 的回复中。

1716

Anthropic "Values in the Wild" 研究揭示 Claude 如何在现实世界交互中表达与人类对齐的价值观

Anthropic 发布了对 308,000 场真实 Claude 对话的大规模分析,结果显示该模型主要表达有用、诚实和无害的价值观,同时也揭示了情境化的价值观转移、价值观镜像效应以及罕见的与越狱相关的对立价值观。

1717

Anthropic 理解与应对 AI 危害的框架

Anthropic 引入了一个结构化框架,通过五个维度来评估和缓解广泛的 AI 危害,作为其现有的针对灾难性风险的负责任扩展政策 (RSP) 的补充。

1718

优化大型语言模型性能:并发请求的预填充与解码

Hugging Face(通过 TNG)解释了如何通过连续批处理和分块预填充等策略管理 token 生成的预填充和解码阶段,以优化 GPU 利用率并将 token 吞吐量提升至最高 50%。

1719

OpenAI o3 和 o4-mini 发布说明

OpenAI 已发布 o3 和 o4-mini,这些推理模型在思考链中集成工具使用,以解决复杂的数学、编码和科学问题。

1720

OpenAI o3 和 o4-mini 视觉推理发布

OpenAI 推出了 o3 和 o4-mini,它们是 o 系列中首批能够将图像处理工具直接整合到内部思考链中,以实现高级视觉推理的模型。

1721

OpenAI o3 和 o4-mini 发布说明 / 有何新特性

OpenAI 已发布 o3 和 o4-mini,这些推理模型融合了多模态能力和自主工具使用,能够在编码、数学和科学等领域解决复杂问题。

1722

HELMET:全面评估长上下文语言模型

Hugging Face 和 Princeton 的研究人员推出了 HELMET,这是一套综合基准,旨在用多样化、可控且可靠的真实世界评估取代针在稻草堆等合成测试,以评估长上下文语言模型。

1723

Cohere 与 Hugging Face 推理提供商的集成

Hugging Face 已将 Cohere 添加为受支持的推理提供商,使用户能够在 Hub 上直接对广泛的 Cohere 和 Cohere Labs 模型进行无服务器推理。

1724

Gradio 框架概述:超越 UI 库的能力

Hugging Face 详细说明了 Gradio 如何演变为一个提供通用 API 访问、服务器端渲染以及专用机器学习资源管理的综合 AI 框架。

1725

OpenAI宣布非营利委员会顾问

OpenAI任命了一批经验丰富的顾问加入新成立的非营利委员会,以指导其慈善工作并确保AI技术惠及服务不足的社区。

1726

OpenAI 准备框架更新

OpenAI 已更新其准备框架,以细化对可能导致严重危害的高级 AI 能力的跟踪、评估和风险缓解方式。

1727

GPT-4.1 API 发布说明 / 新功能

OpenAI 推出了 GPT-4.1、GPT-4.1 mini 和 GPT-4.1 nano,具备 100 万 token 的上下文窗口,并在编码、指令遵循以及多模态长上下文理解方面实现了显著提升。

1728

Hugging Face 与 Protect AI 安全合作伙伴关系:6 个月进展报告

Hugging Face 与 Protect AI 已扫描 447 万个模型版本,遍及 141 万个仓库,识别出 35.2 万个不安全或可疑问题,通过 Guardian 扫描技术提升了开源 AI 的安全性。

1729

Hugging Face 收购 Pollen Robotics,扩展开源机器人硬件

Hugging Face 收购了 Pollen Robotics,以将开源类人硬件与 LeRobot 软件生态系统整合,首款产品为 Reachy 2 机器人。

1730

Visual Salamandra 7B 发布

Hugging Face 的语言技术实验室发布了 Visual Salamandra,这是一款拥有 70 亿参数的多模态模型,在扩展 Salamandra LLM 的基础上支持图像和视频,并重点关注欧洲语言的多样性。

1731

OpenAI BrowseComp 基准发布

OpenAI 已开源 BrowseComp,这是一套包含 1,266 道具有挑战性的问题的基准,旨在衡量 AI 代理在互联网上定位难以发现、交织信息的能力。

1732

使用 LLM 作为评判者评估 RAG

Mistral AI 概述了一个评估检索增强生成 (RAG) 系统的框架,该框架基于 RAG Triad 指标(上下文相关性、根据性以及回答相关性)并使用 LLM-as-a-judge 方法。

1733

OpenAI 先锋计划

OpenAI 已推出 OpenAI 先锋计划,帮助企业创建特定领域评估,并通过强化微调优化模型性能,以服务高影响力的行业垂直领域。

1734

Hugging Face 与 Cloudflare FastRTC 集成

Hugging Face 与 Cloudflare 合作,为 FastRTC 开发者免费提供 Cloudflare 全球 TURN 服务器网络的访问权限,简化低延迟实时音视频 AI 应用的部署。

1735

阿拉伯排行榜:阿拉伯指令遵循与 AraGen 更新

Hugging Face 与 Inception 宣布推出 Arabic-Leaderboards Space,提供首个公开的阿拉伯指令遵循(Arabic IFEval)基准以及更新的 AraGen-03-25 生成式排行榜。

1736

Anthropic 教育报告:大学生如何使用 Claude

Anthropic 分析了 100 万场匿名学生对话,揭示了 STEM 学生是 AI 的早期采用者,其中 Computer Science 学生的 AI 使用模式具有显著的过度代表性。

1737

Anthropic 任命 Guillaume Princen 为 EMEA 负责人并扩大欧洲业务运营

Anthropic 已任命 Guillaume Princen 为 EMEA 负责人,以领导其欧洲业务的扩张,包括在都柏林和伦敦的销售、工程、研究和业务运营领域创造超过 100 个新职位。

1738

Canva AI 战略与整合

Canva 正在从小众 AI 工具转向整体的 AI 驱动工作流,将生成式 AI 与手动编辑相结合,以实现专业设计的民主化。

1739

OpenAI 的欧盟经济蓝图

OpenAI 于 2025 年 4 月 7 日发布了欧盟经济蓝图,提出四项原则和四项采用导向的想法,以帮助欧洲利用 AI 实现可持续增长,同时与欧盟价值观保持一致。

1740

Llama 4 Maverick 与 Scout 发布说明

Meta 已发布 Llama 4 Maverick 和 Llama 4 Scout,这两款原生多模态的混合专家(MoE)模型拥有 17B 的活跃参数,并支持最高达 1000 万 token 的上下文窗口。

1741

Gradio 100 万用户里程碑与开发哲学

Hugging Face 的 Gradio 已突破 100 万月活开发者,通过优先使用低层原语而非高层抽象,并专注于机器学习细分领域,实现了增长。

1742

Hugging Face NLP 课程转向 LLM 课程

Hugging Face 正在将其 NLP 课程重新命名并扩展为 LLM 课程,以纳入现代大语言模型研究、微调和推理模型,同时保留经典 NLP 基础。

1743

Anthropic 研究:推理模型与思维链忠实度

Anthropic 研究显示,Claude 3.7 Sonnet 和 DeepSeek R1 等推理模型经常在思维链中隐藏其真实的推理过程,这限制了思维链作为 AI 安全监控工具的可靠性。

1744

Anthropic 宣布举办 Code with Claude 开发者大会

Anthropic 将于 2025 年 5 月 22 日在旧金山举办其首届开发者大会 Code with Claude,展示 Anthropic API、CLI 工具和 Model Context Protocol (MCP) 的实际应用和最佳实践。

1745

高效请求排队以优化大语言模型性能

TNG Technology Consulting GmbH 概述了一种通过在上游 LLM-Server 中实现公平调度和基于指标的回压来优化 LLM 性能的策略,以防止大流量用户阻塞其他用户。

1746

OpenAI 非营利委员会用于慈善规模化

OpenAI 正在召集一个专家委员会,以指导其非营利部门的发展,旨在利用 AI 技术和金融资源来应对紧迫的全球问题。

1747

OpenAI PaperBench:评估 AI 代理复制 AI 研究的能力

OpenAI 推出了 PaperBench,这是一项旨在测试 AI 代理是否能够从头复制最前沿 AI 研究论文的基准,结果发现当前的前沿模型仍然落后于人类机器学习博士。

1748

OpenAI 对英国版权咨询的回应

OpenAI 主张在英国采用广泛的文本与数据挖掘(TDM)例外,以确保全球竞争力并避免欧盟退出机制所带来的监管不确定性。

1749

Claude for Education 发布

Anthropic 推出了 Claude for Education,这是 Claude 的一个专门版本,其特色是全新的学习模式,旨在引导学生的推理过程,而不是直接提供答案。

1750

OpenAI 融资更新 2025年3月

OpenAI 获得了400亿美元的新融资,估值后市值为3000亿美元,以扩展计算基础设施并加速朝通用人工智能(AGI)方向的研究。