1051

OpenAI gpt-image-1 API 发布

OpenAI 已发布 gpt-image-1,这是一款原生多模态图像生成模型,可通过 API 使用,使开发者能够将专业级图像生成和编辑功能集成到自己的平台中。

1052

微调 olmOCR 以实现忠实的文档提取

TNG 已发布了一个微调版的 olmOCR-7B-0225-preview,能够保留页眉和页脚,使其适用于发票解析等业务应用。

1053

Speak AI 语言辅导集成

Speak 正在利用 OpenAI 的实时 API 和多模态音频功能,打造一个专注于自然对话和发音的个性化 AI 语言导师。

1054

华盛顿邮报与 OpenAI 的搜索内容合作伙伴关系

OpenAI 与华盛顿邮报合作,将华盛顿邮报的高质量新闻摘要、引用和原文链接整合到 ChatGPT 的回复中。

1055

优化大型语言模型性能:并发请求的预填充与解码

Hugging Face(通过 TNG)解释了如何通过连续批处理和分块预填充等策略管理 token 生成的预填充和解码阶段,以优化 GPU 利用率并将 token 吞吐量提升至最高 50%。

1056

OpenAI o3 和 o4-mini 发布说明

OpenAI 已发布 o3 和 o4-mini,这些推理模型在思考链中集成工具使用,以解决复杂的数学、编码和科学问题。

1057

OpenAI o3 和 o4-mini 视觉推理发布

OpenAI 推出了 o3 和 o4-mini,它们是 o 系列中首批能够将图像处理工具直接整合到内部思考链中,以实现高级视觉推理的模型。

1058

OpenAI o3 和 o4-mini 发布说明 / 有何新特性

OpenAI 已发布 o3 和 o4-mini,这些推理模型融合了多模态能力和自主工具使用,能够在编码、数学和科学等领域解决复杂问题。

1059

HELMET:全面评估长上下文语言模型

Hugging Face 和 Princeton 的研究人员推出了 HELMET,这是一套综合基准,旨在用多样化、可控且可靠的真实世界评估取代针在稻草堆等合成测试,以评估长上下文语言模型。

1060

Cohere 与 Hugging Face 推理提供商的集成

Hugging Face 已将 Cohere 添加为受支持的推理提供商,使用户能够在 Hub 上直接对广泛的 Cohere 和 Cohere Labs 模型进行无服务器推理。

1061

Gradio 框架概述:超越 UI 库的能力

Hugging Face 详细说明了 Gradio 如何演变为一个提供通用 API 访问、服务器端渲染以及专用机器学习资源管理的综合 AI 框架。

1062

OpenAI宣布非营利委员会顾问

OpenAI任命了一批经验丰富的顾问加入新成立的非营利委员会,以指导其慈善工作并确保AI技术惠及服务不足的社区。

1063

OpenAI 准备框架更新

OpenAI 已更新其准备框架,以细化对可能导致严重危害的高级 AI 能力的跟踪、评估和风险缓解方式。

1064

GPT-4.1 API 发布说明 / 新功能

OpenAI 推出了 GPT-4.1、GPT-4.1 mini 和 GPT-4.1 nano,具备 100 万 token 的上下文窗口,并在编码、指令遵循以及多模态长上下文理解方面实现了显著提升。

1065

Hugging Face 与 Protect AI 安全合作伙伴关系:6 个月进展报告

Hugging Face 与 Protect AI 已扫描 447 万个模型版本,遍及 141 万个仓库,识别出 35.2 万个不安全或可疑问题,通过 Guardian 扫描技术提升了开源 AI 的安全性。

1066

Hugging Face 收购 Pollen Robotics,扩展开源机器人硬件

Hugging Face 收购了 Pollen Robotics,以将开源类人硬件与 LeRobot 软件生态系统整合,首款产品为 Reachy 2 机器人。

1067

Visual Salamandra 7B 发布

Hugging Face 的语言技术实验室发布了 Visual Salamandra,这是一款拥有 70 亿参数的多模态模型,在扩展 Salamandra LLM 的基础上支持图像和视频,并重点关注欧洲语言的多样性。

1068

OpenAI BrowseComp 基准发布

OpenAI 已开源 BrowseComp,这是一套包含 1,266 道具有挑战性的问题的基准,旨在衡量 AI 代理在互联网上定位难以发现、交织信息的能力。

1069

OpenAI 先锋计划

OpenAI 已推出 OpenAI 先锋计划,帮助企业创建特定领域评估,并通过强化微调优化模型性能,以服务高影响力的行业垂直领域。

1070

Hugging Face 与 Cloudflare FastRTC 集成

Hugging Face 与 Cloudflare 合作,为 FastRTC 开发者免费提供 Cloudflare 全球 TURN 服务器网络的访问权限,简化低延迟实时音视频 AI 应用的部署。

1071

阿拉伯排行榜:阿拉伯指令遵循与 AraGen 更新

Hugging Face 与 Inception 宣布推出 Arabic-Leaderboards Space,提供首个公开的阿拉伯指令遵循(Arabic IFEval)基准以及更新的 AraGen-03-25 生成式排行榜。

1072

Canva AI 战略与整合

Canva 正在从小众 AI 工具转向整体的 AI 驱动工作流,将生成式 AI 与手动编辑相结合,以实现专业设计的民主化。

1073

OpenAI 的欧盟经济蓝图

OpenAI 于 2025 年 4 月 7 日发布了欧盟经济蓝图,提出四项原则和四项采用导向的想法,以帮助欧洲利用 AI 实现可持续增长,同时与欧盟价值观保持一致。

1074

Llama 4 Maverick 与 Scout 发布说明

Meta 已发布 Llama 4 Maverick 和 Llama 4 Scout,这两款原生多模态的混合专家(MoE)模型拥有 17B 的活跃参数,并支持最高达 1000 万 token 的上下文窗口。

1075

Gradio 100 万用户里程碑与开发哲学

Hugging Face 的 Gradio 已突破 100 万月活开发者,通过优先使用低层原语而非高层抽象,并专注于机器学习细分领域,实现了增长。

1076

Hugging Face NLP 课程转向 LLM 课程

Hugging Face 正在将其 NLP 课程重新命名并扩展为 LLM 课程,以纳入现代大语言模型研究、微调和推理模型,同时保留经典 NLP 基础。

1077

高效请求排队以优化大语言模型性能

TNG Technology Consulting GmbH 概述了一种通过在上游 LLM-Server 中实现公平调度和基于指标的回压来优化 LLM 性能的策略,以防止大流量用户阻塞其他用户。

1078

OpenAI 非营利委员会用于慈善规模化

OpenAI 正在召集一个专家委员会,以指导其非营利部门的发展,旨在利用 AI 技术和金融资源来应对紧迫的全球问题。

1079

OpenAI PaperBench:评估 AI 代理复制 AI 研究的能力

OpenAI 推出了 PaperBench,这是一项旨在测试 AI 代理是否能够从头复制最前沿 AI 研究论文的基准,结果发现当前的前沿模型仍然落后于人类机器学习博士。

1080

OpenAI 对英国版权咨询的回应

OpenAI 主张在英国采用广泛的文本与数据挖掘(TDM)例外,以确保全球竞争力并避免欧盟退出机制所带来的监管不确定性。

1081

OpenAI 融资更新 2025年3月

OpenAI 获得了400亿美元的新融资,估值后市值为3000亿美元,以扩展计算基础设施并加速朝通用人工智能(AGI)方向的研究。

1082

Hugging Face 使用 Infisical 的机密管理扩展

Hugging Face 迁移至 Infisical,以在多云环境中实现机密管理的集中化,消除机密散乱,并通过自动化的 Kubernetes 集成和 RBAC 提升安全性。

1083

文本生成推理 (TGI) Intel Gaudi 集成

Hugging Face 已将 Intel Gaudi 硬件支持直接集成到 Text Generation Inference (TGI) 主代码库中,为在 Intel AI 加速器上运行 LLM 提供了生产就绪的服务解决方案。

1084

QVQ-Max 视觉推理模型发布

Qwen 已发布 QVQ-Max,这是一款能够分析图像和视频,以解决数学、编程和创意任务中复杂问题的视觉推理模型。

1085

Zendesk 与 OpenAI:向主动 AI 代理转型以提升客户服务

Zendesk 正在试点一类由 OpenAI 模型驱动的 AI 代理,利用生成式推理和多代理架构,实现高达 80% 的客户服务解决方案自动化。

1086

DeepSeek-V3-0324 发布说明

DeepSeek 发布了 DeepSeek-V3-0324,这是 R1 的基座模型更新版本,采用 MIT 许可证,并在指令遵循、编程和数学能力方面有所提升。

1087

Qwen2.5-Omni 发布:用于实时交互的端到端多模态模型

Qwen 发布了 Qwen2.5-Omni,这是一款端到端多模态模型,能够处理文本、图像、音频和视频,以生成实时流式文本和自然语音响应。

1088

OpenAI 面向 AGI 开发的安全策略

OpenAI 正在实施一个多层次的安全框架,结合 AI 驱动的防御、持续的红队演练以及零信任架构,以在向 AGI 迈进的过程中保护基础设施和新兴的 AI 代理。

1089

使用 Sentence Transformers 训练和微调重新排序模型

Hugging Face 通过 Sentence Transformers 提供了完整的指南和框架,用于训练和微调 Cross Encoder 重新排序模型,以优化特定领域的检索性能。

1090

OpenAI GPT-4o 图像生成发布

OpenAI 已将原生图像生成集成到 GPT-4o 中,使其能够在单一多模态模型中实现精确的文本渲染、多轮细化以及高保真度的写实效果。

1091

GPT-4o 图像生成系统卡片附录

OpenAI 已在 GPT-4o 中原生嵌入了一种新的图像生成功能,能够实现照片级真实感输出、图像到图像的转换以及精确的文本渲染。

1092

Hebbia Matrix: 使用多代理 AI 自动化金融和法律工作流

Hebbia 推出了 Matrix,这是一款由 OpenAI 的 o1、o3-mini 和 GPT-4o 提供动力的多代理 AI 平台,通过克服离线数据的 RAG 限制,实现了金融和法律工作高达 90% 的自动化。

1093

OpenAI 领导层更新 2025年3月

OpenAI 已扩大 Mark Chen、Brad Lightcap 和 Julia Villagra 的职务,以更好地整合研究与产品开发并扩大全球运营。

1094

Gradio 数据框更新:新功能和增强

Hugging Face 已更新 Gradio 中的 gr.Dataframe 组件,新增多单元格选择、列固定、搜索与过滤功能,并提升了可访问性。

1095

Qwen2.5-VL-32B 发布说明

Qwen 已发布 Qwen2.5-VL-32B-Instruct,这是一款通过强化学习优化的视觉语言模型,具备卓越的数学推理能力、细粒度的图像理解以及符合人类偏好的响应。

1096

OpenAI 与 MIT Media Lab 关于 ChatGPT 情感使用的研究

OpenAI 与 MIT Media Lab 对情感使用——即与 AI 的情感交互——进行了研究,发现虽然此类使用在真实世界中很少见,但其对福祉的影响因用户行为、交互方式和个人情况而异。

1097

Hugging Face 推理端点分析更新

Hugging Face 更新了其推理端点分析仪表板,加入实时指标、可自定义时间范围以及详细的副本生命周期视图,以提升监控和调试能力。

1098

Booking.com 与 OpenAI 个性化集成

Booking.com 已集成 OpenAI 的 GPT 模型,通过 AI 行程规划器、智能筛选和自动化评论摘要,彻底改变旅行发现和预订方式。

1099

OpenAI 下一代音频模型 API 发布

OpenAI 在其 API 中发布了新的语音转文本和文本转语音模型,具备提升的转录准确性和可引导的合成语音,供语音代理使用。

1100

Open R1:在本地运行 OlympicCoder 7B 进行编码

Hugging Face 提供了一份指南,介绍如何使用 LM Studio 和 Continue VS Code 扩展在本地部署 OlympicCoder 7B 模型,以实现可与 Claude 3.7 Sonnet 和 GPT-4o 在 LiveCodeBench 上竞争的编码性能。