1201

Qwen2.5-Math-PRM 和 ProcessBench 发布

Qwen 发布了 Qwen2.5-Math-PRM-7B 和 72B,这些是最先进的过程奖励模型,旨在识别数学问题求解中的中间推理错误,同时发布了 ProcessBench,一个新的逐步评估基准。

1202

Hugging Face AI 代理伦理与框架分析

Hugging Face 提供了一个全面的框架来理解 AI 代理,认为风险随着自主性的增加而增加,并建议不要开发完全自主的代理。

1203

Hugging Face 发布 vdr-2b-multi-v1 多语言视觉文档检索模型

Hugging Face 推出了 vdr-2b-multi-v1,这是一个用于视觉文档检索的多语言嵌入模型,通过将页面截图编码为密集向量,实现无需 OCR 即可搜索复杂文档。

1204

Hugging Face Open LLM Leaderboard:CO₂ 排放与模型性能分析

Hugging Face 揭示,由于更高的简洁性和更强的指令遵循能力,社区微调模型通常比官方发布版本表现出更高的碳效率。

1205

Hugging Face smolagents 发布

Hugging Face 已推出 smolagents,一个轻量级库,使 LLMs 能够通过将动作写为可执行代码而非 JSON 来执行复杂任务,从而提升可组合性和通用性。

1206

OpenAI 公司结构演变

OpenAI 计划将其营利性部门转变为特拉华州公益公司,以更好地吸引资本并维持其非营利使命,即确保通用人工智能(AGI)造福全人类。

1207

QVQ-72B-Preview 发布

Qwen 发布了 QVQ-72B-Preview,一个基于 Qwen2-VL-72B 的开放权重多模态推理模型,在 MMMU 基准测试中取得了 70.3 分。

1208

可视化并理解 PyTorch 中的 GPU 内存 – Hugging Face 博客摘要

Hugging Face 的博客文章解释了如何使用 torch.cuda.memory 工具在 PyTorch 中可视化 GPU 内存使用情况,分解了模型训练期间的内存组成部分,并提供了估算总内存需求的公式。

1209

NVIDIA LogitsProcessorZoo: 使用模块化 Logits 处理器控制语言模型生成

NVIDIA 的 LogitsProcessorZoo 为 Hugging Face Transformers 提供了模块化的 Logits 处理器,使开发者能够控制生成长度、强制短语包含、引用提示内容,并将输出限制为多选答案。

1210

审慎对齐:推理使语言模型更安全

OpenAI 提出审慎对齐,这是一种训练范式,它教导 o 系列模型在显式安全规范上进行推理,从而提高安全性,并相比之前的模型减少了欠拒绝和过度拒绝。

1211

Big Bench Audio 发布

Artificial Analysis 发布了 Big Bench Audio,这是一个由 1,000 个音频问题组成的数据集,旨在评估音频语言模型的推理能力,揭示了文本和语音推理之间的显著性能差距。

1212

ModernBERT 发布说明

Hugging Face、Answer.AI 和 LightOn 发布了 ModernBERT,这是一个最先进的仅编码器模型系列,在 BERT 的速度、准确性和上下文长度(达到 8,192 个标记)方面有所提升。

1213

Bamba-9B: 推理高效的 Hybrid Mamba2 模型

Bamba-9B 是由 IBM、普林斯顿大学、CMU 和 UIUC 开发的 hybrid Mamba2 模型,基于 2.2T 开放 token 训练。在 vLLM 中,其吞吐量比 Llama 3.1 8B 高出 2.5 倍,延迟降低了 2 倍,并可立即在 transformers、vLLM、TRL 和 llama.cpp 中使用。

1214

基于 GCP 的第五代 Xeon 的语言模型性能基准测试

Hugging Face 在 Google Cloud 的 C4(第五代 Xeon)和 N2(第三代 Xeon)实例上对文本嵌入和生成进行了基准测试,发现 C4 的嵌入吞吐量比 N2 高 10‑24×,生成吞吐量高 2.3‑3.6×,分别带来 7‑19× 和 1.7‑2.9× 的总体拥有成本优势。

1215

OpenAI o1 和开发者工具更新 2024年12月

OpenAI 已在 API 中发布了生产就绪的 o1 推理模型,通过 DPO 引入了偏好微调(Preference Fine-Tuning),并对 Realtime API 进行了更新,加入 WebRTC 支持并大幅降低价格。

1216

Hugging Face 合成数据生成器

Hugging Face 已推出 Synthetic Data Generator,这是一个无代码应用程序,允许用户使用自然语言提示创建自定义文本分类和聊天数据集。

1217

OpenAI 时间线:埃隆·马斯克提议的营利性结构及其退出

OpenAI 发布了详细的时间线和内部通信,揭示了埃隆·马斯克在 2017 年曾积极寻求在自己的绝对控制下将 OpenAI 转型为营利实体。

1218

LeMaterial v1.0: LeMat-Bulk 数据集发布

LeMaterial v1.0 作为一项开源倡议正式发布,推出了 LeMat-Bulk 数据集。该数据集将来自 Materials Project、Alexandria 和 OQMD 的 670 万条条目统一到一种具有七种属性的标准格式中,旨在加速材料发现。

1219

Sora 已来临 – OpenAI 发布带有新界面和订阅访问的视频生成模型 Sora Turbo

OpenAI 宣布发布 Sora Turbo,这是一种更快的视频生成模型,作为独立产品面向 ChatGPT Plus 和 Pro 用户提供,具备新界面、最高 1080p 分辨率和 20 秒片段以及内置安全措施。

1220

Hugging Face 文本到图像生成的开放偏好数据集

Data is Better Together 社区已发布一个采用 Apache 2.0 许可证的开放偏好数据集,用于文本到图像生成,以解决开源偏好数据缺乏以进行模型对齐的问题。

1221

Hugging Face 模型在 Amazon Bedrock 市场

Hugging Face 已将 83 个开放模型集成到 Amazon Bedrock 市场,使 AWS 客户能够在托管基础设施上部署开放模型,同时保持与 Bedrock API 的兼容性。

1222

OpenAI Sora: 为动画师 Lyndon Barrois 提供的创意工作流集成

动画师 Lyndon Barrois 使用 OpenAI Sora 绕过传统工作室制作流程,实现想象直接转化为高保真视频内容。

1223

Vallée Duhamel 和 Sora

OpenAI 强调了 Vallée Duhamel 对 Sora 视频生成模型的艺术视角,尽管该产品已被标注为在 2026年4月26日 不再可用。

1224

OpenAI Sora 系统卡

OpenAI 已发布 Sora 的系统卡,Sora 是其视频生成模型,能够使用 diffusion-transformer 架构在 1080p 分辨率下生成最长 20 秒的视频。

1225

Minne Atairu 和 Sora

跨学科艺术家 Minne Atairu 使用 OpenAI 的 Sora 挑战父权制图像并重新定义文化图标。

1226

OpenAI 产品团队 AI 集成

OpenAI 已发布一场网络研讨会和指南,旨在将 AI 集成到产品团队工作流程中,以提高生产力和产品开发。

1227

ChatGPT Pro 发布

OpenAI 推出了 ChatGPT Pro,这是一种每月 200 美元的订阅计划,提供对 o1、o1-mini、GPT-4o 的无限访问,以及用于解决复杂问题的高计算 'o1 pro mode'。

1228

OpenAI o1 系统卡

OpenAI 发布了 o1 系统卡,详细介绍了其思维链推理模型、安全性评估,以及在准备框架下被评为说服力和 CBRN 中风险、网络安全和模型自主性低风险的情况。

1229

PaliGemma 2 发布说明

Google 发布了 PaliGemma 2,这是一个新的视觉语言模型系列,将 SigLIP 图像编码器与 Gemma 2 文本解码器结合,覆盖三种参数规模和多种输入分辨率。

1230

LLM 修复错误的能力如何?使用 Keras 和 TPUs 进行的聊天机器人竞技场实验

Hugging Face 在一个简单的日历 API 任务上测试了多个 10B 以下的 LLM,发现 Gemma 2 9B 能够以极少的提示词持续修复错误,而较小和较旧的模型则表现挣扎或需要多次纠正轮次。

1231

OpenAI 和 Future 专业内容战略合作

OpenAI 和 Future 已建立合作伙伴关系,将 Future 超过 200 家专业媒体品牌的内容整合到 ChatGPT 中,为用户提供可靠的专业信息,并扩大出版商的分发覆盖范围。

1232

摩根士丹利 AI 集成与评估框架

摩根士丹利与 OpenAI 合作部署了由 GPT-4 和 Whisper 驱动的工具,通过一个专注于可靠性和合规性的严格评估框架,实现了 98% 的顾问采用率。

1233

AraGen 基准和排行榜:为阿拉伯语大语言模型引入 3C3H 评估

Hugging Face 推出了 AraGen,一个用于阿拉伯语大语言模型的动态基准和排行榜,使用 3C3H 衡量标准来评估正确性、完整性、简洁性、有用性、诚实性和无害性。

1234

Hugging Face CFM 案例研究:利用 LLM 见解对小模型进行微调

Capital Fund Management (CFM) 通过使用 Llama 3.1 辅助标注数据来微调诸如 GLiNER 和 SpanMarker 等紧凑模型,将金融命名实体识别(NER)的准确率提高了最高 6.4%,并将推理成本降低了最高 80倍。

1235

开源开发者指南:欧盟 AI 法案

Hugging Face 指南解释了欧盟 AI 法案如何适用于开源 AI 开发者,概述了有限风险 AI 系统和非系统性风险通用人工智能模型的义务,并指向合规工具。

1236

QwQ-32B-Preview: 探索深度推理能力

Qwen 已经推出 QwQ-32B-Preview,这是一个专为通过内部思维链过程进行深度推理和复杂问题解决而设计的模型。

1237

Hugging Face Hub 存储重构

Hugging Face 通过引入内容寻址存储(CAS)正在重新设计其上传和下载架构,以实现字节级去重并提升巨型 AI 模型的全球传输速度。

1238

SmolVLM 发布说明 / 新功能

Hugging Face 发布了 SmolVLM,一个具有 2B 参数的视觉语言模型(VLM),完全开源,并针对边缘设备的低内存占用和高吞吐量进行了优化。

1239

你本来可以设计出最先进的位置编码

Hugging Face 博客文章逐步介绍了 Transformer 的位置编码的迭代设计,展示了正弦编码如何导致旋转位置编码(RoPE),以及它为何对建模 token 关系很重要。

1240

结合人员与 AI 推进红队工作 – OpenAI 的方法及其在 o1 系列上的应用

OpenAI 发布了一份白皮书,详细阐述了其针对 AI 模型的外部红队流程,并将其应用于为 OpenAI o1 系列模型的公开发布做准备。

1241

Grab GPT-4o 视觉微调 用于 GrabMaps

Grab 已实施 GPT-4o 视觉微调,以自动化 GrabMaps 中交通标志和车道计数的定位,使限速标志定位提高了 13%,车道计数准确性提高了 20%。

1242

Hugging Face 和 LLM-jp 发布开放的日语 LLM 排行榜

Hugging Face 和 LLM-jp 推出了开放的日语 LLM 排行榜,这是一个透明的评估平台,包含超过 20 个数据集,用于基准测试日语大型语言模型的性能。

1243

Hugging Face 引入内容定义分块以提升存储效率

Hugging Face 通过其 Xet 团队宣布了一种内容定义分块存储方法,通过仅上传已修改的块来降低大型模型和数据集文件的存储和传输成本。

1244

使用自推测解码的更快文本生成

Hugging Face 通过 LayerSkip 引入了自推测解码,这是一种使用单个 LLM 的早期层进行草稿、后期层进行验证的方法,以提高生成速度并降低内存开销。

1245

FlagEval 辩论:一种新的多语言 LLM 评估框架

BAAI 已推出 FlagEval 辩论,一个动态评估平台,LLM 在其中进行多语言辩论,以更好地评估推理、逻辑和对抗能力。

1246

Rox 收入平台与 OpenAI 集成

Rox 使用 OpenAI 的 API 推出了一款 AI 驱动的收入管理平台,通过 AI 代理群系统自动化数据统一、销售工作流程和账户监控。

1247

Hugging Face Judge Arena: 将 LLM 作为评估器进行基准测试

Hugging Face 推出了 Judge Arena,这是一个通过人类投票来确定哪些 LLM 在评估其他 AI 生成的响应方面最有效的众包平台。

1248

OpenAI 在巴黎开设办事处以扩展法国 AI 生态系统

OpenAI 已在巴黎开设新办事处,以支持法国组织、初创公司和政府合作中 AI 的快速采用。

1249

Qwen2.5-Turbo 1M Token 上下文长度发布

Qwen 发布了 Qwen2.5-Turbo,将模型的上下文窗口扩展到 100 万个 token,同时显著提升推理速度,并在短序列任务上保持竞争力的性能。

1250

雅诗兰黛公司 ChatGPT Enterprise 实施

雅诗兰黛公司已部署 ChatGPT Enterprise 来分析超过75年的消费者和临床数据,创建了超过240个自定义 GPT,以加速产品开发和市场响应能力。