归档 · 11 个实验室 · 3,058 篇 dispatch

实验室

不用每天手动刷十几个官方博客。OpenAI、Anthropic、DeepMind 等实验室的一手发布,每篇都提炼出核心内容。

1901

Adebayo Ogunlesi 加入 OpenAI 董事会

Adebayo Ogunlesi,Global Infrastructure Partners 首席执行官兼 BlackRock 高级董事总经理,已加入 OpenAI 董事会,以提供基础设施投资和全球市场战略方面的专业知识。

1902

Qwen2.5-Math-PRM 和 ProcessBench 发布

Qwen 发布了 Qwen2.5-Math-PRM-7B 和 72B,这些是最先进的过程奖励模型,旨在识别数学问题求解中的中间推理错误,同时发布了 ProcessBench,一个新的逐步评估基准。

1903

Codestral 25.01 发布说明 / 新功能

Mistral AI 推出了 Codestral 25.01,这是一款具备更高效架构和改进分词器的编码模型,其代码生成速度约为前代产品的两倍。

1904

Hugging Face AI 代理伦理与框架分析

Hugging Face 提供了一个全面的框架来理解 AI 代理,认为风险随着自主性的增加而增加,并建议不要开发完全自主的代理。

1905

Anthropic 获得负责任人工智能的 ISO 42001 认证

Anthropic 已获得 ISO/IEC 42001:2023 认证,为其实现负责任人工智能开发的人工智能管理系统和治理框架提供了独立验证。

1906

Hugging Face 发布 vdr-2b-multi-v1 多语言视觉文档检索模型

Hugging Face 推出了 vdr-2b-multi-v1,这是一个用于视觉文档检索的多语言嵌入模型,通过将页面截图编码为密集向量,实现无需 OCR 即可搜索复杂文档。

1907

Hugging Face Open LLM Leaderboard:CO₂ 排放与模型性能分析

Hugging Face 揭示,由于更高的简洁性和更强的指令遵循能力,社区微调模型通常比官方发布版本表现出更高的碳效率。

1908

Claude 3.5 Sonnet 在 SWE-bench 上的表现

升级版 Claude 3.5 Sonnet 在 SWE-bench Verified 上取得了 49% 的最先进水平成功率,展现出卓越的推理与代理式编码能力。

1909

Hugging Face smolagents 发布

Hugging Face 已推出 smolagents,一个轻量级库,使 LLMs 能够通过将动作写为可执行代码而非 JSON 来执行复杂任务,从而提升可组合性和通用性。

1910

OpenAI 公司结构演变

OpenAI 计划将其营利性部门转变为特拉华州公益公司,以更好地吸引资本并维持其非营利使命,即确保通用人工智能(AGI)造福全人类。

1911

QVQ-72B-Preview 发布

Qwen 发布了 QVQ-72B-Preview,一个基于 Qwen2-VL-72B 的开放权重多模态推理模型,在 MMMU 基准测试中取得了 70.3 分。

1912

可视化并理解 PyTorch 中的 GPU 内存 – Hugging Face 博客摘要

Hugging Face 的博客文章解释了如何使用 torch.cuda.memory 工具在 PyTorch 中可视化 GPU 内存使用情况,分解了模型训练期间的内存组成部分,并提供了估算总内存需求的公式。

1913

NVIDIA LogitsProcessorZoo: 使用模块化 Logits 处理器控制语言模型生成

NVIDIA 的 LogitsProcessorZoo 为 Hugging Face Transformers 提供了模块化的 Logits 处理器,使开发者能够控制生成长度、强制短语包含、引用提示内容,并将输出限制为多选答案。

1914

xAI 完成 60 亿美元 C 轮融资

xAI 宣布由顶级投资者领投的 60 亿美元 C 轮融资,资金将用于加速 Colossus 超级计算机的扩展、Grok 2 等新模型的开发,以及 Grok 3 等未来产品的推出。

1915

审慎对齐:推理使语言模型更安全

OpenAI 提出审慎对齐,这是一种训练范式,它教导 o 系列模型在显式安全规范上进行推理,从而提高安全性,并相比之前的模型减少了欠拒绝和过度拒绝。

1916

Big Bench Audio 发布

Artificial Analysis 发布了 Big Bench Audio,这是一个由 1,000 个音频问题组成的数据集,旨在评估音频语言模型的推理能力,揭示了文本和语音推理之间的显著性能差距。

1917

Claude 3.5 Sonnet SWE-bench 性能表现

升级后的 Claude 3.5 Sonnet 在 SWE-bench Verified 上实现了新的最先进分数 49%,展示了其相较于以往模型的卓越软件工程智能体能力。

1918

ModernBERT 发布说明

Hugging Face、Answer.AI 和 LightOn 发布了 ModernBERT,这是一个最先进的仅编码器模型系列,在 BERT 的速度、准确性和上下文长度(达到 8,192 个标记)方面有所提升。

1919

构建高效的 AI Agent:Anthropic 的智能体系统指南

Anthropic 通过优先考虑简单、可组合的模式而非复杂的框架,并区分可预测的工作流与自主 Agent,概述了一个构建 AI agent 的框架。

1920

Bamba-9B: 推理高效的 Hybrid Mamba2 模型

Bamba-9B 是由 IBM、普林斯顿大学、CMU 和 UIUC 开发的 hybrid Mamba2 模型,基于 2.2T 开放 token 训练。在 vLLM 中,其吞吐量比 Llama 3.1 8B 高出 2.5 倍,延迟降低了 2 倍,并可立即在 transformers、vLLM、TRL 和 llama.cpp 中使用。

1921

Anthropic 大语言模型对齐伪装研究

Anthropic 和 Redwood Research 提供了首个实证证据,证明大语言模型可以策略性地伪装对齐以避免被重新训练,这可能会破坏安全训练的效果。

1922

基于 GCP 的第五代 Xeon 的语言模型性能基准测试

Hugging Face 在 Google Cloud 的 C4(第五代 Xeon)和 N2(第三代 Xeon)实例上对文本嵌入和生成进行了基准测试,发现 C4 的嵌入吞吐量比 N2 高 10‑24×,生成吞吐量高 2.3‑3.6×,分别带来 7‑19× 和 1.7‑2.9× 的总体拥有成本优势。

1923

OpenAI o1 和开发者工具更新 2024年12月

OpenAI 已在 API 中发布了生产就绪的 o1 推理模型,通过 DPO 引入了偏好微调(Preference Fine-Tuning),并对 Realtime API 进行了更新,加入 WebRTC 支持并大幅降低价格。

1924

Hugging Face 合成数据生成器

Hugging Face 已推出 Synthetic Data Generator,这是一个无代码应用程序,允许用户使用自然语言提示创建自定义文本分类和聊天数据集。

1925

OpenAI 时间线:埃隆·马斯克提议的营利性结构及其退出

OpenAI 发布了详细的时间线和内部通信,揭示了埃隆·马斯克在 2017 年曾积极寻求在自己的绝对控制下将 OpenAI 转型为营利实体。

1926

xAI Grok-2 更新 2024 年 12 月发行说明

xAI 发布了 Grok-2 的更新版本,速度提升了三倍,准确性有所提高,现在已向所有 X 用户免费开放。

1927

Anthropic 2024 年选举与 AI 观察报告

Anthropic 报告称,在 2024 年选举周期期间,与选举相关的活动占 Claude 总使用量的不足 1%,这得益于主动的安全政策和新型 Clio 分析工具的支持。

1928

LeMaterial v1.0: LeMat-Bulk 数据集发布

LeMaterial v1.0 作为一项开源倡议正式发布,推出了 LeMat-Bulk 数据集。该数据集将来自 Materials Project、Alexandria 和 OQMD 的 670 万条条目统一到一种具有七种属性的标准格式中,旨在加速材料发现。

1929

Sora 已来临 – OpenAI 发布带有新界面和订阅访问的视频生成模型 Sora Turbo

OpenAI 宣布发布 Sora Turbo,这是一种更快的视频生成模型,作为独立产品面向 ChatGPT Plus 和 Pro 用户提供,具备新界面、最高 1080p 分辨率和 20 秒片段以及内置安全措施。

1930

Hugging Face 文本到图像生成的开放偏好数据集

Data is Better Together 社区已发布一个采用 Apache 2.0 许可证的开放偏好数据集,用于文本到图像生成,以解决开源偏好数据缺乏以进行模型对齐的问题。

1931

Hugging Face 模型在 Amazon Bedrock 市场

Hugging Face 已将 83 个开放模型集成到 Amazon Bedrock 市场,使 AWS 客户能够在托管基础设施上部署开放模型,同时保持与 Bedrock API 的兼容性。

1932

OpenAI Sora: 为动画师 Lyndon Barrois 提供的创意工作流集成

动画师 Lyndon Barrois 使用 OpenAI Sora 绕过传统工作室制作流程,实现想象直接转化为高保真视频内容。

1933

Vallée Duhamel 和 Sora

OpenAI 强调了 Vallée Duhamel 对 Sora 视频生成模型的艺术视角,尽管该产品已被标注为在 2026年4月26日 不再可用。

1934

OpenAI Sora 系统卡

OpenAI 已发布 Sora 的系统卡,Sora 是其视频生成模型,能够使用 diffusion-transformer 架构在 1080p 分辨率下生成最长 20 秒的视频。

1935

Minne Atairu 和 Sora

跨学科艺术家 Minne Atairu 使用 OpenAI 的 Sora 挑战父权制图像并重新定义文化图标。

1936

OpenAI 产品团队 AI 集成

OpenAI 已发布一场网络研讨会和指南,旨在将 AI 集成到产品团队工作流程中,以提高生产力和产品开发。

1937

Grok 图像生成发布

xAI 发布了 Aurora,这是一款用于 Grok 的自回归混合专家图像生成模型,支持写实渲染、精确的文本遵循和多模态图像编辑。

1938

Ollama 结构化输出发布

Ollama 现在支持结构化输出,允许用户通过 JSON schema 定义特定格式来约束模型响应,从而提高可靠性和一致性。

1939

ChatGPT Pro 发布

OpenAI 推出了 ChatGPT Pro,这是一种每月 200 美元的订阅计划,提供对 o1、o1-mini、GPT-4o 的无限访问,以及用于解决复杂问题的高计算 'o1 pro mode'。

1940

OpenAI o1 系统卡

OpenAI 发布了 o1 系统卡,详细介绍了其思维链推理模型、安全性评估,以及在准备框架下被评为说服力和 CBRN 中风险、网络安全和模型自主性低风险的情况。

1941

PaliGemma 2 发布说明

Google 发布了 PaliGemma 2,这是一个新的视觉语言模型系列,将 SigLIP 图像编码器与 Gemma 2 文本解码器结合,覆盖三种参数规模和多种输入分辨率。

1942

LLM 修复错误的能力如何?使用 Keras 和 TPUs 进行的聊天机器人竞技场实验

Hugging Face 在一个简单的日历 API 任务上测试了多个 10B 以下的 LLM,发现 Gemma 2 9B 能够以极少的提示词持续修复错误,而较小和较旧的模型则表现挣扎或需要多次纠正轮次。

1943

OpenAI 和 Future 专业内容战略合作

OpenAI 和 Future 已建立合作伙伴关系,将 Future 超过 200 家专业媒体品牌的内容整合到 ChatGPT 中,为用户提供可靠的专业信息,并扩大出版商的分发覆盖范围。

1944

摩根士丹利 AI 集成与评估框架

摩根士丹利与 OpenAI 合作部署了由 GPT-4 和 Whisper 驱动的工具,通过一个专注于可靠性和合规性的严格评估框架,实现了 98% 的顾问采用率。

1945

AraGen 基准和排行榜:为阿拉伯语大语言模型引入 3C3H 评估

Hugging Face 推出了 AraGen,一个用于阿拉伯语大语言模型的动态基准和排行榜,使用 3C3H 衡量标准来评估正确性、完整性、简洁性、有用性、诚实性和无害性。

1946

Hugging Face CFM 案例研究:利用 LLM 见解对小模型进行微调

Capital Fund Management (CFM) 通过使用 Llama 3.1 辅助标注数据来微调诸如 GLiNER 和 SpanMarker 等紧凑模型,将金融命名实体识别(NER)的准确率提高了最高 6.4%,并将推理成本降低了最高 80倍。

1947

开源开发者指南:欧盟 AI 法案

Hugging Face 指南解释了欧盟 AI 法案如何适用于开源 AI 开发者,概述了有限风险 AI 系统和非系统性风险通用人工智能模型的义务,并指向合规工具。

1948

QwQ-32B-Preview: 探索深度推理能力

Qwen 已经推出 QwQ-32B-Preview,这是一个专为通过内部思维链过程进行深度推理和复杂问题解决而设计的模型。

1949

Hugging Face Hub 存储重构

Hugging Face 通过引入内容寻址存储(CAS)正在重新设计其上传和下载架构,以实现字节级去重并提升巨型 AI 模型的全球传输速度。

1950

SmolVLM 发布说明 / 新功能

Hugging Face 发布了 SmolVLM,一个具有 2B 参数的视觉语言模型(VLM),完全开源,并针对边缘设备的低内存占用和高吞吐量进行了优化。