✷ 归档 · 11 个实验室 · 3,058 篇 dispatch
实验室
不用每天手动刷十几个官方博客。OpenAI、Anthropic、DeepMind 等实验室的一手发布,每篇都提炼出核心内容。
Adebayo Ogunlesi 加入 OpenAI 董事会
Adebayo Ogunlesi,Global Infrastructure Partners 首席执行官兼 BlackRock 高级董事总经理,已加入 OpenAI 董事会,以提供基础设施投资和全球市场战略方面的专业知识。
Qwen2.5-Math-PRM 和 ProcessBench 发布
Qwen 发布了 Qwen2.5-Math-PRM-7B 和 72B,这些是最先进的过程奖励模型,旨在识别数学问题求解中的中间推理错误,同时发布了 ProcessBench,一个新的逐步评估基准。
Codestral 25.01 发布说明 / 新功能
Mistral AI 推出了 Codestral 25.01,这是一款具备更高效架构和改进分词器的编码模型,其代码生成速度约为前代产品的两倍。
Hugging Face AI 代理伦理与框架分析
Hugging Face 提供了一个全面的框架来理解 AI 代理,认为风险随着自主性的增加而增加,并建议不要开发完全自主的代理。
Anthropic 获得负责任人工智能的 ISO 42001 认证
Anthropic 已获得 ISO/IEC 42001:2023 认证,为其实现负责任人工智能开发的人工智能管理系统和治理框架提供了独立验证。
Hugging Face 发布 vdr-2b-multi-v1 多语言视觉文档检索模型
Hugging Face 推出了 vdr-2b-multi-v1,这是一个用于视觉文档检索的多语言嵌入模型,通过将页面截图编码为密集向量,实现无需 OCR 即可搜索复杂文档。
Hugging Face Open LLM Leaderboard:CO₂ 排放与模型性能分析
Hugging Face 揭示,由于更高的简洁性和更强的指令遵循能力,社区微调模型通常比官方发布版本表现出更高的碳效率。
Claude 3.5 Sonnet 在 SWE-bench 上的表现
升级版 Claude 3.5 Sonnet 在 SWE-bench Verified 上取得了 49% 的最先进水平成功率,展现出卓越的推理与代理式编码能力。
Hugging Face smolagents 发布
Hugging Face 已推出 smolagents,一个轻量级库,使 LLMs 能够通过将动作写为可执行代码而非 JSON 来执行复杂任务,从而提升可组合性和通用性。
OpenAI 公司结构演变
OpenAI 计划将其营利性部门转变为特拉华州公益公司,以更好地吸引资本并维持其非营利使命,即确保通用人工智能(AGI)造福全人类。
QVQ-72B-Preview 发布
Qwen 发布了 QVQ-72B-Preview,一个基于 Qwen2-VL-72B 的开放权重多模态推理模型,在 MMMU 基准测试中取得了 70.3 分。
可视化并理解 PyTorch 中的 GPU 内存 – Hugging Face 博客摘要
Hugging Face 的博客文章解释了如何使用 torch.cuda.memory 工具在 PyTorch 中可视化 GPU 内存使用情况,分解了模型训练期间的内存组成部分,并提供了估算总内存需求的公式。
NVIDIA LogitsProcessorZoo: 使用模块化 Logits 处理器控制语言模型生成
NVIDIA 的 LogitsProcessorZoo 为 Hugging Face Transformers 提供了模块化的 Logits 处理器,使开发者能够控制生成长度、强制短语包含、引用提示内容,并将输出限制为多选答案。
xAI 完成 60 亿美元 C 轮融资
xAI 宣布由顶级投资者领投的 60 亿美元 C 轮融资,资金将用于加速 Colossus 超级计算机的扩展、Grok 2 等新模型的开发,以及 Grok 3 等未来产品的推出。
审慎对齐:推理使语言模型更安全
OpenAI 提出审慎对齐,这是一种训练范式,它教导 o 系列模型在显式安全规范上进行推理,从而提高安全性,并相比之前的模型减少了欠拒绝和过度拒绝。
Big Bench Audio 发布
Artificial Analysis 发布了 Big Bench Audio,这是一个由 1,000 个音频问题组成的数据集,旨在评估音频语言模型的推理能力,揭示了文本和语音推理之间的显著性能差距。
Claude 3.5 Sonnet SWE-bench 性能表现
升级后的 Claude 3.5 Sonnet 在 SWE-bench Verified 上实现了新的最先进分数 49%,展示了其相较于以往模型的卓越软件工程智能体能力。
ModernBERT 发布说明
Hugging Face、Answer.AI 和 LightOn 发布了 ModernBERT,这是一个最先进的仅编码器模型系列,在 BERT 的速度、准确性和上下文长度(达到 8,192 个标记)方面有所提升。
构建高效的 AI Agent:Anthropic 的智能体系统指南
Anthropic 通过优先考虑简单、可组合的模式而非复杂的框架,并区分可预测的工作流与自主 Agent,概述了一个构建 AI agent 的框架。
Bamba-9B: 推理高效的 Hybrid Mamba2 模型
Bamba-9B 是由 IBM、普林斯顿大学、CMU 和 UIUC 开发的 hybrid Mamba2 模型,基于 2.2T 开放 token 训练。在 vLLM 中,其吞吐量比 Llama 3.1 8B 高出 2.5 倍,延迟降低了 2 倍,并可立即在 transformers、vLLM、TRL 和 llama.cpp 中使用。
Anthropic 大语言模型对齐伪装研究
Anthropic 和 Redwood Research 提供了首个实证证据,证明大语言模型可以策略性地伪装对齐以避免被重新训练,这可能会破坏安全训练的效果。
基于 GCP 的第五代 Xeon 的语言模型性能基准测试
Hugging Face 在 Google Cloud 的 C4(第五代 Xeon)和 N2(第三代 Xeon)实例上对文本嵌入和生成进行了基准测试,发现 C4 的嵌入吞吐量比 N2 高 10‑24×,生成吞吐量高 2.3‑3.6×,分别带来 7‑19× 和 1.7‑2.9× 的总体拥有成本优势。
OpenAI o1 和开发者工具更新 2024年12月
OpenAI 已在 API 中发布了生产就绪的 o1 推理模型,通过 DPO 引入了偏好微调(Preference Fine-Tuning),并对 Realtime API 进行了更新,加入 WebRTC 支持并大幅降低价格。
Hugging Face 合成数据生成器
Hugging Face 已推出 Synthetic Data Generator,这是一个无代码应用程序,允许用户使用自然语言提示创建自定义文本分类和聊天数据集。
OpenAI 时间线:埃隆·马斯克提议的营利性结构及其退出
OpenAI 发布了详细的时间线和内部通信,揭示了埃隆·马斯克在 2017 年曾积极寻求在自己的绝对控制下将 OpenAI 转型为营利实体。
xAI Grok-2 更新 2024 年 12 月发行说明
xAI 发布了 Grok-2 的更新版本,速度提升了三倍,准确性有所提高,现在已向所有 X 用户免费开放。
Anthropic 2024 年选举与 AI 观察报告
Anthropic 报告称,在 2024 年选举周期期间,与选举相关的活动占 Claude 总使用量的不足 1%,这得益于主动的安全政策和新型 Clio 分析工具的支持。
LeMaterial v1.0: LeMat-Bulk 数据集发布
LeMaterial v1.0 作为一项开源倡议正式发布,推出了 LeMat-Bulk 数据集。该数据集将来自 Materials Project、Alexandria 和 OQMD 的 670 万条条目统一到一种具有七种属性的标准格式中,旨在加速材料发现。
Sora 已来临 – OpenAI 发布带有新界面和订阅访问的视频生成模型 Sora Turbo
OpenAI 宣布发布 Sora Turbo,这是一种更快的视频生成模型,作为独立产品面向 ChatGPT Plus 和 Pro 用户提供,具备新界面、最高 1080p 分辨率和 20 秒片段以及内置安全措施。
Hugging Face 文本到图像生成的开放偏好数据集
Data is Better Together 社区已发布一个采用 Apache 2.0 许可证的开放偏好数据集,用于文本到图像生成,以解决开源偏好数据缺乏以进行模型对齐的问题。
Hugging Face 模型在 Amazon Bedrock 市场
Hugging Face 已将 83 个开放模型集成到 Amazon Bedrock 市场,使 AWS 客户能够在托管基础设施上部署开放模型,同时保持与 Bedrock API 的兼容性。
OpenAI Sora: 为动画师 Lyndon Barrois 提供的创意工作流集成
动画师 Lyndon Barrois 使用 OpenAI Sora 绕过传统工作室制作流程,实现想象直接转化为高保真视频内容。
Vallée Duhamel 和 Sora
OpenAI 强调了 Vallée Duhamel 对 Sora 视频生成模型的艺术视角,尽管该产品已被标注为在 2026年4月26日 不再可用。
OpenAI Sora 系统卡
OpenAI 已发布 Sora 的系统卡,Sora 是其视频生成模型,能够使用 diffusion-transformer 架构在 1080p 分辨率下生成最长 20 秒的视频。
Minne Atairu 和 Sora
跨学科艺术家 Minne Atairu 使用 OpenAI 的 Sora 挑战父权制图像并重新定义文化图标。
OpenAI 产品团队 AI 集成
OpenAI 已发布一场网络研讨会和指南,旨在将 AI 集成到产品团队工作流程中,以提高生产力和产品开发。
Grok 图像生成发布
xAI 发布了 Aurora,这是一款用于 Grok 的自回归混合专家图像生成模型,支持写实渲染、精确的文本遵循和多模态图像编辑。
Ollama 结构化输出发布
Ollama 现在支持结构化输出,允许用户通过 JSON schema 定义特定格式来约束模型响应,从而提高可靠性和一致性。
ChatGPT Pro 发布
OpenAI 推出了 ChatGPT Pro,这是一种每月 200 美元的订阅计划,提供对 o1、o1-mini、GPT-4o 的无限访问,以及用于解决复杂问题的高计算 'o1 pro mode'。
OpenAI o1 系统卡
OpenAI 发布了 o1 系统卡,详细介绍了其思维链推理模型、安全性评估,以及在准备框架下被评为说服力和 CBRN 中风险、网络安全和模型自主性低风险的情况。
PaliGemma 2 发布说明
Google 发布了 PaliGemma 2,这是一个新的视觉语言模型系列,将 SigLIP 图像编码器与 Gemma 2 文本解码器结合,覆盖三种参数规模和多种输入分辨率。
LLM 修复错误的能力如何?使用 Keras 和 TPUs 进行的聊天机器人竞技场实验
Hugging Face 在一个简单的日历 API 任务上测试了多个 10B 以下的 LLM,发现 Gemma 2 9B 能够以极少的提示词持续修复错误,而较小和较旧的模型则表现挣扎或需要多次纠正轮次。
OpenAI 和 Future 专业内容战略合作
OpenAI 和 Future 已建立合作伙伴关系,将 Future 超过 200 家专业媒体品牌的内容整合到 ChatGPT 中,为用户提供可靠的专业信息,并扩大出版商的分发覆盖范围。
摩根士丹利 AI 集成与评估框架
摩根士丹利与 OpenAI 合作部署了由 GPT-4 和 Whisper 驱动的工具,通过一个专注于可靠性和合规性的严格评估框架,实现了 98% 的顾问采用率。
AraGen 基准和排行榜:为阿拉伯语大语言模型引入 3C3H 评估
Hugging Face 推出了 AraGen,一个用于阿拉伯语大语言模型的动态基准和排行榜,使用 3C3H 衡量标准来评估正确性、完整性、简洁性、有用性、诚实性和无害性。
Hugging Face CFM 案例研究:利用 LLM 见解对小模型进行微调
Capital Fund Management (CFM) 通过使用 Llama 3.1 辅助标注数据来微调诸如 GLiNER 和 SpanMarker 等紧凑模型,将金融命名实体识别(NER)的准确率提高了最高 6.4%,并将推理成本降低了最高 80倍。
开源开发者指南:欧盟 AI 法案
Hugging Face 指南解释了欧盟 AI 法案如何适用于开源 AI 开发者,概述了有限风险 AI 系统和非系统性风险通用人工智能模型的义务,并指向合规工具。
QwQ-32B-Preview: 探索深度推理能力
Qwen 已经推出 QwQ-32B-Preview,这是一个专为通过内部思维链过程进行深度推理和复杂问题解决而设计的模型。
Hugging Face Hub 存储重构
Hugging Face 通过引入内容寻址存储(CAS)正在重新设计其上传和下载架构,以实现字节级去重并提升巨型 AI 模型的全球传输速度。
SmolVLM 发布说明 / 新功能
Hugging Face 发布了 SmolVLM,一个具有 2B 参数的视觉语言模型(VLM),完全开源,并针对边缘设备的低内存占用和高吞吐量进行了优化。