NVIDIA AI-Q Blueprint:DeepResearch Bench 上排名最高的开放深度研究代理
NVIDIA 的 AI-Q Blueprint 是一个可移植的、开放的深度研究代理,已在 DeepResearch Bench 上的 Hugging Face “LLM with Search” 排行榜中名列第一。此成就表明,开源 AI 堆栈能够驱动先进的代理工作流,且可与闭源方案相媲美甚至超越。
核心技术栈与架构
AI-Q Blueprint 融合了两款高性能的开放 LLM,以管理长上下文检索、代理推理和综合能力:
- Llama 3.3-70B Instruct:用于生成流畅且结构化的报告的基础。
- Llama-3.3-Nemotron-Super-49B-v1.5:一种专注于推理的变体,通过神经架构搜索(NAS)、知识蒸馏以及监督和强化学习进行优化。它专为多步骤推理、查询规划、工具使用和反思而设计。
为了支持这些模型,参考示例集成了 NVIDIA NeMo Retriever 用于在内部和外部数据之间进行可扩展的多模态搜索,以及 NVIDIA NeMo Agent toolkit 用于编排复杂的多步骤工作流。该架构实现了对本地和网络数据的并行、低延迟搜索,便于在需要高度隐私和合规性的环境中部署。
Llama Nemotron 的深度推理能力
Llama-3.3-Nemotron-Super-49B-v1.5 经过后训练以实现显式的代理推理,并允许用户通过系统提示开启或关闭推理功能。这使得模型既可以作为标准聊天 LLM 使用,也可以作为面向代理流水线的深度链式思考推理引擎。
关键技术规格包括:
- Post-training:一种多阶段方法,结合指令遵循、数学/编程推理以及工具调用技能。
- Efficiency:拥有 49B 参数和最高 128K 令牌的上下文窗口,模型可在单个 H100 GPU 或更小的设备上运行,确保推理成本可预测且快速。
- Lineage:模型直接可追溯至开源 Meta 权重,并对合成数据和调优数据集保持透明。
评估指标与透明性
AI-Q 强调推理轨迹和中间步骤的透明性。开发团队采用了标准与专用指标的组合,以确保模型的鲁棒性:
- Hallucination Detection:在生成过程中检查事实性声明。
- Multi-source Synthesis:从不同证据中综合出新见解的能力。
- Citation Trustworthiness:对声明与证据之间关联的自动评估。
- RAGAS Metrics:对检索增强生成准确性的自动评分。
DeepResearch Bench 性能
DeepResearch Bench 使用 100 多个长上下文、真实世界的研究任务,对代理堆栈进行评估,涵盖科学、金融、艺术、历史和软件等领域。这些任务需要复杂的多跳推理和报告级别的综合,而非简单的问答。
截至 2025 年 8 月,AI-Q 在 LLM with Search 类别中取得了 40.52 的总体得分,成为排名最高的全开放许可证堆栈。系统在全面性(报告深度)、洞察力(分析质量)和引用质量方面表现最为突出。
开发者可用性
Llama-3.3-Nemotron-Super-49B-v1.5 与 Llama 3.3-70B Instruct 均可在 Hugging Face 下载。开发者可以使用 Python 将这些模型集成到自己的流水线,或通过 vLLM 部署以实现快速推理和工具调用支持。