AstaBrief 8B 发布说明 / 新功能

AstaBrief 8B:快速、有依据的科学报告生成

Hugging Face 和 AllenAI 发布了 AstaBrief 8B,这是一个开放权重的模型,专门训练用于将研究问题和检索到的文献摘录转化为带引用的科学报告。该模型旨在为专有模型提供高质量、有依据的替代方案,显著减少生成时间和服务成本,同时允许机构在自己的基础设施上运行该模型,以处理敏感或未发表的工作。

性能与效率提升

与 Asta“思考模式”中使用的专有模型相比,AstaBrief 8B 在报告生成时间上实现了近一个数量级的减少。在整个流程中,AstaBrief 的“快速模式”平均每份报告耗时 51.1 秒,而思考模式为 178.5 秒,速度提升约 3.5 倍。

这一效率是通过重新设计的流程实现的,该流程一次性完成整份报告的撰写,绕过了专有系统使用的昂贵的片段摘要和聚类阶段。

训练方法

AstaBrief 基于 Qwen3-8B 构建,并通过监督微调(SFT)和直接偏好优化(DPO)的组合进行优化,而非使用更昂贵的强化学习(RL)方法。

监督微调(SFT)

  • 数据来源: 该模型基于 47,000 个可用示例进行训练,这些示例来自科学家通过 ScholarQA 框架提交的 90,000 个真实研究查询。
  • 目标生成: 目标报告是使用多种专有模型生成的,包括 Claude 3.5 Sonnet、Claude 3.7 Sonnet、o3、o4-mini 和 GPT-4.1。

直接偏好优化(DPO)

  • 数据集: 使用不同模型(例如 Claude 与 DeepSeek-V3/R1)生成的报告对,创建了约 6,000 个示例的偏好集。
  • 验证: 使用两个评判模型(GPT-4.1 和 DeepSeek-R1)来选择优胜者。仅保留两个评判模型都同意的报告对,确保与人类偏好的 95% 一致率。

改进科学依据和引用归因

为确保科学忠实性,团队注重数据质量而非数量。他们特别针对“泛化偏差”进行了防范,即模型可能将特定样本的发现转化为广泛的普遍性主张。

用于归因的数据过滤

为提高引用质量,团队测试了四种基于统计的过滤器。最显著的改进来自过滤掉 引用密度低(即带有至少一个引用的陈述所占比例)的合成报告。其他测试的过滤器包括:

  • 输出与输入 token 比率: 识别从过少证据生成过多文本的报告。
  • 引用相关性: 对引用论文的检索相关性得分进行平均。
  • 引用多样性: 衡量相对于检索集,被引用论文所占的比例。

评估与验证

AstaBrief 使用 SQABench-CS2(200 个用户编写的计算机科学问题)和 DeepScholarBench(63 个用于长篇综合的查询)进行了评估。

  • 质量: 在 LLM 评判的比较中,AstaBrief 在答案和引用质量方面与基于 Claude 的流程和 DR Tulu 具有竞争力。
  • 人类偏好: 在一项小型人类研究中,三位研究人员中有两位在 引用准确性 方面更偏好 AstaBrief 而非其他系统。
  • 用户采用率: 在 374 位 Asta 用户中,29.1% 使用了快速模式两天或以上,其中 23% 的用户继续仅使用快速模式,从未切换回思考模式。

未来方向

AllenAI 正在探索未来版本的几项增强功能,包括:

  • 细粒度偏好学习和更强的 RAG 加 RL 方法。
  • 多轮和多工具能力。
  • 评估模型是否保留其来源的证据范围,而不仅仅是检查引用是否存在。

Sources