AstaBrief 8B 發布說明 / 最新功能

AstaBrief 8B:快速、具依據的科學報告生成

Hugging Face 和 AllenAI 發布了 AstaBrief 8B,這是一款專門訓練用於將研究問題與檢索到的文獻摘錄轉換為帶有引用的科學報告的開源權重模型。該模型旨在提供高品質、具依據的替代方案,以取代專有模型,顯著降低生成時間與運行成本,同時讓機構可在自有基礎設施上運行此模型,以處理敏感或未公開的工作。

性能與效率提升

AstaBrief 8B 相較於 Asta「思考模式」中使用的專有模型,報告生成時間幾乎縮短了一個數量級。在整個流程中,AstaBrief 的「快速模式」平均每篇報告耗時 51.1 秒,而思考模式則需 178.5 秒,速度提升約 3.5 倍。

這種效率提升來自於重新設計的流程,該流程以單次遍歷方式撰寫完整報告,跳過了專有系統所使用的昂貴片段摘要與聚類階段。

訓練方法

AstaBrief 是從 Qwen3-8B 開始構建,並透過監督微調(SFT)與直接偏好優化(DPO)結合的方式進行優化,而非使用成本更高的強化學習(RL)方法。

監督微調(SFT)

  • 資料來源: 模型在 90,000 篇科學家透過 ScholarQA 框架提交的真實研究問題中,提取出 47,000 篇可用範例進行訓練。
  • 目標生成: 目標報告使用多種專有模型混合生成,包括 Claude 3.5 Sonnet、Claude 3.7 Sonnet、o3、o4-mini 和 GPT-4.1。

直接偏好優化(DPO)

  • 資料集: 使用不同模型(例如 Claude 對 DeepSeek-V3/R1)生成的報告對,建立約 6,000 範例的偏好資料集。
  • 驗證: 使用兩種評審模型(GPT-4.1 和 DeepSeek-R1)進行勝者選取。僅保留兩位評審意見一致的對比,確保與人類偏好達成 95% 的一致率。

提升科學依據性與引用準確性

為確保科學上的忠實性,團隊著重於資料品質而非數量。特別針對「泛化偏差」進行防範,即模型可能將特定樣本的發現誤解為普遍性結論。

引用品質的資料過濾

為提升引用品質,測試了四種基於統計的過濾方法。其中成效最顯著的是過濾掉 引用密度低(至少有一個引用的陳述所佔比例)的合成報告。其他測試過的過濾方法包括:

  • 輸出對輸入的 token 比率: 用於識別從過少證據生成過多文字的報告。
  • 引用相關性: 計算被引用論文的檢索相關性得分平均值。
  • 引用多樣性: 衡量被引用論文數量佔檢索集合的比例。

評估與驗證

AstaBrief 使用 SQABench-CS2(200 篇使用者撰寫的電腦科學問題)與 DeepScholarBench(63 篇長篇綜合查詢)進行評估。

  • 品質: 在 LLM 評估的比較中,AstaBrief 在答案與引用品質方面,與 Claude 驅動的流程及 DR Tulu 相當。
  • 人類偏好: 在小型人類研究中,三名研究者中有兩名特別在 引用準確性 上偏好 AstaBrief。
  • 使用者採用: 在 374 名 Asta 用戶中,29.1% 的用戶連續兩天或以上使用快速模式,其中 23% 的使用者持續專用快速模式,從未切換回思考模式。

未來方向

AllenAI 正探索未來版本的多項改進,包括:

  • 細粒度偏好學習與更強的 RAG 加強化學習方法。
  • 多輪對話與多工具支援能力。
  • 評估模型是否保留其來源的證據範圍,而非僅檢查引用是否存在。

Sources