使用 Castform 與 Neon 在檢索任務上超越 GPT-5.6 Sol

開源權重模型在檢索方面可以超越前沿模型

經過後訓練(post-trained)的開源權重模型可以在特定的檢索任務上達到或超過像 GPT-5.6 Sol 這樣的前沿模型性能,同時將成本降低多達 100 倍。雖然通用型前沿模型功能強大,但對於代理式檢索工作流(agentic retrieval workflows)——即模型必須在循環中多次規劃與搜索以解決問題——而言,它們通常昂貴得令人望而卻步且速度緩慢。透過使用強化學習(RL)後訓練,開發者可以使小型模型專門化,以更高效地處理這些特定的搜索與檢索模式。

從傳統 RAG 到代理式檢索的轉變

檢索已從單次嵌入搜索演變為多跳代理式工作流。在傳統的檢索增強生成(RAG)中,系統執行單次相似度搜索以向 LLM 提供上下文。相比之下,代理式檢索涉及一個模型將複雜問題分解為較小的任務,並在循環中發出多次搜索查詢,直到找到必要的資訊。

這種轉變增加了模型在兩個關鍵領域的負擔:

  1. 上下文:提供能夠找到正確數據的工具的能力。
  2. 模型:模型決定搜索什麼以及如何迭代的能力。

對於前沿模型,這種迭代過程成本高昂。使用 GPT-5.6 Sol 的典型多輪搜索請求可能需要超過 10 秒,且每次請求的成本約為 $0.03,這對於許多生產規模而言是不可持續的。

Castform 與 Neon 如何實現 RL 後訓練

Castform 與 Neon 提供了一個集成管道,將原始企業數據轉化為專門的檢索模型,而無需具備 GPU 內部機制或機器學習的深厚專業知識。

訓練管道

Castform 管理 RL 循環,而 Neon(透過 Lakebase Search)提供數據基礎設施:

Stage Role of Neon + Lakebase Search
Corpus Storage 原始文檔儲存在 Neon 上的 Postgres。
Synthetic Data Generation Castform 使用 lakebase_textlakebase_vector 來生成訓練任務。
RL Training 每次 rollout 的搜索工具調用都利用了 Lakebase Search。
Production Inference 最終模型在實時檢索時使用相同的搜索工具。

將數據轉化為任務

大多數企業缺乏乾淨的訓練數據集。Castform 透過從現有的專有數據(例如:內部 Wiki、支持文章與產品記錄)中合成生成問答對來解決此問題。例如,一份聲明「火車行程必須是標準艙位,且需提前 14 天預訂」的政策文件,會被轉換成一個關於預訂規則的特定問題及其對應的標準答案(ground-truth answer)。

獎勵函數

RL 後訓練依賴於獎勵函數來引導模型。在檢索任務中,獎勵是根據三個因素計算的:

  • Retrieval:模型是否找到了正確的數據塊(chunks)?
  • Citation:它是否引用了正確的來源?
  • Correctness:它是否提供了準確的最終答案?

基礎設施用於狀態化代理(Stateful Agents)

訓練代理式模型會產生高度爆發性的工作負載,因為數千個並行 rollout 可能會同時發出數十次搜索調用。Neon 的動態計算資源擴展能力可以吸收這些峰值,而無需持續配置最大容量。

此外,Neon 的分支(branching)與時空旅行(time-travel)功能允許訓練狀態化代理。透過為每個 rollout 創建隔離的數據庫分支,開發者可以確保一個代理的行為不會干擾其他代理或影響生產數據,從而提供一個可以重置與檢查代理狀態的安全環境。

社群洞察與技術對比點

Hacker News 上的行業從業者強調了關於專門化檢索模型的一些關鍵考量因素:

"It makes more sense for retrieval, reranking, reasoning, and generation to each have their own optimized model if the routing cost is negligible."

關鍵技術挑戰

  • Data Quality:部分用戶質疑系統如何處理語料庫中過時或誤導性的資訊,因為獎勵函數是從語料庫本身衍生而來的。
  • Retrieval Depth:對於「大海撈針」問題提出了疑慮——特別是模型尋找配對針的能力,即需要利用其中一部分資訊來解鎖另一部分的發現。
  • Chunking Strategies:有人認為 RAG 的根本缺陷在於「盲目分塊(blind chunking)」,並建議比簡單的嵌入搜索更有效的、更豐富的父子片段模型(parent-child segment models)。
  • Privacy:對於敏感數據,將資訊上傳到雲端供應商的要求仍然是一個重大障礙,因此對於能在租用的 GPU 上運行的開源技術棧的需求很高。

Sources

相關