使用 Castform 與 Neon 在檢索任務上超越 GPT-5.6 Sol
開源權重模型在檢索方面可以超越前沿模型
經過後訓練(post-trained)的開源權重模型可以在特定的檢索任務上達到或超過像 GPT-5.6 Sol 這樣的前沿模型性能,同時將成本降低多達 100 倍。雖然通用型前沿模型功能強大,但對於代理式檢索工作流(agentic retrieval workflows)——即模型必須在循環中多次規劃與搜索以解決問題——而言,它們通常昂貴得令人望而卻步且速度緩慢。透過使用強化學習(RL)後訓練,開發者可以使小型模型專門化,以更高效地處理這些特定的搜索與檢索模式。
從傳統 RAG 到代理式檢索的轉變
檢索已從單次嵌入搜索演變為多跳代理式工作流。在傳統的檢索增強生成(RAG)中,系統執行單次相似度搜索以向 LLM 提供上下文。相比之下,代理式檢索涉及一個模型將複雜問題分解為較小的任務,並在循環中發出多次搜索查詢,直到找到必要的資訊。
這種轉變增加了模型在兩個關鍵領域的負擔:
- 上下文:提供能夠找到正確數據的工具的能力。
- 模型:模型決定搜索什麼以及如何迭代的能力。
對於前沿模型,這種迭代過程成本高昂。使用 GPT-5.6 Sol 的典型多輪搜索請求可能需要超過 10 秒,且每次請求的成本約為 $0.03,這對於許多生產規模而言是不可持續的。
Castform 與 Neon 如何實現 RL 後訓練
Castform 與 Neon 提供了一個集成管道,將原始企業數據轉化為專門的檢索模型,而無需具備 GPU 內部機制或機器學習的深厚專業知識。
訓練管道
Castform 管理 RL 循環,而 Neon(透過 Lakebase Search)提供數據基礎設施:
| Stage | Role of Neon + Lakebase Search |
|---|---|
| Corpus Storage | 原始文檔儲存在 Neon 上的 Postgres。 |
| Synthetic Data Generation | Castform 使用 lakebase_text 與 lakebase_vector 來生成訓練任務。 |
| RL Training | 每次 rollout 的搜索工具調用都利用了 Lakebase Search。 |
| Production Inference | 最終模型在實時檢索時使用相同的搜索工具。 |
將數據轉化為任務
大多數企業缺乏乾淨的訓練數據集。Castform 透過從現有的專有數據(例如:內部 Wiki、支持文章與產品記錄)中合成生成問答對來解決此問題。例如,一份聲明「火車行程必須是標準艙位,且需提前 14 天預訂」的政策文件,會被轉換成一個關於預訂規則的特定問題及其對應的標準答案(ground-truth answer)。
獎勵函數
RL 後訓練依賴於獎勵函數來引導模型。在檢索任務中,獎勵是根據三個因素計算的:
- Retrieval:模型是否找到了正確的數據塊(chunks)?
- Citation:它是否引用了正確的來源?
- Correctness:它是否提供了準確的最終答案?
基礎設施用於狀態化代理(Stateful Agents)
訓練代理式模型會產生高度爆發性的工作負載,因為數千個並行 rollout 可能會同時發出數十次搜索調用。Neon 的動態計算資源擴展能力可以吸收這些峰值,而無需持續配置最大容量。
此外,Neon 的分支(branching)與時空旅行(time-travel)功能允許訓練狀態化代理。透過為每個 rollout 創建隔離的數據庫分支,開發者可以確保一個代理的行為不會干擾其他代理或影響生產數據,從而提供一個可以重置與檢查代理狀態的安全環境。
社群洞察與技術對比點
Hacker News 上的行業從業者強調了關於專門化檢索模型的一些關鍵考量因素:
"It makes more sense for retrieval, reranking, reasoning, and generation to each have their own optimized model if the routing cost is negligible."
關鍵技術挑戰
- Data Quality:部分用戶質疑系統如何處理語料庫中過時或誤導性的資訊,因為獎勵函數是從語料庫本身衍生而來的。
- Retrieval Depth:對於「大海撈針」問題提出了疑慮——特別是模型尋找配對針的能力,即需要利用其中一部分資訊來解鎖另一部分的發現。
- Chunking Strategies:有人認為 RAG 的根本缺陷在於「盲目分塊(blind chunking)」,並建議比簡單的嵌入搜索更有效的、更豐富的父子片段模型(parent-child segment models)。
- Privacy:對於敏感數據,將資訊上傳到雲端供應商的要求仍然是一個重大障礙,因此對於能在租用的 GPU 上運行的開源技術棧的需求很高。
Sources
相關
- 專案
- Dispatch
- Dispatch
- Dispatch
- Dispatch