Castform과 Neon을 사용하여 Retrieval에서 GPT-5.6 Sol을 능가하기

Open-Weights 모델은 Retrieval에서 Frontier 모델을 능가할 수 있습니다

Post-trained open-weights 모델은 특정 retrieval tasks에서 GPT-5.6 Sol과 같은 frontier 모델의 성능을 매칭하거나 능가할 수 있으며, 비용을 최대 100배까지 절감할 수 있습니다. 범용 frontier 모델은 강력하지만, 모델이 문제를 해결하기 위해 루프 내에서 여러 번 계획하고 검색해야 하는 agentic retrieval workflows에서는 종종 비용이 너무 비싸고 속도가 느립니다. Reinforcement Learning (RL) post-training을 사용하면 개발자는 소형 모델을 특화시켜 이러한 특정 검색 및 retrieval patterns를 더 효율적으로 처리하도록 만들 수 있습니다.

Traditional RAG에서 Agentic Retrieval로의 전환

Retrieval은 one-shot embedding searches에서 multi-hop agentic workflows로 진화했습니다. 전통적인 Retrieval-Augmented Generation (RAG)에서는 시스템이 LLM에 컨텍스트를 제공하기 위해 단일 similarity search를 수행합니다. 반면, agentic retrieval은 모델이 복잡한 문제를 더 작은 작업으로 분해하고, 필요한 정보를 찾을 때까지 루프 내에서 여러 번의 search queries를 발행하는 과정을 포함합니다.

이러한 변화는 모델에 두 가지 핵심 영역에서 부담을 가중시킵니다:

  1. Context: 올바른 데이터를 찾는 도구를 제공하는 능력.
  2. Model: 무엇을 검색할지, 그리고 어떻게 반복할지 결정하는 모델의 능력.

Frontier 모델의 경우, 이러한 반복적인 프로세스는 비용이 많이 듭니다. GPT-5.6 Sol을 사용하는 전형적인 multi-turn search request는 10초 이상 소요될 수 있으며 요청당 약 $0.03의 비용이 발생할 수 있는데, 이는 많은 프로덕션 규모에서는 지속 불가능합니다.

Castform과 Neon이 RL Post-Training을 가능하게 하는 방법

Castform과 Neon은 GPU internals이나 machine learning에 대한 깊은 전문 지식 없이도 원시 기업 데이터를 특화된 retrieval 모델로 전환하는 통합 파이프라인을 제공합니다.

The Training Pipeline

Castform은 RL loop를 관리하고, Neon(via Lakebase Search)은 데이터 인프라를 제공합니다:

Stage Role of Neon + Lakebase Search
Corpus Storage Raw documents는 Neon의 Postgres에 저장됩니다.
Synthetic Data Generation Castform은 lakebase_textlakebase_vector를 사용하여 training tasks를 생성합니다.
RL Training 모든 rollout의 search tool call은 Lakebase Search를 활용합니다.
Production Inference 최종 모델은 라이브 inference 시 동일한 search tool을 사용합니다.

Data를 Task로 전환하기

대부분의 기업은 깨끗한 training datasets가 부족합니다. Castform은 기존의 proprietary data(예: 내부 wikis, support articles, 제품 기록)로부터 synthetically question-answer pairs를 생성함으로써 이 문제를 해결합니다. 예를 들어, "Train rides must be standard cabin class with 14 day booking lead time"라고 명시된 정책 문서가 예약 규칙에 대한 특정 질문과 그에 상응하는 ground-truth answer로 변환됩니다.

The Reward Function

RL post-training은 모델을 가이드하기 위한 reward function에 의존합니다. Retrieval tasks에서 reward는 세 가지 요소에 따라 계산됩니다:

  • Retrieval: 모델이 올바른 data chunks를 찾았는가?
  • Citation: 올바른 sources를 인용했는가?
  • Correctness: 정확한 최종 answer를 제공했는가?

Stateful Agents를 위한 인프라

Agentic 모델을 학습시키면 수천 개의 parallel rollouts가 동시에 수십 개의 search calls를 수행할 수 있으므로 매우 높은 bursty workloads가 발생합니다. Neon의 dynamic compute scaling은 지속적인 최대 용량 프로비저닝 없이 이러한 스파이크를 흡수합니다.

또한, Neon의 branching과 time-travel 기능은 stateful agents의 학습을 가능하게 합니다. 각 rollout에 대해 격리된 database branches를 생성함으로써, 개발자는 한 agent의 행동이 다른 agent에게 영향을 미치거나 프로덕션 데이터에 영향을 주지 않도록 보장할 수 있으며, agent states를 리셋하고 검사할 수 있는 안전한 환경을 제공합니다.

Community Insights and Technical Counterpoints

Hacker News의 업계 실무자들은 특화된 retrieval 모델에 관한 몇 가지 중요한 고려 사항을 강조했습니다:

"라우팅 비용이 무시할 수 있는 수준이라면, retrieval, reranking, reasoning, 그리고 generation이 각각 자신만의 최적화된 모델을 갖는 것이 더 합리적입니다."

Key Technical Challenges

  • Data Quality: reward function이 corpus 자체에서 유도되므로, 일부 사용자는 시스템이 corpus 내의 오래되거나 잘못된 정보를 어떻게 처리하는지 의문을 제기했습니다.
  • Retrieval Depth: "needle in a haystack" 문제, 즉 한 조각의 정보가 다른 정보의 발견을 가능하게 하는 경우처럼, 쌍을 이루는 needles를 찾는 모델의 능력에 대해 우려가가 제기되었습니다.
  • Chunking Strategies: 일부는 RAG의 근본적인 결함이 "blind chunking"이라고 주장하며, 단순한 embedding searches보다 더 풍부한 parent-child segment 모델이 더 효과적이라고 제안했습니다.
  • Privacy: 민감한 데이터의 경우, 정보를 클라우드 제공업체에 업로드해야 한다는 요구 사항이 여전히 큰 장벽벽으로 남아 있으며, open-source stacks가 rented GPUs에서 실행될 수 있어야 한다는 요구가 있습니다.

Sources

관련