Ecom-RLVE: 전자상거래 대화형 에이전트를 위한 적응형 검증 가능한 환경

Ecom-RLVE: 전자상거래 대화형 에이전트를 위한 적응형 검증 가능한 환경

Hugging Face는 Ecom-RLVEを発表했습니다. 이는 전자상거래 대화형 에이전트의 작업 완료율을 향상시키기 위해 설계된 프레임워크입니다. RLVE(검증 가능한 환경에서의 강화 학습) 프레임워크를 멀티 턴, 도구 증강 대화로 확장하여, EcomRLVE-GYM은 실제 결과(예: 올바른 제품 선택 및 카트 정확도)에 최적화된 에이전트를 위한 검증 가능한 환경 세트를 제공합니다. 이는 단순한 대화 유창성에 국한되지 않습니다.

검증 가능한 보상 vs. LLM-as-a-Judge

Ecom-RLVE는 대화에서는 유창하지만 복잡한 거래 작업을 완료하지 못하는 대형 언어 모델(LLMs)의 격차를 해소합니다. 이를 해결하기 위해, 프레임워크는 알고리즘 검증을 사용하여 "LLM-as-a-judge"의 주관성을 제거하는 검증 가능한 보상을 이용한 강화 학습(RLVR)을 활용합니다.

모든 결과는 실제 목표에 접근할 수 있는 프로그램을 통해 평가됩니다. 보상 신호는 세 가지 주요 구성 요소로 구성됩니다:

  • Task Reward: 에이전트가 목표를 성공적으로 완료했는지 측정합니다(예: 올바른 제품 추천 또는 카트 정확도).
  • Efficiency Reward: 에이전트 실수로 인한 낭비된 턴에 페널티를 부과하며, 사용자 후속 질문으로 인한 턴은 무시합니다.
  • Hallucination Penalty: 세션 동안 실제로 검색되지 않은 제품 ID를 추천한 에이전트에 페널티를 부과합니다.

잘못된 JSON이나 불법적인 도구 호출과 같은 잘못된 출력은 잘 형성된 응답을 유도하기 위해 즉시 실패 점수를 초래합니다.

여덟 개의 EcomRLVE-GYM 환경

EcomRLVE-GYM은 실제 쇼핑 시나리오를 시뮬레이션하는 여덟 개의 서로 다른 환경으로 구성됩니다. 각 환경은 사용자 요청을 충족하기 위해 카탈로그 검색, 카트 작업, 주문 조회와 같은 도구를 사용하도록 에이전트를 요구합니다.

환경 에이전트 목표
Product Discovery 모든 사용자 제약을 만족하는 제품 찾기
Substitution 품절된 항목에 대한 호환 가능한 대체품 찾기
Cart Building 정확한 제품, 변형, 수량을 카트에 추가
Return + Replacement 올바른 주문 라인 식별, 반품 시작 및 대체 제안
Order Tracking 의도된 주문을 해결하고 상태 보고
Policy QA 가게 정책에 대한 결정론적 질문에 답변
Bundle Planning 예산 내에서 완전한 쇼핑 목록 추천
Multi-Intent Journey 위 작업 중 2~5개를 단일 시퀀스로 연결

적응형 난이도 커리큘럼

훈련 포화 또는 기아를 방지하기 위해, Ecom-RLVE는 적응형 난이도 커리큘럼을 사용합니다. 단일 난이도 값(d)이 작업 복잡도의 12개 독립 축을 제어합니다.

대표적인 난이도 축에는 다음이 포함됩니다:

  • Constraint Volume: 사용자 제약 조건의 수는 d=0에서 2에서 d=12에서 8로 증가합니다.
  • Constraint Omission: 사용자가 제약 조건을 생략하는 빈도가 5%에서 ~80%로 증가하여, 에이전트가 명확화 질문을 강요받게 됩니다.
  • Distractor Ratio: 검색 결과 중 방해 요소의 비율이 0%에서 24%로 증가합니다.
  • Stock Volatility: 대화 중간에 품목이 품절되는 빈도가 0%에서 50%로 증가합니다.

각 환경은 에이전트의 성공률을 독립적으로 추적하며, 에이전트가 현재 수준을 안정적으로 통과할 때만 난이도를 높입니다.

심층 탐구: 카트 구축 (E_CART)

카트 구축 환경은 변형 선택의 필요성을 강조합니다. 실제 카탈로그가 희소하기 때문에, 프레임워크는 에피소드 초기화時に 변형(예: 전자제품의 커넥터 유형, 의류의 사이즈)을 합성합니다.

E_CART에서 성공하려면 에이전트는 제품 발견, 변형 선택, 카트 관리, 명확화 대화, 다중 아이템 주문 처리라는 다섯 가지 기술을 습득해야 합니다. 여기에는 catalog_search, catalog_get_variants, cart_add, cart_view, user_get_visit_history, ask_user 도구가 포함됩니다.

사용자 시뮬레이션 및 스케일링

Ecom-RLVE는 자연스럽고 다양한 메시지(오타 및 주제 전환 포함)를 생성하기 위해 사용자 시뮬레이터로 **Qwen3.5 (9.7B)**를 사용합니다. 시뮬레이터는 사용자 선호도가 명시된 제약 조건과 일치하도록 보장하고, 에이전트의 명확화를 유도하기 위해 정보를 전략적으로 생략합니다.

환경 스케일링은 중첩 구조(C1 ⊂ C2 ⊂ C4 ⊂ C8)를 따릅니다. 여기서 전체 스위트(C8)에서 훈련된 에이전트는 단일 환경에서만 훈련된 전문가보다 우수할 것으로 가설됩니다.

초기 훈련 결과

타당성 연구에서, Qwen 3 8B 모델은 카트 구축(C1) 환경에서 DAPO를 사용하여 300단계 동안 훈련되었습니다. 결과는 도달한 난이도 수준의 점진적인 성장을 보여주었으며, 이는 적응형 스케줄링이 에이전트 작업 완료에 안정적인 학습 신호를 제공함을 확인합니다.

Sources