Ecom-RLVE: 전자상거래 대화형 에이전트를 위한 적응형 검증 가능한 환경
Ecom-RLVE: 전자상거래 대화형 에이전트를 위한 적응형 검증 가능한 환경
Hugging Face는 Ecom-RLVEを発表했습니다. 이는 전자상거래 대화형 에이전트의 작업 완료율을 향상시키기 위해 설계된 프레임워크입니다. RLVE(검증 가능한 환경에서의 강화 학습) 프레임워크를 멀티 턴, 도구 증강 대화로 확장하여, EcomRLVE-GYM은 실제 결과(예: 올바른 제품 선택 및 카트 정확도)에 최적화된 에이전트를 위한 검증 가능한 환경 세트를 제공합니다. 이는 단순한 대화 유창성에 국한되지 않습니다.
검증 가능한 보상 vs. LLM-as-a-Judge
Ecom-RLVE는 대화에서는 유창하지만 복잡한 거래 작업을 완료하지 못하는 대형 언어 모델(LLMs)의 격차를 해소합니다. 이를 해결하기 위해, 프레임워크는 알고리즘 검증을 사용하여 "LLM-as-a-judge"의 주관성을 제거하는 검증 가능한 보상을 이용한 강화 학습(RLVR)을 활용합니다.
모든 결과는 실제 목표에 접근할 수 있는 프로그램을 통해 평가됩니다. 보상 신호는 세 가지 주요 구성 요소로 구성됩니다:
- Task Reward: 에이전트가 목표를 성공적으로 완료했는지 측정합니다(예: 올바른 제품 추천 또는 카트 정확도).
- Efficiency Reward: 에이전트 실수로 인한 낭비된 턴에 페널티를 부과하며, 사용자 후속 질문으로 인한 턴은 무시합니다.
- Hallucination Penalty: 세션 동안 실제로 검색되지 않은 제품 ID를 추천한 에이전트에 페널티를 부과합니다.
잘못된 JSON이나 불법적인 도구 호출과 같은 잘못된 출력은 잘 형성된 응답을 유도하기 위해 즉시 실패 점수를 초래합니다.
여덟 개의 EcomRLVE-GYM 환경
EcomRLVE-GYM은 실제 쇼핑 시나리오를 시뮬레이션하는 여덟 개의 서로 다른 환경으로 구성됩니다. 각 환경은 사용자 요청을 충족하기 위해 카탈로그 검색, 카트 작업, 주문 조회와 같은 도구를 사용하도록 에이전트를 요구합니다.
| 환경 | 에이전트 목표 |
|---|---|
| Product Discovery | 모든 사용자 제약을 만족하는 제품 찾기 |
| Substitution | 품절된 항목에 대한 호환 가능한 대체품 찾기 |
| Cart Building | 정확한 제품, 변형, 수량을 카트에 추가 |
| Return + Replacement | 올바른 주문 라인 식별, 반품 시작 및 대체 제안 |
| Order Tracking | 의도된 주문을 해결하고 상태 보고 |
| Policy QA | 가게 정책에 대한 결정론적 질문에 답변 |
| Bundle Planning | 예산 내에서 완전한 쇼핑 목록 추천 |
| Multi-Intent Journey | 위 작업 중 2~5개를 단일 시퀀스로 연결 |
적응형 난이도 커리큘럼
훈련 포화 또는 기아를 방지하기 위해, Ecom-RLVE는 적응형 난이도 커리큘럼을 사용합니다. 단일 난이도 값(d)이 작업 복잡도의 12개 독립 축을 제어합니다.
대표적인 난이도 축에는 다음이 포함됩니다:
- Constraint Volume: 사용자 제약 조건의 수는
d=0에서 2에서d=12에서 8로 증가합니다. - Constraint Omission: 사용자가 제약 조건을 생략하는 빈도가 5%에서 ~80%로 증가하여, 에이전트가 명확화 질문을 강요받게 됩니다.
- Distractor Ratio: 검색 결과 중 방해 요소의 비율이 0%에서 24%로 증가합니다.
- Stock Volatility: 대화 중간에 품목이 품절되는 빈도가 0%에서 50%로 증가합니다.
각 환경은 에이전트의 성공률을 독립적으로 추적하며, 에이전트가 현재 수준을 안정적으로 통과할 때만 난이도를 높입니다.
심층 탐구: 카트 구축 (E_CART)
카트 구축 환경은 변형 선택의 필요성을 강조합니다. 실제 카탈로그가 희소하기 때문에, 프레임워크는 에피소드 초기화時に 변형(예: 전자제품의 커넥터 유형, 의류의 사이즈)을 합성합니다.
E_CART에서 성공하려면 에이전트는 제품 발견, 변형 선택, 카트 관리, 명확화 대화, 다중 아이템 주문 처리라는 다섯 가지 기술을 습득해야 합니다. 여기에는 catalog_search, catalog_get_variants, cart_add, cart_view, user_get_visit_history, ask_user 도구가 포함됩니다.
사용자 시뮬레이션 및 스케일링
Ecom-RLVE는 자연스럽고 다양한 메시지(오타 및 주제 전환 포함)를 생성하기 위해 사용자 시뮬레이터로 **Qwen3.5 (9.7B)**를 사용합니다. 시뮬레이터는 사용자 선호도가 명시된 제약 조건과 일치하도록 보장하고, 에이전트의 명확화를 유도하기 위해 정보를 전략적으로 생략합니다.
환경 스케일링은 중첩 구조(C1 ⊂ C2 ⊂ C4 ⊂ C8)를 따릅니다. 여기서 전체 스위트(C8)에서 훈련된 에이전트는 단일 환경에서만 훈련된 전문가보다 우수할 것으로 가설됩니다.
초기 훈련 결과
타당성 연구에서, Qwen 3 8B 모델은 카트 구축(C1) 환경에서 DAPO를 사용하여 300단계 동안 훈련되었습니다. 결과는 도달한 난이도 수준의 점진적인 성장을 보여주었으며, 이는 적응형 스케줄링이 에이전트 작업 완료에 안정적인 학습 신호를 제공함을 확인합니다.