오픈소스 LLM을 LangChain 에이전트로 활용
오픈소스 대형 언어 모델(LLM)은 에이전트 워크플로우에서 효과적인 추론 엔진으로 활용될 수 있는 성능 임계점에 도달했습니다. Hugging Face의 벤치마크에 따르면 Mixtral-8x7B는 에이전시 시스템에 통합될 때 일반 목적 추론에서 GPT-3.5를 능가할 수 있으며, 함수 호출을 위한 추가 파인튜닝이 오픈소스 모델을 GPT-4 수준의 성능으로 끌어올릴 수 있음을 시사합니다.
LLM 에이전트와 ReAct 프레임워크 이해
LLM 에이전트는 관찰을 기반으로 환경에서 행동을 수행하는 중앙 엔진으로 LLM을 사용하는 시스템입니다. 이러한 시스템은 일반적으로 목표를 달성하기 위해 Perception → Reflexion → Action 사이클을 따르며, 종종 계획 또는 지식 관리 시스템으로 보강됩니다.
ReAct 접근법
ReAct(Reasoning and Acting)은 체인‑오브‑쓰(thought) 프롬프트와 행동 실행을 결합한 에이전트를 구축하는 구체적인 방법입니다. 모델은 "단계별"로 생각하도록 프롬프트되어 행동을 계획하고 실행합니다. 내부 루프는 다음과 같이 작동합니다:
- Thought: LLM이 현재 상태를 반영하고 다음 단계를 계획합니다.
- Action: LLM이 특정 형식(예: JSON)으로 도구를 호출합니다.
- Observation: 시스템이 도구를 실행하고 결과를 프롬프트에 다시 추가합니다.
- Final Answer: 충분한 정보가 수집되면 LLM이 최종 응답을 제공합니다.
에이전트 시스템의 핵심 과제
신뢰할 수 있는 에이전트를 구현하려면 다음 세 가지 주요 기술적 장벽을 극복해야 합니다:
- 도구 선택: 목표에 도달하기 위해 제공된 목록 중 올바른 도구를 선택합니다.
- 인자 형식화: 도구 호출 시 오탈자나 잘못된 인자 값을 방지하기 위해 엄격한 형식(예: JSON)을 유지합니다.
- 정보 통합: 수집된 관찰과 초기 컨텍스트를 효율적으로 활용해 이후 추론 단계에 반영합니다.
LangChain과 Hugging Face로 에이전트 구현
Hugging Face는 ChatHuggingFace 래퍼를 LangChain에 통합하여 오픈소스 모델을 이용한 에이전트 생성을 간소화했습니다. 이를 통해 개발자는 HuggingFaceEndpoint 모델을 ReAct 스타일 프롬프트와 도구 집합(예: 검색을 위한 SerpAPI, 계산을 위한 LLM-math)과 연결할 수 있습니다.
AgentExecutor를 사용하면 모델이 복잡한 질의를 처리할 수 있습니다—예를 들어 세계 기록 보유자의 나이를 찾고 그 나이에 대한 수학 연산을 수행하는 작업을 데이터 검색과 계산기 도구를 반복적으로 활용해 수행합니다.
성능 벤치마크: 오픈소스 vs. 상용 모델
일반 목적 추론을 평가하기 위해 Hugging Face는 HotpotQA(인터넷 검색), GSM8K(초등 수학), GAIA(일반 AI 어시스턴트) 샘플을 결합한 데이터셋을 사용해 여러 모델을 테스트했습니다.
평가된 모델
- 오픈소스: Llama2-70b-chat, Mixtral-8x7B-Instruct-v0.1, OpenHermes-2.5-Mistral-7B, Zephyr-7b-beta, 그리고 SOLAR-10.7B-Instruct-v1.0.
- 상용: GPT-3.5와 GPT-4(OpenAI 전용 함수 호출 템플릿 사용).
주요 결과
- Mixtral-8x7B 우수성: Mixtral-8x7B는 벤치마크에서 GPT-3.5를 능가하는 뛰어난 성능을 보였습니다. 이는 Mixtral이 에이전트 워크플로우에 특화된 파인튜닝을 거치지 않았음에도 불구하고, GPT-3.5는 해당 목적에 맞게 조정된 점이 주목됩니다.
- 모델 변동성: 오픈소스 모델 간 성능 차이가 크게 나타났습니다. Mixtral이 뛰어난 반면, Llama2-70b는 이 특정 에이전시 상황에서 의외로 낮은 성능을 보였습니다.
- 도구 사용의 영향: 에이전트 워크플로우는 모델 성능을 크게 향상시킵니다. 예를 들어, GSM8K 질문 소규모 샘플에서 Mixtral-8x7B는 계산기 도구를 제공받았을 때 제로샷 성능이 73%에 달했으며, 이는 5-shot 프롬프트로 LLM Leaderboard에 보고된 57.6%보다 높은 수치입니다.
개선 가능성
Mixtral이 GAIA 벤치마크에서 실패한 사례의 약 10%는 도구 인자 형식 오류 때문이었습니다. Hugging Face는 함수 호출 및 작업 계획을 위한 목표 지향 파인튜닝이 오픈소스 모델의 성능을 더욱 끌어올려 GPT-4와 경쟁할 수 있을 것으로 전망합니다.
SUMMARY: Hugging Face는 오픈소스 LLM, 특히 Mixtral-8x7B가 이제 에이전트 워크플로우를 구동할 수 있을 정도로 성능이 향상되었으며, 일반 목적 추론 작업에서 GPT-3.5를 능가할 수 있음을 보여줍니다.
TITLE: 오픈소스 LLM을 LangChain 에이전트로 활용