Qwen2.5-Turbo 1M 토큰 컨텍스트 길이 출시
Qwen은 Qwen2.5-Turbo를 출시했으며, 모델의 컨텍스트 윈도우를 128k에서 1백만 토큰으로 확장했습니다. 이 업데이트는 약 10권의 전체 길이 소설 또는 30,000줄의 코드에 해당하는 대규모 데이터셋 처리를 가능하게 하면서 추론 속도와 비용 효율성을 크게 향상시킵니다.
확장된 컨텍스트 기능
Qwen2.5-Turbo는 최대 1백만 토큰까지의 컨텍스트 길이를 지원하며, 이는 약 1백만 영어 단어 또는 150만 중국어 문자에 해당합니다. 이 확장은 전체 책 삼부작 요약 또는 저장소 수준 코드 분석과 같은 복잡하고 대용량 데이터 처리 작업을 가능하게 합니다.
장컨텍스트 성능 벤치마크
이 모델은 초장거리 시퀀스에서 정보를 검색하는 데 높은 정확도를 보여줍니다:
- Passkey Retrieval: 1M 길이 Passkey Retrieval 작업에서 100% 정확도를 달성합니다.
- RULER 벤치마크: 93.1점을 기록하며 GPT-4 (91.6)와 GLM4-9B-1M (89.9)를 능가합니다.
- Complex Understanding: LV-Eval 및 LongbenchChat과 같은 벤치마크에서 128k 토큰을 초과하는 컨텍스트를 처리할 때 Qwen2.5-Turbo는 대부분의 차원에서 GPT-4o-mini를 능가합니다.
짧은 시퀀스 안정성
컨텍스트 확장의 일반적인 문제는 짧은 시퀀스에서의 성능 저하입니다. Qwen2.5-Turbo는 GPT-4o-mini와 동등한 짧은 시퀀스 기능을 유지하도록 설계되어, 컨텍스트 윈도우 확장이 표준 대화 또는 추론 성능을 저해하지 않도록 보장합니다.
추론 최적화 및 비용 효율성
Qwen2.5-Turbo는 희소 주의 메커니즘을 통해 장컨텍스트 처리의 계산 요구를 해결하기 위한 상당한 최적화를 도입합니다.
속도 및 효율성
- Reduced Latency: 희소 주의 메커니즘의 사용으로 1M 토큰 컨텍스트의 Time to First Token(TTFT)이 4.9분에서 68초로 줄어들어 4.3배 속도 향상을 나타냅니다.
- Computational Compression: 희소 주의는 주의 계산을 약 12.5배 압축합니다.
가격 및 가치
- Cost-Effective Scaling: 모델은 1백만 토큰당 ¥0.3에 가격이 책정됩니다. 이 가격대에서 Qwen2.5-Turbo는 GPT-4o-mini보다 3.6배 더 많은 토큰을 처리할 수 있습니다.
구현 및 가용성
Qwen2.5-Turbo는 Alibaba Cloud Model Studio API를 통해 이용할 수 있습니다. 이 API는 OpenAI SDK와 호환되어 qwen-turbo-latest 모델 식별자를 사용하여 기존 Python 워크플로에 간단히 통합할 수 있습니다.
개발자는 다음과 같은 경로를 통해 모델에 접근할 수 있습니다:
- Alibaba Cloud Model Studio (API)
- HuggingFace Demo
- ModelScope Demo