GLM-5.3-Flash 추론 인프라스트럭처: AI 에이전트가 10만 가속기 서비스를 구축한 방법
TL;DR
GLM‑5.3‑Flash의 추론 서비스는 중국산 AI 가속기 10만 개 이상으로 구성된 클러스터에서 2주 미만의 기간에 완전히 새로 구축되었으며, 주로 GLM‑5.3 기반의 코드 작성 보조 도구인 Infra Agent가 주도적으로 작업을 수행했습니다. 공격적인 메모리 최적화, 맞춤형 Encode‑Prefill‑Decode 아키텍처, 그리고 희소한 엔드투엔드 메트릭을 세밀한 실행 가능 신호로 전환하는 '밀도 높은 피드백' 루프를 결합함으로써 흐름 속도를 3배로 증가시키고, 주류 NVIDIA GPU 수준의 하드웨어 효율성을 달성했습니다.
1. GLM-5.3-Flash 인프라스트럭처의 중요성
- 이 시스템은 재귀적 자기 개선(RSI)에 대한 구체적인 단계를 보여줍니다: 자신을 훈련시키는 후속 모델을 위한 하드웨어와 소프트웨어를 설계하고 구축하며 최적화하는 모델.
- 기존에 검증되지 않은 하드웨어 스택(중국산 가속기)에서 생산 수준의 성능을 달성한 것은 대규모 AI 추론이 주류 NVIDIA 생태계와 분리될 수 있음을 입증합니다.
- 3배의 흐름 속도 향상과 6일 만에 62조 토큰 처리는 AI 기반 인프라 엔지니어링이 개발 주기를 극적으로 단축시킬 수 있음을 보여줍니다.
2. 10만 가속기 클러스터를 처음부터 구축하기
- 하드웨어 제약: 제한된 온칩 메모리, 좁은 대역폭, 미성숙한 커널 지원, 완전하지 않은 문서화.
- 모델 요구사항: 1M 토큰의 컨텍스트 창, 다중 모달 입력, 그리고 새로운 아키텍처.
- 해결책: Infra Agent가 저수준 코드를 작성하고 테스트하며 반복 개선하여, 일반적으로 고급 엔지니어가 수주를 소요하는 작업을 수행했습니다.
- 결과: GLM-5.3-Flash의 모든 생산 추론은 이 맞춤형 클러스터에서 실행되며, OpenCode와 OpenRouter에서 Ox‑Alpha 별칭으로 가장 많이 사용되는 모델이 되었습니다.
3. 밀도 높은 피드백: 희소 메트릭을 실행 가능한 안내로 전환하기
"피드백은 지역적이어야 하며, 비용이 적고 객관적으로 검증 가능해야 한다." – Z‑AI 블로그
3.1. 지역적 vs. 엔드투엔드 검증
- 엔드투엔드 메트릭(예: 흐름 속도)은 무엇이 잘못되었는지는 알려주지만 왜 잘못되었는지는 알려주지 않습니다.
- 밀도 높은 피드백은 다음과 같은 정보를 제공합니다:
- 정확성 테스트 – 커널 수준의 수치 비교.
- 런타임 로그 및 실행 추적 – 비활성 기간, 경쟁, 잘못된 전송 스케줄링을 정확히 파악.
- 마이크로벤치마크 – 특정 커널이나 입력 형태의 성능을 고립하여 분석.
- Infra Agent는 각 가설에 가장 적합한 검증 방법을 선택하여, 모든 변경 사항에 대해 비용이 큰 전체 서비스 배포를 피했습니다.
3.2. 효과적인 피드백의 특성
| 특성 | 어떤 모습인가 | 왜 중요한가 |
|---|---|---|
| 지역적 | "분할 후 커널 X는 (64, 1024) 형태에서 0.3 % 오차를 발생시켰습니다." | |
| 검색 공간을 단일 코드 경로로 좁힙니다. | ||
| 비용 낮음 | 5 ms 마이크로벤치마크는 분 단위가 아니라 초 단위로 실행됩니다. | |
| 빠른 반복과 나쁜 아이디어의 조기 거부를 가능하게 합니다. | ||
| 객관적 | 정의된 허용 오차를 가진 참조 구현과의 비교. | |
| 관측된 개선이 실제인지, 우연인지 보장합니다. |
4. 밀도 높은 피드백을 보여주는 사례 연구
4.1. 정확성 피드백 – 수치 정확도 버그 수정
- 문제: KDA 커널의 컨텍스트 병렬 처리(CP) 경로는 기본적으로 TF32를 사용하여 긴 컨텍스트에서 오차가 누적되었습니다.
- 피드백 루프:
- 병렬 처리 전략 → 특정 커널로의 매핑.
- 분할된 vs. 분할되지 않은 커널 출력 비교에서 1 % 이상의 오차를 발견.
- TF32 정밀도가 원인임을 확인.
- 수정: 두 개의 행렬 곱셈 모두
input_precision="tf32x3"로 설정하여 Tensor Core 속도를 유지하면서 정확도를 향상.
- 결과: 수치 오차 제거; 수정 사항은 상류에 병합됨 (PR #1180 참조).
4.2. 시스템 행동 피드백 – KV 전송 동시성 병목 해결
- 문제: 프리필 + KV 전송 지연이 프리필 전용 베이스라인보다 20 % 이상 초과.
- 피드백 루프:
- 5 % 성능 예산을 가진 테스트 시나리오(프리필, 프리필 + KV, 디코딩) 정의.
- 실행 추적 분석에서 파이썬 측 KV 전송이 DeepEP 디스패치/결합 단계와 겹치지 않았음.
- 근본 원인: C++ 호출(
intranode_dispatch,intranode_combine)이 파이썬 GIL을 차지하여 전송 스레드를 차단. - 수정: 해당 호출 중 GIL을 해제.
- 결과: 격차는 1 % 미만으로 감소; 엔드투엔드 흐름 속도도 개선됨.
4.3. 성능 피드백 – 커널 수준 최적화가 시스템 성능에 미치는 영향
- 문제: 기준 KDA 디코딩 커널은 중복 계산과 최적화되지 않은 타일링으로 인해 성능 저하.
- 피드백 루프:
- 기존 커널(SGLang, Flash Linear Attention, DeepGEMM)에서 "최적화 뼈대"를 수신.
- 제거 실험을 통해 세 단계의 개선(ReplaySSM 트레이드오프, 나눗셈 최적화, 타일 병합) 식별.
- 최종 버전에서 네 개의 V 차원 타일을 하나의 스레드 블록으로 병합, 중간 결과를 레지스터에 유지, 타일별 감소를 워프 수준 감소로 대체.
- 결과: 이전 버전 대비 1.71배 속도 향상; 누적 커널 성능 향상이 전체 서비스 수준의 3배 흐름 속도 증가에 기여.
5. 3배 성능 향상을 이룬 아키텍처 및 최적화
| 기술 | 설명 | 영향 |
|---|---|---|
| 노드 내 텐서 병렬 처리(선형 주의 및 언어 모델 헤드) | 노드 내 가속기 간 계산을 분할. | 단일 장치의 메모리 부담 감소. |
| ReplaySSM | 계산 사이클을 희생하여 메모리 대역폭을 줄입니다. | 더 큰 컨텍스트 창 가능. |
| W8A8 양자화 | 8비트 가중치 및 활성화 표현. | 메모리 트래픽 감소. |
| 혼합 정밀도 캐시(INT8/FP8/BF16) | 각 레이어마다 캐시 정밀도를 동적으로 선택. | 정확도 vs. 대역폭 균형. |
| 레이어 분할 | 무거운 레이어를 전용 장치에 분리. | 활용도 향상. |
| Encode‑Prefill‑Decode(EPD) 분리 | 세 가지 추론 단계를 분리하여 독립적인 확장 가능. | 파이프라인 병렬성과 지연 시간 개선. |
6. 인간이 개입하는 역할
- 목표 정의 – 엔지니어가 성능 목표, 안전 제약, 위험 수용 수준을 설정.
- 피드백 환경 설계 – 엔지니어가 에이전트가 소비할 수 있도록 적절한 로그, 테스트, 마이크로벤치마크를 노출.
- 비판적 검토 – 인간은 수치 안전성 변경, 동시성 수정, 생산 안정성에 영향을 줄 수 있는 코드를 감사.
- 결과 – 에이전트는 변경 사항을 제안하고 구현하며 검증; 인간은 정확성, 안정성, 비즈니스 기준을 충족하는 사항만 승인.
7. AI 기반 시스템 공학의 미래에 대한 함의
- GLM-5.3-Flash 출시는 모델 기반 코드 생성이 밀도 높은 피드백 루프와 결합될 때 전통적인 인프라 엔지니어링의 대다수를 대체할 수 있음을 입증합니다.
- 세 주의 개발 창구는 미래 세대 모델이 엔지니어링 주기를 수개월에서 수일로 압축할 수 있음을 시사하며, 점점 더 큰 모델의 배포를 가속화할 수 있습니다.
- 진정한 재귀적 자기 개선(RSI)은 여전히 연구 과제이지만, 이 작업은 실용적이고 점진적인 접근로를 보여줍니다: 먼저 저수준 최적화를 자동화한 후, 모델이 고수준 시스템 설계에 영향을 미치게 합니다.
- 이 접근법은 하드웨어에 종속적이지 않으며, NVIDIA, AMD 또는 새로운 ASIC 스택에도 유사한 밀도 높은 피드백 파이프라인을 적용할 수 있어, 전 세계적으로 AI 추론의 비용 곡선을 평탄화할 수 있습니다.
8. 커뮤니티 반응 (선택된 HN 댓글)
"미국의 반도체 수출 제한은 실제로 중국 AI 인프라에 장점이 될 수 있다. 중국 기업들은 자체 AI 칩 개발을 가속화할 수밖에 없다." – zicohacks
"우리는 중국산 AI 가속기 10만 개 이상으로 구성된 클러스터에서 완전히 새로 추론 서비스를 구축했다. GLM-5.3-Flash의 모든 생산 추론은 이 시스템에서 실행된다." – dada216
"동일한 하드웨어에서 얼마나 많은 성능을 끌어낼 수 있는지 보는 것은 정말 인상적이다. 나는 이 과정이 모든 LLM, 추론 제공자, 하드웨어 스택 조합에 대해 반복될 것이라고 생각한다." – a11r
이러한 댓글들은 해당 작업의 전략적 중요성을 강조하며, 강력한 소프트웨어 최적화가 하드웨어 한계를 상쇄할 수 있다는 넓은 신념을 반영합니다.
9. 결론
GLM-5.3-Flash의 추론 인프라스트럭처는 AI 모델이 자신을 실행하는 시스템을 직접 구축하고 개선하는 새로운 공학 패러다임을 보여줍니다. 엔드투엔드 메트릭을 희소한 상태에서 밀도 높고 지역적이며 검증 가능한 피드백으로 전환함으로써, Infra Agent는 다음과 같은 일을 수행할 수 있었습니다:
- 수치 정확도 버그를 식별하고 수정.
- 레이어 간 동시성 문제를 해결.
- 커널 수준 최적화 지식을 대규모로 적용.
결과적으로, 2주 미만의 기간에 10만 가속기 클러스터에서 3배의 흐름 속도 증가를 달성한 것은 피드백 기반, AI 보조 개발이 AI 인프라를 극적으로 가속화할 수 있음을 보여줍니다. 인간의 감독은 안전성과 전략적 방향에 있어 여전히 필수적이지만, 재귀적 자기 개선으로 가는 길은 이제 명백하게 더 짧아졌습니다.
Sources
관련
- Dispatch
- 프로젝트
- Dispatch
- Dispatch
- Dispatch