변화하는 글로벌 컴퓨팅 환경: 중국의 AI 하드웨어 및 소프트웨어 부상
글로벌 컴퓨팅의 현황
고급 AI 칩에 대한 수요는 전 세계적으로 계속 증가하고 있지만, 엔비디아의 오랜 지배력은 중국의 국내 자립을 위한 전략적 추진에 의해 도전받고 있습니다. 중국의 차세대 오픈 웨이트 AI 모델은 점점 더 국내 칩으로 구동되며, 글로벌 AI 학습 및 배포의 규범을 바꾸고 있습니다.
이 전환은 미국과 중국의 국가 안보 우려로 인해 칩과 희토류 자원에 대한 제한이 가해지면서 촉진됩니다. 미국 수출 통제가 강화됨에 따라 중국산 칩의 출시가 가속화되어, 로컬 하드웨어에 최적화된 모델이 늘고 계산 효율적인 오픈 웨이트 모델의 채택이 급증했습니다.
촉매제: 미국 수출 통제와 국내 혁신
2022년 바이든 행정부가 고급 GPU 접근을 제한하여 중국의 AI 발전을 저지하려는 의도로 수출 통제를 마련했지만, 오히려 급성장하는 국내 산업의 기반을 마련했습니다. 중국 AI 연구소들은 차단될 위협에 대응하여 하드웨어와 소프트웨어 모두에서 혁신의 물결을 일으켰습니다.
국내 하드웨어의 부상
중국은 엔비디아 GPU를 대체할 여러 주목할 만한 고급 칩을 개발했으며, 다음과 같습니다:
- Huawei Ascend: 2018년에 처음 출시되었으며, 2024년과 2025년 전반에 걸쳐 배포가 확대되었습니다.
- Cambricon Technologies 및 Baidu Kunlun: 국내 칩 환경의 다른 주요 플레이어입니다.
오픈 웨이트 모델의 성장
컴퓨팅 자원의 부족으로 인해 중국 연구소들은 아키텍처 효율성과 개방적 협업을 우선시했습니다. 이 실용적인 '비-엔비디아 우선' 접근 방식은 Qwen, DeepSeek, GLM, Kimi와 같은 세계 수준의 오픈 웨이트 모델을 탄생시켰습니다. 이러한 모델을 로컬에서 실행할 수 있는 능력은 칩 제조업체와 연구자 간의 피드백 루프를 만들어 Ascend 플랫폼에 최적화된 모델과 같은 하드웨어 최적화 모델로 이어졌습니다.
컴퓨팅 제약 환경에서의 기술적 돌파구
컴퓨팅 제한은 현재 글로벌 AI 개발에 영향을 미치는 상당한 아키텍처 및 인프라 발전을 촉진했습니다.
알고리즘 및 아키텍처 효율성
- DeepSeek: Multi-head Latent Attention (MLA) 및 **DeepSeek Sparse Attention (DSA)**를 도입하여 성능을 저하시키지 않고 추론 비용을 줄였습니다. DeepSeek는 또한 **Group Relative Policy Optimization (GRPO)**를 개발했는데, 이는 Proximal Policy Optimization (PPO)에 비해 컴퓨팅 비용을 줄이는 강화 학습(RL) 방법론입니다. GRPO는 Meta 연구자들이 채택했으며, OpenAI의 Jerry Tworek로부터 RL 연구 가속화에 대한 찬사를 받았습니다.
- Linear Attention: Peng Bo와 같은 연구자들은 Linear Attention을 Transformer의 후속 기술로 옹호하며, RWKV 모델에서 볼 수 있고, MiniMax M1 및 Qwen-Next와 같은 상용 모델에서 확장되었습니다.
오픈 인프라 및 엔지니어링
중국 연구소들은 기업의 비밀에서 벗어나 엔지니어링 비법을 공유하여 진전을 가속화하고 있습니다:
- Kimi: 사전 채우기/디코딩 분리를 위한 Mooncake 서빙 시스템을 개발했습니다.
- StepFun: Step3에서 **Attention-FFN Disaggregation (AFD)**를 통해 이를 향상시켰습니다.
- ByteDance: 프로덕션 등급 RL 훈련을 위한 오픈소스 라이브러리 verl을 기여했습니다.
- Baidu: Ernie 4의 엔지니어링 과제를 극복하는 데 대한 상세한 기술 보고서를 발표했습니다.
병렬 소프트웨어 생태계의 출현
엔비디아의 지배력은 하드웨어뿐만 아니라 CUDA 소프트웨어 생태계에서도 구축되었습니다. 중국은 이제 이 의존도에 도전하기 위해 백엔드 중립적인 대안을 개발하고 있습니다.
충분함에서 수요로
DeepSeek의 R1 모델이 화웨이의 Ascend 클라우드에서 원활하게 실행되는 시연이 국내 모델을 국내 칩에 최적화하기 위한 시장 전반의 경주를 촉발했습니다. 이는 국내 실리콘이 최첨단 AI에 충분하다는 것을 입증했으며, 로컬 하드웨어에 대한 인식을 틈새 대안에서 필수 자산으로 변화시켰습니다.
하드웨어-소프트웨어 공동 설계
연구자들은 이제 칩 공급업체와 모델을 공동 개발하고 있습니다. 예를 들어, DeepSeek-V3.1의 FP8 정밀도 형식은 차세대 국내 칩을 위해 특별히 설계되었으며, DeepSeek-V3.2는 여러 하드웨어 공급업체 간의 이동성을 위해 TileLang 기반 커널을 활용합니다.
CUDA 스택에 도전
NVIDIA 스택을 대체할 새로운 소프트웨어 계층이 등장하고 있습니다:
- FlagGems (BAAI) 및 TileLang: CUDA와 cuDNN에 대한 백엔드 중립적인 대안입니다.
- Huawei Collective Communication Library (HCCL): NVIDIA의 NCCL에 대한 대체물입니다.
컴퓨팅 통제 및 시장 변화 타임라인
- October 2022: 미국 산업안보국(BIS)이 A100 및 H100 GPU에 대한 수출 통제를 도입했습니다.
- Late 2022–2023: 엔비디아가 대역폭이 감소한 준수 변형(A800, H800, RTX 4090D)을 만들었습니다.
- Late 2023–2024: BIS가 총 처리 성능(TPP)과 성능 밀도로 프레임워크를 업그레이드하여 A800/H800을 대상으로 했습니다.
- January 2025: "DeepSeek 순간"이 Ascend, Cambricon, Kunlun 칩의 채택을 가속화했습니다.
- April–May 2025: 미국이 5월에 AI 확산 규칙을 폐지하기 전에 엔비디아 칩에 대한 라이선스 요구 사항을 발행하고 $5.5 billion을 부과했습니다.
- August 2025: 미국 상무부가 H20 라이선스에 대한 15% 수익 공유 방안을 시행했습니다.
- Late 2025: 중국 규제 당국이 reportedly 기업에 엔비디아 주문을 취소하고 국내 가속기를 우선시하도록 지시했습니다.