AMD, AI 추론을 위한 모델 전용 집적 회로 구현을 위해 타알라스 인수
AMD는 토론토 기반의 AI 칩 스타트업 타알라스를 인수하여, Nvidia의 AI 하드웨어 지배력을 도전하기 위해 추론에 대해 근본적으로 다른 접근 방식을 구현했다. 기존의 GPU나 데이터 흐름 아키텍처와 달리, 타알라스는 모델 가중치를 실리콘에 직접 각인하는 모델 전용 집적 회로(MSIC)를 사용하여 추론 중 가중치를 저장하기 위한 고대역폭 메모리(HBM)가 필요 없게 한다.
추론 처리량의 급격한 증가
모델 가중치를 실리콘에 각인함으로써 메모리 대역폭 병목 현상을 제거해 토큰 생성 속도를 극적으로 향상시킬 수 있다.
타알라스의 첫 번째 테스트 칩인 HC1(티엠에스씨의 6nm 공정으로 제조)은 메타의 Llama 3.1 8B 모델을 초당 16,960개의 토큰으로 제공하는 능력을 입증했다. 발표 당시 이 성능은 Nvidia GPU보다 약 48배 빠르고, Cerebras 가속기보다 약 8.5배 빠르다.
하드웨어 아키텍처
타알라스 프로세서는 두 가지 주요 기능 영역으로 나뉜다:
- 마스크-롬 리콜 패브릭: 모델 가중치가 실리콘에 영구적으로 각인되는 영역이다.
- SRAM 리콜 패브릭: KV 캐시와 미세 조정 어댑터를 저장하여 고정된 가중치에도 불구하고 일부 유연성을 제공한다.
대규모 모델 확장
두 번째 세대 HC2 칩을 위해 타알라스는 칩당 최대 200억 파라미터를 지원하는 것을 목표로 하고 있다. 트리리언 파라미터 모델을 지원하기 위해 AMD는 파이프라인 병렬 처리를 활용해 가중치를 여러 가속기 간에 분산할 수 있다. 트리리언 파라미터 모델의 경우 약 50개의 HC2 가속기가 필요하다. 이 접근 방식은 현재 랙 시스템(예: Nvidia의 LPX)과 비교해 공간과 전력 효율성이 훨씬 뛰어나며, 유사한 결과를 얻기 위해 수천 개의 LPUs가 필요하다.
AMD 헬리오스 랙에 전략적 통합
AMD는 타알라스 기반 가속기를 자신의 인스티크 기반 헬리오스 랙과 결합해 분리형 아키텍처를 구현할 계획이다. 이 구조에서는 계산 집약적인 프롬프트 처리는 GPU가 담당하고, 고속 토큰 생성은 타알라스 MSIC에 위임된다.
AMD는 또한 "틱-톡" 배포 전략을 도입할 수 있다: 고객은 먼저 유연한 인스티크 가속기를 사용해 모델을 검증한 후, 모델이 최종 결정되면 생산 규모의 고성능 추론을 위해 타알라스 가속기로 전환할 수 있다.
트레이드오프: 유연성 vs 성능
MSIC의 주요 단점은 유연성 부족이다. 가중치가 실리콘에 각인되어 있기 때문에, 중요한 모델 업데이트가 필요하면 하드웨어 재설계가 필요하다.
완화 및 비용
업데이트의 비용과 시간을 줄이기 위해, 타알라스는 재설계 시 실리콘 공정을 처음부터 시작하지 않고, 단지 두 층의 금속만 변경하면 된다고 주장한다. 또한 회사는 실리콘에 가중치를 각인하는 것이 선도 모델의 초기 학습보다 100배 적은 비용이 든다고 제안한다.
타겟 사용 사례
하드웨어의 강성 때문에 이 기술은 다음 분야에서 가장 가능성이 높게 채택될 것으로 보인다:
- 선도 모델 개발자: OpenAI, Anthropic, 메타와 같은 안정적이고 고-traffice 모델을 보유한 기업
- 인프라 제공업체: 토큰당 비용을 낮추고자 하는 대규모 추론 제공업체
- 임베디드 시스템 및 IoT: 로봇 및 엣지 장치에서 지연 시간이 짧고 로컬 추론이 중요한 분야이며, 모델 업데이트가 드물다
AI 개발 및 사용자 경험에 미치는 영향
추론 속도의 증가는 AI 모델의 사용 및 개발 방식을 근본적으로 변화시킬 수 있다:
- 테스트 시각 스케일링: 모델 개발자는 모델이 더 오래 "생각"하게(테스트 시각 스케일링) 하여 환각을 줄이고 정확도를 높일 수 있지만, 사용자가 기다리는 시간은 합리적인 수준을 유지할 수 있다.
- 다중 에이전트 오케스트레이션: 초고속 토큰 생성(초당 토큰 수, TPS)은 수십 또는 수백 개의 전문 하위 에이전트를 실시간으로 검증하고 출력을 수정하는 데 가능하게 하며, 사용자 인식 지연을 희생하지 않는다.
- 새로운 UX 패턴: 고속 추론은 "타이핑하면서 찾기"와 같은 AI 상호작용 및 모든 디지털 정보의 실시간 증강을 가능하게 할 수 있다.
커뮤니티의 시각과 기술 분석
업계 관찰자와 개발자들은 타알라스 인수에 대해 몇 가지 중요한 점을 강조했다:
"모델은 별로지만 속도는 놀랍다... 추론과 도구 사용 생성은 TPS에 비례한다. 모델에서 100배 더 많은 추론이나 100배의 병렬 도구 사용을 상상해 보라."
비판자들은 최첨단(SOTA) 모델의 빠른 변화가 주요 위험 요소라고 지적한다. 어떤 이들은 실리콘 제조가 끝날 무렵 이미 모델이 낡아졌을 수 있다고 주장한다. 그러나 지지자들은 특정 비즈니스 용도에 적합한 "충분히 좋은" 모델을 "블랙박스" 하드웨어에 고정해 사내 고속 로컬 연구 및 데이터 처리를 가능하게 할 수 있다고 제안한다.
다른 기술적 관찰로는, 이러한 칩이 모듈형 슬롯(예: ZIF 소켓 또는 USB-C 가속기)에 구현된다면 "FPGA의 강화판"처럼 작동할 수 있다는 점이다. 이 경우 사용자는 하드웨어 모듈로 모델을 물리적으로 교체할 수 있다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch