Thinking Machines Inkling 릴리스 노트 / 새로운 기능
Thinking Machines Inkling 릴리스 노트 / 새로운 기능
Thinking Machines는 이미지, 텍스트, 오디오 입력을 네이티브하게 처리할 수 있는 massive 1조 파라미터 오픈 모델인 Inkling을 출시했습니다. 이 릴리스는 1백만 토큰 컨텍스트 윈도우와 에이전틱 추론 기능을 갖춘 대규모 멀티모달 오픈 모델을 제공하기 때문에 중요합니다.
모델 아키텍처 및 기능
Inkling은 디코더 전용 멀티미달 Mixture-of-Experts (MoE) 모델입니다. 총 9750억 개의 파라미터를 갖는 희소 아키텍처를 활용하며, 단일 추론 패스 동안 410억 개의 파라미터만 활성화되어 더 빠른 계산을 가능하게 합니다.
주요 아키텍처 기능
- 상대적 주의: Rotary Positional Embeddings (RoPE)를 사용하는 대신, Inkling은 각 주의 레이어가 토큰당, 헤드당 상대적 특성 투영을 통해 주의 로짓에서 직접 위치를 학습하는 상대적 주의 방식을 사용합니다.
- 하이브리드 주의: 모델은 글로벌 주의와 슬라이딩 윈도우 주의를 5:1 비율로 교차하는 하이브리드 방식을 사용하며, 최종 레이어는 풍부한 특징 표현을 위해 글로벌 주의를 활용합니다.
- 단일 컨볼루션 (SConv): 은닉 상태에 1D 컨볼루션을 적용하여 로컬 표현을 처리함으로써 주의 및 MoE 모듈의 계산 부하를 줄입니다.
- 공유 전문가를 갖춘 MoE: 라우터는 256개의 전문가 중에서 상위 k개를 선택하여 6개의 라우팅된 전문가와 항상 활성 상태인 2개의 공유 전문가를 선택합니다.
멀티모달 처리
각 모달리티에 별도의 인코더에 의존하는 모델과 달리, Inkling은 비교적 간단한 멀티미달 타워를 사용합니다:
- 비전: 계층적 MLP 패치피커가 픽셀을 점진적으로 임베딩으로 병합합니다. 이 아키텍처는 비디오 처리를 위한 시간 차원을 지원합니다.
- 오디오: 오디오 이산화된 멜 스펙트로그램을 통해 변환되며, 100ms 청크가 멜 스펙트로그램 빈으로 분류된 후 임베딩됩니다.
추론 및 배포
Inkling은 두 가지 주요 형식으로 제공됩니다: 2TB의 VRAM이 필요한 전체 BF16 체크포인트와 600GB의 VRAM이 필요한 잘 calibrated된 NVFP4 변형입니다.
지원 프레임워크
- Transformers:
transformers라이브러리(버전 5.14.0+)의any-to-any파이프라인을 통해 Day-0 지원을 사용할 수 있습니다. 사용자는none에서max까지 범위의reasoning_effort수준을 지정할 수 있습니다. - 고성능 엔진: 모델은 속도를 위한 커스텀 구현이 포함된 SGLang, 프로덕션 서빙에 최적화된 vLLM, 그리고 GGUF quant을 통한 로컬 배포를 위한 llama.cpp에서 지원됩니다.
- 로컬 배포: Unsloth는 1비트 정밀도 양자화를 제공하여 원래 모델 대비 VRAM 소비를 95% 줄입니다.
성능 및 벤치마크
Inkling은 추론, 에이전틱, 멀티미달 벤치마크 전반에서 경쟁력 있는 성능을 보여줍니다. 많은 영역에서 높은 숙련도를 보이지만, 성능은 특정 작업과 추론 노력 수준에 따라 달라집니다.
추론 및 사실성
텍스트 전용 추론(HLE)에서 Inkling은 29.7%를 기록하며, Claude Fable 5(53.3%) 및 GPT 5.6 Sol(47.2%) 같은 모델보다 뒤처집니다. 그러나 AIME 2026에서 수학적 추론에 강점을 보여 97.1%의 점수를 얻습니다.
에이전틱 및 멀티미달 성능
- 코딩: SWEBench Verified에서 Inkling은 77.6%를 달성하며, Gemini 3.1 Pro(80.6%) 및 Claude Fable 5(95.0%)와 같은 모델과 경쟁력 있는 성능을 보입니다.
- 비전: MMMU Pro(Standard 10)에서 Inkling은 73.3%를 기록합니다.
- 오디오: VoiceBench에서 Inkling은 91.4%의 점수를 달성합니다.
사후 훈련 및 연구 도구
Thinking Machines는 파인튜닝 또는 강화 학습을 통해 모델을 적응시키려는 개발자를 위한 도구를 제공합니다:
- Tinker: 오픈 가중치 모델의 사후 훈련을 위한 관리형 도구로, 증류 및 RL을 위한 쿡북이 포함됩니다.
- OpenEnv: ECHO 알고리즘을 사용하여 모델을 훈련시키는 에이전틱 RL 환경 도구로, 별도의 검증자 없이 모델이 환경을 예측할 수 있게 합니다.
- 지식 증류: Inkling은 GOLD 알고리즘을 사용하여 서로 다른 토크나이저 간의 토큰 로짓을 맞추어 더 작은 온디바이스 모델의 교사 모델로 사용될 수 있습니다.