Inkling 오픈-웨이트 모델 출시

Thinking Machines는 맞춤화와 파인튜닝을 위한 유연하고 오픈-웨이트 기반을 제공하도록 특별히 설계된 멀티모달 Mixture-of-Experts (MoE) 모델인 Inkling을 출시했습니다. 일반 벤치마크에서 1위를 차지하려는 경쟁 대신, Inkling은 멀티모달 기능, 효율적인 “thinking” 노력, 그리고 특수한 실제 작업 흐름에 대한 적응 용이성의 균형을 우선시합니다.

모델 아키텍처 및 사양

Inkling은 총 9750억 파라미터를 갖는 Mixture-of-Experts 트랜스포머이며, 토큰당 410억 개의 활성 파라미터를 사용합니다. 최대 100만 토큰의 컨텍스트 윈도우를 지원하며, 텍스트, 이미지, 오디오, 비디오 45조 토큰에 대해 사전 학습되었습니다.

기술 설계

  • MoE 구조: 이 아키텍처는 DeepSeek-V3와 유사한 설계를 따르며, 256개의 라우팅된 전문가와 2개의 공유 전문가를 사용하고, 토큰당 6개의 라우팅된 전문가가 활성화됩니다.
  • Attention 메커니즘: 모델은 슬라이딩 윈도우와 글로벌 레이어를 5:1 비율로 교차 배치하고 8개의 KV 헤드를 사용합니다. 긴 시퀀스에 대한 외삽을 개선하기 위해 Rotary Positional Embedding (RoPE) 대신 Shaw 등 및 Huang 등의 연구를 기반으로 한 상대 위치 임베딩을 사용합니다.
  • 멀티모달성: Inkling은 오디오와 비전을 위한 인코더 없는 아키텍처를 사용합니다. 오디오는 이산 dMel 스펙트로그램으로 처리되며, 이미지는 40x40 픽셀 패치를 4계층 hMLP로 인코딩합니다. 두 입력 모두 텍스트 토큰과 함께 공동으로 처리됩니다.
  • 최적화: 학습은 대형 행렬 가중치에 Muon을, 기타 파라미터에 Adam을 사용하는 하이브리드 전략을 적용했으며, 가중치 안정성을 유지하기 위해 가중치 감쇠를 학습률의 제곱에 결합했습니다.

제어 가능한 Thinking 노력

Inkling의 주요 차별점 중 하나는 제어 가능한 thinking 노력을 지원한다는 것으로, 개발자가 성능을 지연 시간 및 토큰 비용과 균형 맞출 수 있게 합니다.

노력 설정을 0.2에서 0.99 사이로 조정함으로써, 사용자는 모델이 추론에 사용하는 토큰 수를 제어할 수 있습니다. Terminal Bench 2.1, HLE, IFBench에서의 벤치마크 결과는 Inkling이 Nemotron 3 Ultra와 같은 다른 오픈-웨이트 모델과 성능을 맞추면서도 훨씬 적은 토큰(일부 경우 약 1/3)을 사용함을 보여줍니다.

기능 및 벤치마킹

Inkling은 에이전시 작업, 추론, 코딩, 멀티모달 입력 전반에 걸쳐 학습된 범용 모델로, 좁은 최적화를 피하도록 설계되었습니다.

에이전시 코딩 및 도구 사용

Inkling은 코딩 및 에이전트 활용 환경에서 작동하도록 설계되었습니다. 다음과 같은 능력을 보여주었습니다:

  • 한 번에 기능적인 웹 앱을 구축한다.
  • 다중 페이지이며 일관된 스타일의 산출물(예: 9페이지 PDF 저널)을 만든다.
  • 40번의 피드백 반복을 통해 멀티플레이어 게임을 개선하는 등 긴 정제 루프를 유지한다.

멀티모달 성능

Inkling은 텍스트, 이미지, 오디오에 대해 자연스럽게 추론합니다. 오디오 분야에서는 VoiceBench, MMAU, AudioMC에서 경쟁력 있는 성능을 보이며, 차트, 다이어그램, 수학적 시각 추론 작업에서도 강력한 결과를 나타냅니다. 또한 추론 중에 파이썬 도구를 활용해 이미지 확대 및 자르기와 같은 작업을 수행할 수 있습니다.

인식론 및 안전성

  • 보정: 모델은 적절한 점수 규칙에 대한 강화학습(RL)으로 학습되어, 특히 예측 작업에서 적절한 신뢰 수준을 표현하도록 합니다.
  • 명령 수행: Thinking Machines는 이중 평가 시스템(회상을 위한 루브릭 평가자와 에이전시 웹 검색을 통한 주장 검증을 위한 사실성 평가자)을 사용해 환각을 감소시켰습니다.
  • 검열: 모델은 종종 검열 대상이 되는 주제에 대해 직접 답변하도록 학습되었으며, Cognition 팀의 평가에서 검열 제약을 따르지 않는 강한 패턴을 보였습니다.
  • 안전성: FORTRESS 벤치마크에서 Inkling은 비교된 오픈-웨이트 모델 중 가장 강력한 내장 안전 장치를 보여주었으며, 해로운 요청은 거부하면서도 정상적인 요청을 과도하게 거부하지 않았습니다.

Inkling-Small 미리보기

Thinking Machines는 276B 파라미터 MoE 모델이며 12B 활성 파라미터를 가진 Inkling-Small도 미리 선보였습니다. 규모가 작음에도 불구하고 Inkling-Small은 GPQA Diamond와 IFBench를 포함한 여러 벤치마크에서 대형 모델과 동등하거나 뛰어난 성능을 보여, 합성 데이터 생성이나 자동 채점과 같은 저지연 작업에 적합한 후보가 됩니다.

생태계 및 맞춤화

Inkling은 Tinker 플랫폼을 통해 파인튜닝하도록 설계되었습니다. 이를 지원하기 위해 Thinking Machines는 다음을 출시했습니다:

  • Inkling Playground: 모델과 채팅하고 테스트할 수 있는 개발자 인터페이스.
  • TML-Renderer: 채팅 템플릿 및 멀티모달 입력을 사용한 샘플링 및 사후 학습 도구.
  • 배포 파트너: Together, Fireworks, Modal, Databricks, Baseten, SGLang, vLLM, TokenSpeed, llama.cpp, Hugging Face transformers와의 통합.

커뮤니티 인사이트 및 분석

기술 사용자들 간의 논의는 이번 출시와 관련된 몇 가지 주요 관점을 강조합니다:

  • 전략적 포지셔닝: 사용자들은 Thinking Machines가 리더보드 지배보다는 맞춤화 경쟁을 하고 있다고 언급했습니다. 한 관찰자는 다음과 같이 말했습니다:

    "Tinker에서 파인튜닝할 수 있는 오픈 베이스 모델은 훌륭한 비즈니스 모델입니다... 여러분(즉, 기업)은 자체 모델을 소유하고, 해당 작업에서 최첨단 수준 혹은 그 이상의 성능을 잠재적으로 훨씬 낮은 비용으로 구현할 수 있습니다."

  • 지역 경쟁: 일부 사용자는 이번 출시를 최근 DeepSeek와 GLM 같은 중국 모델이 주도해 온 오픈-웨이트 분야에 대한 강력한 미국 진출로 보았습니다.
  • 벤치마크에 대한 주의: 일부 비평가들은 레이더 플롯이나 특정 벤치마크 선택이 실제 성능을 가릴 수 있다고 지적하며, 개발자들이 자신들의 환경에서 직접 평가를 수행할 것을 권고했습니다.

Sources

관련