Poolside의 모델 팩토리, Laguna S, 그리고 오픈 모델: AGI를 위한 코드 모델 구축에 대한 Eiso Kant의 이야기
Poolside의 모델 팩토리, Laguna S, 그리고 오픈 모델: AGI를 위한 코드 모델 구축에 대한 Eiso Kant의 설명
모델 팩토리가 빠른 실험을 가능하게 함
Poolside의 모델 팩토리는 스트리밍 데이터, 버전 관리된 코드, 자동화된 에이전트를 통합함으로써 모델 개발 기간을 수개월에서 수주로 단축합니다. 팀은 Laguna XS2와 Laguna S와 같은 모델에 대해 6개월 주기에서 5주 및 8주 출시로 전환했습니다. 그들은 매월 10,000~20,000개의 실험을 수행하며, 하루 전에 만든 변경 사항을 다음 실행에 바로 반영할 정도로 머신을 신뢰합니다. 에이전트는 코드를 작성하고, 학습 작업을 시작하며, 결과를 평가하고, 파이프라인을 수정함으로써 인간의 루프를 축소합니다. 불변 데이터와 버전 관리된 코드는 완벽한 재현성을 제공하여 모든 실험을 정확히 다시 실행할 수 있게 합니다.
Laguna S는 원시 지능보다 지속성을 우선시한다
Laguna S는 규모만이 아니라 검증, 역추적, 지속적인 추론을 통해 강력한 성능을 달성합니다. 이 모델은 총 1180억 파라미터 중 80억 파라미터가 활성화되어 있으며, DGX Spark에 탑재될 수 있고 초당 약 30~40 토큰을 처리합니다. 응용 연구 공동 책임자인 Peng은 Laguna S의 향상이 “더 많은 지능 때문이 아니라, 다른 행동, 더 많은 검증, 당연히 여기지 않음, 조기에 승리를 선언하지 않음, 그리고 훨씬 더 지속적인 것” 때문이라고 말했습니다. 이 모델은 Erdos 397 문제를 독립적으로 해결하고, 외부 라이브러리 없이도 시도와 오류를 지속함으로써 복잡한 프로그래밍 작업을 수행할 수 있습니다.
오픈 가중치와 오픈 연구는 다르다
모델 가중치만 공개해도 복제는 불가능하며, 진정한 개방성을 위해서는 연구 세부 정보를 공유해야 합니다. 가중치를 제공받은 사람은 기본 연구, 데이터 혼합, 학습 파이프라인이 숨겨져 있기 때문에 여러분이 하는 일을 재현할 수 없습니다. 따라서 Poolside는 데이터 소스, 옵티마이저 선택, 학습 절차 등을 포함한 모델 구축 방식을 상세히 기술한 기술 보고서를 공개합니다. 그들은 오픈 연구를 수만 건의 실험으로부터 다른 이들이 배울 수 있게 하는 의미 있는 기여로 보고 있습니다.
글로벌 인재 전략으로 베이 지역 경쟁 회피
Poolside는 전 세계의 전문성을 활용하고 인재 전쟁을 피하기 위해 베이 지역 외에 분산 팀을 구축했습니다. 시작부터 창업자들은 베이 지역에서 연구원을 고용하지 않기로 결정하고, 미국 중서부부터 세르비아, 대만, 싱가포르까지 전 세계를 탐색했습니다. 그들은 미국에 거점을 유지하면서 파리와 런던에 사무소를 열었으며, 최고의 혁신 아이디어는 한 지역에 국한되지 않는다고 믿었습니다. 이러한 글로벌 접근 방식은 팀에 회복력과 지속성을 부여했으며, 수년간 떠나는 인원은 거의 없었습니다.
모델 구축은 대부분 엔지니어링이다
기초 모델 개발 작업의 90% 이상이 이론적 돌파구가 아니라 엔지니어링입니다. Poolside는 초기부터 모델 구축이 궁극적으로 90%는 엔지니어링이며, 연구원들은 대부분 코드를 작성하고, 데이터를 검토하고, 실험을 수행하는 데 시간을 보낸다고 보았습니다. 회사는 이 과정을 산업화된 시스템으로 간주하며, 데이터 파이프라인, 분산 학습, 신뢰성 등 각 구성 요소마다 자체적인 기계가 있습니다.
데이터와 연산 효율성이 성장을 이끈다
데이터 품질 향상이나 연산 효율성 개선이 모델 구축에서 대부분의 진전을 차지합니다. Eiso는 모델 구축의 95%가 더 나은 데이터 또는 더 나은 연산 효율성이라는 두 가지 레버로 축소될 수 있다고 추정합니다. FP8을 이용한 저정밀 학습(Laguna S)이나 더 스마트한 네트워킹과 같은 진보는 기존 하드웨어에서 더 많은 성능을 끌어냅니다. 더 나은 데이터는 필터링, 정제, 변환, 그리고 모델이 학습 초기에 추론하도록 가르치는 커리큘럼을 만드는 것을 포함합니다.
스트리밍 데이터와 재현성이 연구를 가속한다
데이터를 직접 학습에 공급하고 불변 데이터셋을 유지함으로써 빠르고 신뢰할 수 있는 실험이 가능해집니다. 각 실행 전에 전체 데이터셋을 만들지 않고, Poolside는 데이터가 도착하는 즉시 스트리밍하여 나머지 데이터가 아직 도착 중일 때도 학습을 시작할 수 있습니다. 데이터 레이어는 불변으로, 코드는 버전 관리된 것으로 취급되어 연구원들이 각 토큰을 정확한 출처와 코드 버전으로 추적할 수 있습니다. 이 재현성 덕분에 이전의 YOLO 스타일 실행이 각 실험이 깔끔한 절제(ablations)인 엄격한 과학 실험으로 전환되었습니다.
에이전트가 모델 팩토리를 자동화한다
에이전트는 이제 코드를 작성하고, 학습 작업을 시작하며, 결과를 평가하고, 파이프라인을 수정함으로써 인간 루프 시간을 감소시킵니다. 사무실을 걸어다니면, Eiso는 연구원들의 화면에 에이전트가 코딩하고, 작업을 제출하고, 결과를 확인하며, 학습 인프라를 조정하는 모습을 봅니다. 에이전트는 사전·사후 학습 파이프라인과 합성 데이터 생성 모두에서 작동하며, 이제 아키텍처 결정에도 영향을 미치기 시작했습니다. 이 자동화는 시스템이 자체 학습 과정을 개선하는 재귀적 자기 개선의 초기 징후를 만들고 있습니다.
강화 학습이 더 일찍 이동할 것이다
Eiso는 강화 학습이 사전 학습 단계로 이동해 추론을 더 일찍 가르칠 것으로 기대합니다. 그는 강화 학습이 별도의 사후 학습 단계에 머무르기보다 점점 더 사전 학습 단계로 이동한다는, 흔히 받아들여지지 않는 의견을 가지고 있습니다. 초기 강화 학습은 모델이 아직 원시 웹 텍스트를 보고 있을 때 추론 능력을 유도하여, 다음 토큰 예측을 사고 과정으로 전환할 수 있습니다.
다음 토큰 예측은 웹 지식을 충분히 활용하지 못한다
현재 사전 학습은 웹으로부터 너무 적은 정보를 추출하고 있으며, 원시 텍스트를 추론으로 전환하는 더 나은 방법이 필요합니다. Eiso는 다음 토큰 예측 사전 학습만으로는 충분하지 않으며, 우리는 아직 웹에서 얻어야 할 것을 겨우 짜내고 있다고 주장합니다. 연구는 웹을 활용해 모델이 학습 초기에 사고하도록 가르치는 방안을 모색하고 있으며, 순수 통계적 예측을 넘어서는 것을 목표로 하고 있습니다.
시각 모달리티를 우선시하고, 오디오는 지연
Poolside는 언어 다음 단계로 시각 이해에 집중하고, 오디오 작업은 미루고 있습니다. 현재 모델은 시각 이해가 부족하지만, 팀은 이를 매우 중요하게 여기며 구축 노력을 시작했습니다. Eiso는 오디오가 시스템을 AGI에 더 가깝게 만들지 못한다고 생각해, 언어와 시각에 연산 자원을 투자하는 것을 선호합니다.
Poolside 이름과 야망
Poolside라는 이름은 창업자들에게 야망을 절대 낮추지 말라는 의미를 상기시켜 주며, 회의에서의 우연한 만남에서 영감을 받았습니다. 잠재 파트너와의 초기 대화에서, 수석 과학자가 레스토랑의 풀사이드로 이동하자고 제안했고, 그 이름은 쉬운 인수 제안을 거절하고 더 어려운 길을 선택하라는 상징이 되었습니다. 이는 기초 모델을 구축할 때 야망을 절감하지 않겠다는 상징입니다.
자금 조달 및 투자자 회의론
Poolside는 5억 달러를 모금했지만, 많은 투자자들은 여전히 AGI의 실현 가능성을 의심했습니다. 자금 조달 라운드 동안 대부분의 투자자와의 대화는 이 모델들이 단순한 확률적 모방이 아니며 지속적으로 개선될 것임을 설명하려는 것이었습니다. AGI가 실제로 가까운 시일 내에 실현될 수 있는가에 대한 회의론에도 불구하고 자본을 확보했습니다.
오픈 모델 과도한 제한의 위험
오픈 모델 공개에 대한 조기 제한은 권력을 집중시키고 혁신을 저해할 수 있습니다. Eiso는 Poolside가 다섯 개 중 하나가 되더라도, 100개의 기초 모델 기업이 있는 세상을 선호합니다. 그는 규제나 안전 우려가 오픈 공개를 차단하면, 담배 광고 금지로 소수의 담배 기업이 고착된 것처럼 두세 개 AI 기업의 과점이 우연히 형성될 수 있다고 경고합니다.
하드웨어 병목과 RL 실제 시간
배치 크기에 제한받는 강화 학습의 실제 시간은 하드웨어 발전에도 불구하고 여전히 주요 병목입니다. RL 작업은 유한하기 때문에 배치 크기를 늘리기 어렵고, RL을 위한 연산 규모 확대는 사전 학습과 같은 곡선을 따르지 않습니다. Eiso는 이를 현재 Poolside의 가장 큰 병목 중 하나로 꼽으며, 프리필과 디코드를 서로 다른 칩으로 분리해 RL 효율성을 높이는 기술을 기대하고 있습니다.
증류 대신 처음부터 학습
Poolside는 큰 모델을 단순히 증류하는 대신 처음부터 모델을 학습하여 연구 통제권을 완전히 유지합니다. 증류는 학습 과정에서 얻은 교훈을 숨겨 모델 팩토리를 개선하기 어렵게 만들 것입니다. 처음부터 학습함으로써 팀은 안정성, 데이터 혼합, 옵티마이저 동작을 각 규모에서 연구하고, 그 통찰을 시스템에 다시 반영할 수 있습니다.
모델 구축 전 영역 채용
회사는 사전 학습, 사후 학습, 아키텍처, 평가, 엔지니어링 역할을 위한 연구원과 엔지니어를 채용합니다. Poolside는 모델 구축 전 영역에 걸쳐 채용하며, 실험과 인프라에 대한 주도권을 가질 수 있는 높은 주도성을 가진 인재를 찾습니다. 연구원 70명 미만, 엔지니어 약 35명으로, 각 채용은 모델 팩토리의 속도와 역량에 큰 영향을 미칩니다.