강화 학습을 사용하여 코드로 그림을 그리는 AI 학습시키기
편집 가능한 코드로 생성된 AI 예술
Surya Narreddi와 연구팀은 픽셀을 생성하는 대신 코드를 작성하여 이미지를 생성하도록 언어 모델을 학습시키는 방법을 개발했습니다. 코드를 주요 결과물로 취급함으로써, 시스템은 이미지의 세밀하고 직접적인 편집을 가능하게 합니다. 이는 프롬프트가 유일한 상호작용 지점인 기존의 AI 이미지 생성기와는 크게 다른 점입니다.
강화 학습 루프
이 시스템은 모델이 미적 결과를 생성하는 능력을 정교화하기 위해 학습 과정 동안 수천 번 실행되는 4단계 반복 루프를 사용합니다:
- Generation: 모델이 프롬프트(예: "draw a peach hibiscus in watercolour")를 받고 완전한 p5.brush JavaScript 스케치를 작성합니다.
- Rendering: 스케치는 샌드박스된 Puppeteer 환경에서 실행되어 PNG 이미지를 생성합니다.
- Judgment: 별도의 판사 모델이 결과 PNG를 수동으로 평가된 풀(pool)에서 가져온 두 개의 무작위 참조 그림과 비교하여 더 우수한 수채화 작품을 선택합니다.
- Update: 판정 결과는 보상 신호로 변환되며, Group Relative Policy Optimization (GRPO)를 사용하여 모델을 업데이트합니다.
미학을 위한 보상 함수 설계
미적 품질은 주관적이며 수학 문제처럼 "정답" 또는 "오답"으로 검증할 수 없기 때문에, 이 프로젝트는 주요 과제로 보상 함수의 설계를 데으로 집중합니다. 연구원들은 보상 함수가 신중하게 균형을 이루어야 한다는 것을 발견했습니다. 보상 함수가 너무 엄격하면 모델이 조기에 수렴하고, 너무 느슨하면 모델이 표류하게 됩니다.
참조 풀(Reference Pool)
보상 신호를 근거 있게 만들기 위해, 팀은 581개의 참조 그림 풀을 큐레이션했습니다. 이는 1,664개의 생성물에서 파생되었으며 세 가지 등급으로 분류되었습니다: 117개의 "love-tier," 266개의 "okay," 그리고 색상 표현의 공백을 메우기 위해 사용된 198개의 보충물입니다.
니치한 p5.brush 라이브러리를 사용하는 인간 제작 예시가 부족했기 때문에, 참조 풀은 두 가지 파이프라인을 사용하여 채워졌습니다:
- AutoResearch: VLM (Vision Language Model) 판사 모델 하에서 참조 사진을 대상으로 반복 작업을 수행하기 위해 Opus 4.6, GPT-5.4, Gemini 3.1 Pro를 활용했습니다.
- Batch Run: Gemini 3.1 Pro를 사용한 더 큰 규모의 생성 실행입니다.
시스템 프롬프트 진화 및 API 환각 현상
이 프로젝트의 주요 기술적 발견 중 하나는 시스템 프롬프트에 광범위한 API 문서를 제공하는 것이 실제로 환각 현상을 증가시킬 수 있다는 것입니다. 초기 버전의 프롬프트에는 400줄의 p5.brush API 참조가 포함되어 있었으며, 이는 모델이 존재하지 않는 API를 자신 있게 만들어내는 결과를 초래했습니다.
이를 해결하기 위해, 팀은 taste-anchored 7-shot 판사 모델을 대상으로 200회 반복하여 프롬프트를 진화시키는 GEPA (프롬프트 최적화 라이브러리)를 사용했습니다. 최적화 결과, 8개의 브러시 메서드만을 허용하는 엄격한 허용 목록(allowlist)과 API 문서나 예시가 없는 매우 제한된 프롬프트로 수렴되었습니다. 이러한 최소한의, 주관적인 접근 방식은 환각 현상을 크게 줄이고 실제 시각적 출력을 개선했습니다.
커뮤니티 통찰력의 종합
이 프로젝트에 대한 커뮤니티 논의는 생성 예술과 현대 RL 기술의 교차점을 강조합니다. 일부 기여자는 브러시 스트로크를 학습하는 초기 연구(예: 2018년의 GAN-based 방법)와의 유사성과 이 접근 방식을 SVG나 voxel과 같은 다른 형식으로 적용할 수 있는 잠재력을 언급했습니다.
댓글에서 제기된 한 가지 기술적 반론은, RL이 학습 분포 외부의 스타일이나 참신함을 생성하는 데 비효율적일 수 있다는 점을 시사하며, 다음과 같이 언급했습니다. 유사한 작업에 대해 베이스 모델에 대한 지도 학습 미세 조정(SFT)이 행동 학습의 대부분을 처리하는 경우가 많기 때문입니다:
"RL is very ineficient at style or at least at generating novelty out of distrib."
결론
코드를 통해 이미지를 생성하는 것은 전통적인 확산 모델(diffusion models)보다 느리지만, 편집 가능한 결과물을 제공함으로써 사용자를 관찰자에서 창의적인 참여자로 변화시킵니다. 이 프로젝트는 창의적인 작업을 위한 RL은 본질적으로 설계 문제임을 보여줍니다: 인간의 취향향을 모델의 선호도로 일반화할 수 있는 구조를 만드는 것입니다.
Sources
관련
- 프로젝트
- 프로젝트
- Dispatch
- Dispatch