Claude 5 Fable: Mythos-Class AI 모델 평가
Claude 5 Fable는 Mythos-class AI 모델의 첫 번째 공개 버전으로, AI가 협업 도구에서 자율적인 에이전트로 전환되는 변화를 나타냅니다. 초기 테스트에서 Fable은 복잡하고 수 시간이 소요되는 워크플로우를 실행하고, 하위 AI 에이전트들을 조율하여 인간의 개입을 최소화하면서 연구를 수행하고, 코드를 검증하며, 정교한 소프트웨어 및 데이터 시각화를 생성하는 능력을 보여줍니다.
자율 실행 및 멀티 에이전트 오케스트레이션
Claude 5 Fable는 연구, 판단, 반복적인 개발이 필요한 장기적이고 자율적인 작업을 처리하는 능력으로 이전 모델들과 차별화됩니다. 단일 응답을 제공하는 대신, Fable은 수 시간에 걸쳐 수 페이지 분량의 사양을 실행할 수 있습니다.
사례 연구: 등시선 지도(The Isochronic Map)
완전한 조사를 거친 등시선 지도(시간에 따른 이동 거리를 보여주는 지도)를 구축하기 위해, Fable은 멀티 에이전트 워크플로우를 활용했습니다:
- 연구 위임: Fable은 여러 하위 AI(주로 Claude Sonnet)를 실행하여 학술 논문으로부터 2,200개 이상의 특정 항공편, 철도 일정(TGV 및 Shinkansen 포함), 도로 속도를 추출했습니다.
- 동시 개발: 연구 에이전트들이 활발히 작동하는 동안, Fable은 애플리케이션 코딩을 시작했습니다.
- 검증: 모델은 추가 에이전트와 테스트를 실행하여 코드를 검증하고 진행 상황을 기록했습니다.
- 적대적 정교화: 원격 지역의 데이터를 개선하라는 요청을 받았을 때, Fable은 적대적 에이전트 그룹을 배치하여 결과를 연구하고 교차 테스트하여, Pitcairn Island로의 운송 일정과 Grise Fjord로의 이동 경로를 성공적으로 식별했습니다.
사례 연구: Concord Software
Fable은 복잡한 데이터 분석을 위한 인간과 AI의 응답을 교정하는 목적으로 설계된 "Concord"라는 소프트웨어를 개발했습니다. 이 프로젝트는 다음을 포함합니다:
- 설계 단계: 복잡한 19페이지 분량의 설계 문서 생성.
- 실행 단계: 기능적인 소프트웨어를 구축하기 위해 9시간 30분 동안 지속적으로 작업함.
성능 역량 및 제약 사항
Fable은 학술 사회과학 논문부터 복잡한 수학적 예술(외부 자산 없이 수학만으로 3D 객체와 게임을 생성하는 것)에 이르기까지 광범위한 작업에서 일반적인 역량이 크게 향상되었음을 보여줍니다.
기술적 및 운영적 한계
그 강력한 성능에도 불구하고, Fable은 몇 가지 주목할 만한 제약 사항을 가집니다:
- 토큰 소비: Fable은 Claude Opus보다 두 배 더 비싸며 토큰을 높은 비율로 소비하지만, 더 저렴한 모델에 작업을 위임하는 능력이 전체 비용을 완감할 수 있습니다.
- 안전 가드레일: 모델은 사이버 보안 및 생물학 분야에 엄격한 가드레일을 적용합니다. 이러한 가드레일이 트리거될 때—때로는 "안전하고 정상적인 콘텐츠"에 의해서도—시스템은 성능이 낮은 Claude 4.8 Opus로 기본 설정이 돌아갑니다.
- "블랙박스" 효과: Fable은 수백 개의 작은 판단을 자율적으로 내리기 때문에, 사용자의 역할은 프로세스를 "조종"하는 것 것에서 결과물을 "의뢰"하는 것으로 전환됩니다. 내부 의사결정 과정은 인간이 실시간으로 모니터링하기에는 너무 길고 복잡합니다.
커뮤니티 관점 및 비판
사용자와 커뮤니티 구성원들의 피드백은 출력물의 "느낌(vibe)"과 결과의 기술적 엄밀함 사이의 간격에 대해 강조합니다.
코드 품질 및 검증
비판론자들은 Fable의 자율적인 특성이 기저의 기술적 부채를 가생할 수 있다고 주장합니다. Concord 프로젝트를 위해 생성된 코드를 검토한 일부 사용자들은 이를 "유지보수가 불가능한 엉망진창"이라고 묘사하며, 출력물이 기능적일 수는 있으나 다음과 같은 요소가 부족할 수 있음을 시사합니다:
- 적절한 문서화 및 테스트.
- 장기적인 확장성.
- 보안 감사.
정확도 및 "환각(Hallucinations)"
일부 사용자들은 생성된 등시선 지도에서 사실적 오류를 발견했습니다. 특정 지역(예: 러시아 후방 지역)으로의 이동 시간이 역사적 또는 지리적 현실과 비교했을 때 부정확하게 나타난다는 점을 지보했습니다.
사용자 경험 및 유용성
일부 사용자는 자율 에이전트 방식이 혁신적이라고 생각하는지 반면, 다른 이들은 수 시간 소요되는 워크플로우의 유약성(utility)을 의심합니다. 한 개발자는 업계계의 20초 미만의 응답 시간 요구 사항과 작업 완료에 수 시간이 소리가리는 모델의 불일치(dissonance)를 industry의 demands and requirements
"작업의 중심이 프로세스에서 결과물로 이동했습니다. 나는 더 이상 조종하지 않습니다. 나는 의뢰합니다."
이러한 전환은 인간 운영자의 역할이 단계별 실행을 관리하는 개발자가 아닌, 최종 결과물을 승인하는 후원자 또는 클라이언트의 역할로 이동하고 있음을 시사합니다.