Ornith-1.5 출시: 추론 및 코딩을 위한 엔드투엔드 자기 개선(Self-Improvement)
Ornith-1.5 출시: 추론 및 코딩을 위한 엔드투엔드 자기 개선(Self-Improvement)\n\nOrnith-1.5는 고성능 추론, 에이전트 및 코딩 작업을 위해 설계된 파운데이션 모델 시리즈입니다. 이는 Ornith-1.0의 self-scaffolding 프레임워크를 모델이 자율적으로 새로운 작업을 제안하고, 작업별 scaffold를 생성하며, 강화 학습을 위한 솔루션 rollout을 생성하는 완전한 자기 개선 루프로 진화시켰습니다.\n\n## 모델 성능 및 스케일링\n\nOrnith-1.5는 세 가지 규모로 출시되었으며, 다양한 벤치마크에서 독점 모델 및 오픈 소스 모델 모두에 대해 경쟁력 있는 성능을 보여줍니다.\n\n### Ornith-1.5-397B (MoE)\n플래그십 397B Mixture-of-Experts (MoE) 모델은 여러 주요 벤치마크에서 Claude Opus 4.8과 대등한 성능을 보여줍니다. Terminal-Bench 2.1에서 86.1점을, DeepSWE에서 56.0점을 기록하며, GLM-5.2 (82.7 및 46.2) 및 DeepSeek-V4-Flash-0731 (82.7 및 54.4)와 같은 오픈 소스 경쟁 모델들을 능가합니다.\n\n### Ornith-1.5-35B (MoE)\n35B MoE 모델은 토큰당 3B 파라미터만 활성화하지만, 훨씬 더 큰 밀집(dense) 모델들을 크게 능가합니다. Terminal-Bench 2.1에서 68.5점을 기록하여, Gemma 4-31B의 43.4점 및 Muse Glimmer-30B의 51.7점과 비교됩니다. 또한 SWE-Bench Verified에서 79.0점을 달성하여 Gemma 4-31B (52.0) 및 Muse Glimmer-30B (76.0)를 모두 능가합니다.\n\n### Ornith-1.5-9B (Dense)\niPhone 및 Android 기기에서의 엣지 배포를 위해 설계된 9B 밀집 모델은 훨씬 더 큰 모델들의 성능과 대등하거나 이를 능가합니다. Terminal-Bench 2.1에서 47.0점을, SWE-Bench Verified에서 70.6점을 달성하여 여러 카테고리에서 Gemma 4-31B 및 Qwen 3.6-35B를 능가합니다.\n\n## 자기 개선 루프 (The Self-Improvement Loop)\n\nOrnith-1.5는 인간이 큐레이션한 작업과 수동 harness를 대신하여 작업 생성, scaffold 구축, 솔루션 생성의 자율적인 사이클로 대체합니다. 이 폐쇄 루프를 통해 모델은 자신의 커리큘럼을 지속적으로 확장하고 문제 해결 전략을 적응시킬 수 있습니다.\n\n### 3단계 학습 사이클\n1. 작업 제안 (Task Proposal): 시스템은 모델의 이전 기록과 대상 환경을 기반으로, 특히 역량 격차를 목표로 하여 점진적으로 더 어려운 작업을 제안합니다.\n2. Scaffold 생성 (Scaffold Generation): 각 작업에 대해 모델은 지침, 도구, 분해 전략 및 문제 해결에 필요한 오케스트레이션이 포함된 작업별 scaffold를 생성합니다.\n3. 솔루션 Rollout (Solution Rollout): 정책(policy)은 작업 및 scaffold를 조건으로 하여 솔루션 rollout을 생성합니다.\n\nRollout에서 얻은 보상은 $\pi_{target}$을 통해 모든 세 단계로 전파되어, Group Relative Policy Optimization (GRPO)를 통해 유용한 작업을 생성하고 효과적인 scaffold를 생성하는 모델의 능력을 최적화합니다.\n\n## 보상 메커니즘 (Reward Mechanisms)\n\n자기 개선 루프가 고품질의 학습 데이터를 생성하도록 보장하기 위해, Ornith-1.5는 작업, harness 및 rollout에 대해 특정 보상 신호를 활용합니다.\n\n### 작업 보상 (Task Reward)\n작업 보상은 세 가지 신호의 곱셈 공식에 기반하여 계산됩니다:\n* 유효성 (Validity): 작업이 일관적이고 해결 가능하며 scaffold가 올바르게 실행되는지 확인합니다. 이는 잘못된 작업이 보상을 받는 것을 방지하는 강력한 게이트 역할을 합니다.\n* 최전선 난이도 (Frontier Difficulty): 작업이 도전적이지만 학습 가능한지 측정합니다. 시스템은 성공률 ($\pi_{target}$)이 0.2가 되도록 목표로 하여, 모델이 향상됨에 따라 생성기가 더 어려운 문제로 나아가도록 유도합니다.\n* 신규성 (Novelty): 이전에 생성된 작업들의 버퍼와 비교하여 다양한 작업을 보상함으로써 중복성을 줄입니다.\n\n### Harness 및 Rollout 보상\n* Harness 보상 (Harness Reward): harness는 작업 명세와 일치하는지, 실제 솔루션 품질을 추적할 수 있는지, 그리고 보상 해킹(reward hacking)에 대한 저항력이 있는지에 따라 보상을 받습니다.\n* Rollout 보상 (Rollout Reward): 각 rollout은 생성된 harness에 의해 점수가 매겨지며, 검증 가능한 작업의 경우 이진(binary) pass/fail을 사용하거나, 복잡한 환경에서는 정확성, 효율성 및 제약 조건 충족 여부에 따라 점수를 매깁니다.\n\n## 커뮤니티 인사이트 및 관찰 사항\n\n사용자 토론은 이번 출시와 관련된 실용적 유용성과 기술적 회의론을 모두 강조합니다:\n\n* 로컬 배포 (Local Deployment): 사용자들은 35B-A3B 모델의 효율성을 언급했습니다. 한 사용자는 이 모델이 높은 양자화 수준에서도 더 높은 속도를 유지하면서 Qwen 3.8 27B와 대등한 성능을을 보여준다고 보고했습니다.\n* 모델 정체성 (Model Identity): 일부 사용자는 모델이 정체성 프롬프트에서 가끔씩 Claude라고 주장하는 것을 관찰했습니다.\n* 기술적 회의론 (Technical Skepticism): 일부 커뮤니티 구성원들은
관련
- Dispatch
- Dispatch
- Dispatch
OpenAI gpt-oss 릴리즈 노트OpenAI는 Apache 2.0 라이선스로 제공되는 두 개의 오픈-웨이트 추론 모델인 gpt-oss-120b와 gpt-oss-20b를 출시했으며, 소비자 하드웨어에 최적화된 최첨단 수준의 추론 및 도구 사용 기능을 제공합니다.
- Dispatch
Qwen 3.8 27B 릴리스 노트Qwen 3.8 27B는 유연한 사고 제어와 네이티브 이미지/영상 이해 기능을 갖춘 컴팩트하고 밀도 높은 비전-언어 모델로, 코딩 및 에이전트 작업에서 선도 모델과 경쟁 가능한 성능을 제공합니다.
- Dispatch