GPT-6 Astra 릴리스 노트 / 새로 추가된 기능
OpenAI는 고지능 전문 업무, 자율적인 컴퓨터 사용, 과학적 발견을 위한 다음 세대 모델인 GPT-6 Astra를 발표했습니다. 이 모델은 소프트웨어 공학, 사이버 보안, 수학 분야에서 최고 수준의 성능을 보이며, 모델의 일치성과 의도 준수에 대한 새로운 기준을 제시합니다.
최고 수준의 컴퓨터 사용 및 전문 업무
GPT-6 Astra는 자율적인 컴퓨터 사용의 속도와 정확도에서 새로운 기준을 설정하여, 온라인 양식 작성, CRM 업데이트, 프론트엔드 QA 검사와 같은 복잡한 전문 업무를 처리할 수 있습니다.
성능 벤치마크
- Agents' Last Exam: Astra는 59.3%를 기록하여 Claude Opus 5(55.5%)와 GPT-5.6 Sol(53.6%)를 넘어서며, 이 설정에서 Opus 5보다 약 65% 적은 출력 토큰을 사용했습니다.
- OSWorld 2.0: 지연 시간 시뮬레이션에서 Astra는 각 작업당 약 40분 내에 72.6%의 점수를 기록했으며, GPT-5.6 Sol은 75분에 65.7%를 기록했습니다. 작업 시간이 약 47% 감소했습니다.
- Mind2Web: 업데이트된 Codex 하니스와 함께 사용할 경우, Astra는 GPT-5.6 Sol보다 1.9배 빠르게 작업을 완료합니다.
- BenchCAD: Astra는 다중 시점 렌더링에서 3D 객체를 재구성할 때 기하학적 겹침 점수 95.9%를 기록하여, GPT-5.6 Sol(83.3%)과 Claude Fable 5.1(84.3%)보다 훨씬 높은 성능을 보였습니다.
전문 기능
벤치마크를 넘어서 Astra는 슬라이드, 스프레드시트, 문서에 대한 기존 템플릿 준수 능력 등 비즈니스 환경에 최적화되어 있습니다. 출력 시 불필요한 반복을 방지하기 위해 관련된 컨텍스트만 추출하도록 특별히 훈련되었습니다. ChatGPT의 "Sites" 기능을 통해 Astra는 프롬프트만으로 웹사이트, 웹 앱, 게임을 직접 생성, 호스팅, 공유할 수 있습니다.
소프트웨어 공학 및 코딩
GPT-6 Astra는 현재까지 가장 능력 있는 소프트웨어 공학 모델로 평가되며, 터미널 기반 작업에서 큰 성과를 보였습니다.
- Terminal-Bench 4.0: Astra는 57.9%를 기록했으며, GPT-5.6 Sol은 37.3%, Claude Fable 5.1은 55.8%를 기록했습니다.
- 컨텍스트 관리: Astra는 컨텍스트 창이 가득 찬 경우에도 정보를 보존하고 검색할 수 있는 새로운 방법을 도입했습니다. 단순한 압축(요약)이 아닌, 컨텍스트 창 전체에 걸쳐 검색 가능한 노트를 유지함으로써, 실패한 수정 사항이나 컴포넌트의 동작에 대한 구체적인 세부 정보를 반복적인 압축 없이 보존할 수 있습니다.
과학적 발견 및 수학
GPT-6 Astra는 수학 분야에서 열린 문제 해결에 기여한 고도의 추론 능력을 보여줍니다.
- 소수 간격: Astra는 무한히 많은 소수 쌍에 대해 186이라는 더 강한 경계를 설정했으며, 이는 이전의 240보다 개선된 결과입니다. 또한 80년 이상 변화하지 않은 대규모 소수 간격에 대한 경계의 항목을 개선했습니다.
- 학술 벤치마크:
- FrontierMath Tier 4: 98% 점수 (벤치마크 포화 상태)
- ARC-AGI-3: 99.9% 점수 (벤치마크 포화 상태)
- GPQA Diamond: 96.0% 점수, 대학원 수준의 과학적 추론에서 새로운 최고 기록
- Terminal-Bench Science 0.1: 64.6% 점수, Claude Fable 5.1의 52.6%보다 높음
사이버 보안 기능 및 위험
GPT-6 Astra는 OpenAI의 준비 프레임워크에서 "비상 상황 기준"을 충족하며, 제로데이 취약점을 식별하고 개발할 수 있는 능력이 있기 때문입니다.
공격 및 방어 벤치마크
- ExploitBench: Astra는 완벽한 100% 점수를 기록했으며, GPT-5.6 Sol은 78.5%를 기록했습니다.
- ExploitGym: Astra는 42.4%의 성공률을 기록했으며, GPT-5.6 Sol은 30.3%를 기록했습니다.
- SRE-Bench: Astra는 단일 시도에서 88.0%의 작업을 해결했으며, GPT-5.6 Sol은 55.9%였습니다. 이는 소프트웨어 바이너리 역공학 능력이 매우 뛰어남을 보여줍니다.
- 제로데이 발견: 2026년 6월~8월의 취약점 데이터를 사용한 내부 평가에서 Astra는 두 개의 이전에 알려지지 않은 제로데이 취약점을 발견하고 활용했습니다.
안전 장치
위험을 완화하기 위해 Astra는 고급 사이버 보안 작업, 예를 들어 PoC 취약점 생성을 거부합니다. OpenAI는 취약점 검증 및 악성코드 분석을 위한 방어적 접근을 확장하기 위해 "OpenAI Daybreak"를 도입하고 있습니다. 또한 모델은 Codex Auto-review 및 비일치 모니터링을 포함한 안전 장치 스택을 사용하여 비승인된 행동을 탐지하고 제어합니다.
모델 일치성 및 안전성
GPT-6 Astra는 OpenAI가 가장 일치성이 높은 모델로 평가되며, 작업 경계를 존중하고 투명한 커뮤니케이션을 중시합니다.
- 의도 준수: 불가능한 작업 평가에서 GPT-6 Astra는 허용된 목표를 초과한 경우가 0%였으며, GPT-5.6 Sol은 48%였습니다.
- 자동 리뷰 회피: Astra는 구성이 의도적으로 회피 가능하게 설정되어 있어도 Codex Auto-Review 거부를 회피하려는 시도를 한 적이 없습니다.
- 능력 환상: Astra는 GPT-5.6 Sol보다 자신의 능력에 대해 잘못된 주장할 가능성이 3배 낮습니다.
- 감시 가능성: OpenAI는 Astra의 서술적 추론이 GPT-5.6 Sol보다 간단한 작업에서 더 감시하기 어렵다고 지적했습니다. 왜냐하면 문제를 더 적은 서술 단계로 해결하기 때문이며, 이는 연구 우선순위로 남아 있습니다.
사용 가능 및 가격
GPT-6 Astra는 ChatGPT Plus, Pro, Business, Enterprise 사용자에게 제공되며, OpenAI API, Microsoft Azure, AWS Bedrock를 통해도 이용할 수 있습니다.
- API 가격: 입력 토큰 100만 개당 $10, 출력 토큰 100만 개당 $50
- 빠른 모드: API에서 사용 가능하며, 표준 가격의 2배로 최대 2배 빠른 속도 제공
- Enterprise 접근: Enterprise 관리자는 기본적으로 접근이 비활성화되어 있으며, 수동으로 활성화해야 합니다.