GPT-6 Astra 릴리스 노트 / 새로 추가된 기능
GPT-6 Astra는 전문 워크플로우를 위한 직접적인 컴퓨터 사용을 가능하게 합니다
GPT-6 Astra는 맞춤형 API나 데이터 준비 없이 기존 비즈니스 애플리케이션과 워크플로우 내에서 작동하도록 설계되었습니다. 컴퓨터 사용 기능을 활용함으로써 Astra는 인간이 소프트웨어와 상호작용하는 방식과 유사하게 작동할 수 있어, 출시 직후 다양한 애플리케이션에서 작업을 수행할 수 있습니다.
주요 전문 애플리케이션은 다음과 같습니다:
- 재무 모델링: 2023년 마이크로소프트 엑셀 월드 챔피언십 기반의 재무 모델링 월드컵 도전 과제에서, GPT-6 Astra는 우승한 인간 참가자보다 약 4배 빠르게 작업을 완료했습니다.
- 소프트웨어 공학: OpenAI 내부 엔지니어링 팀은 Astra를 사용해 테스트 환경에서 메모리 할당 버퍼 문제를 해결했으며, 전환 지연을 25배 낮추고 피크 메모리 사용량은 약 30% 증가시켰습니다.
- 콘텐츠 제작: 모델은 회사별 음성, 템플릿, 디자인 기준을 준수할 수 있으며, 비즈니스의 특정 레이아웃과 톤에 맞는 슬라이드 데크를 생성할 수 있습니다.
성능 및 비용 효율성 벤치마크
GPT-6 Astra는 더 적은 토큰과 더 적은 재시도로 작업을 완료하도록 설계되어, 작업당 비용을 줄였습니다. OpenAI는 Astra가 전문 업무 및 코딩 평가에서 비용 효율성 전면의 대부분을 차지한다고 보고했습니다.
터미널 벤치 4.0 결과
터미널 벤치 4.0은 시스템 구성 및 데이터 분석을 포함한 복잡한 터미널 기반 작업에 대해 에이전트를 평가하는 테스트입니다. GPT-6 Astra는 57.9%의 점수를 기록했으며, 이는 이전 모델들을 능가합니다:
- GPT-5.6 Sol: 37.3% (Astra는 작업당 추정 API 비용이 약 9% 낮습니다).
- Claude Fable 5.1: 55.8% (Astra는 작업당 추정 API 비용이 약 63% 낮습니다).
가격
GPT-6 Astra의 API 가격은 입력 토큰 100만 단위당 $10, 출력 토큰 100만 단위당 $50부터 시작합니다.
안전성, 일치성 및 기업용 제어
GPT-6 Astra는 OpenAI가 현재까지 개발한 가장 인간의 의도와 일치하는 모델로, 비즈니스 시스템 내에서 안전하게 작동하기 위해 인간의 의도와 권한을 더 엄격히 준수합니다.
컴퓨터 사용 안전성 벤치마크
내부 컴퓨터 사용 안전성 벤치마크에서 데이터 삭제나 기밀 정보 노출과 같은 시나리오를 테스트한 결과, Astra는 GPT-5.6 Sol보다 89% 덜, Claude Fable 5.1보다 74.7% 덜 예기치 않은 결과를 생성했습니다.
기업용 관리 제어
배포를 관리하기 위해 OpenAI는 기업용 관리 제어를 도입하여 조직이 다음을 수행할 수 있도록 했습니다:
- 승인된 웹사이트와 데스크톱 애플리케이션에 대한 액세스 제한
- 업로드 및 다운로드 관리
- 브라우징 기록 제어
- 중요한 작업을 수행하기 전 승인을 요구하는 확인 정책 구현
- 잠재적으로 위험하거나 승인되지 않은 도구 호출에 대한 자동 검토 수행
사이버보안 및 대비
GPT-6 Astra는 OpenAI의 대비 프레임워크에서 "중대한 사이버보안 능력 기준"에 도달한 최초의 모델입니다. 이에 따라 OpenAI는 오용 및 승인되지 않은 작업에 대한 보호를 강화했으며, 모델이 보안 경계를 존중하도록 훈련하고, 해로운 응답을 차단하기 위한 자동 검사를 배포했습니다.
가용성 및 통합
GPT-6 Astra는 ChatGPT Work, Codex 및 API를 통해 이용 가능합니다. 접근성을 확대하기 위해 OpenAI는 ChatGPT 데스크톱용 Oracle Analytics, Power BI(마이크로소프트 팩트리 서비스), Navan, Avalara용 새로운 기업용 플러그인을 출시할 예정입니다.