OpenAI GPT‑6 Sol と Luna のリリース:50%の価格引き下げと性能概要

TL;DR

OpenAI は GPT‑6 Sol と GPT‑6 Luna をリリースし、それぞれの前モデルである GPT‑5.6 と比べて 50 % 低価格に抑えながら、プロフェッショナルタスクのパフォーマンス、事実性、コーディング能力、コンピュータ使用効率において測定可能な向上を実現しました。


価格の飛躍

モデル 入力価格(1 Mトークンあたり) 出力価格(1 Mトークンあたり) 相対的削減率
GPT‑6 Sol $2($4から) $10($20から) 50 %
GPT‑6 Luna $0.10($0.20から) $0.50($1.20から) 50 %

OpenAI は、価格引き下げが API ユーザーおよび ChatGPT サブスクリプション層に直接反映されると述べています。より安価な料金は、日常的な自動化や大規模アプリケーションにおける高度なAIの実用化を目的としています。


プロフェッショナルタスクのパフォーマンス

  • AutomationBench(47ツールワークフローベンチマーク):
    • GPT‑6 Sol(エクストラハイエフォート)は Claude Opus 5(マックスエフォート)を上回りながら、タスクあたりのコストは 9 % にとどまります。
    • GPT‑6 Luna(ハイエフォート)は前モデルを 5.4 pp 伸ばし、コストを 58 % 減らしました。
  • Agents’ Last Exam(複雑なワークフロー評価):GPT‑6 Sol(マックスエフォート)は 56.4 % を達成し、Claude Opus 5 と同等の品質を 60 % 低いコストで実現しました。

これらの結果は、Sol と Luna がビジネスプロセス自動化におけるコスト対知能のフロンティアを支配していることを示しています。


事実性の向上

OpenAI の内部事実性テスト(ユーザーが誤りを指摘した現実世界の会話に基づく)によると、

  • GPT‑6 Sol は GPT‑5.6 Sol と比べて 約半分 の事実誤認を犯し、Astra 水準の信頼性に近づいています。
  • GPT‑6 Luna は、より高い推論エフォートで実行された場合、GPT‑5.6 Sol と同等の事実性を 約1 % のコストで達成できます。

評価では、テストセットが誤りを起こしやすいクエリに偏っているため、通常の使用における絶対的な誤り率はさらに低いとされています。


コーディングベンチマーク

  • FrontierCode(コード変更の準備度):GPT‑6 Sol は GPT‑5.6 Sol を上回り、Claude Fable 5.1(エクストラハイエフォート)と同等の性能を、価格の 数分の1 で実現しました。
  • DeepSWE v1.1(ソフトウェアエンジニアリングタスク):GPT‑6 Sol(マックスエフォート)は 68.8 % を達成し、Claude Fable 5 の最高スコアと 1.1 pp の差にとどまり、タスクあたりのコストは 約80 % 低くなりました。
  • GPT‑6 Luna(マックスエフォート)は 66.6 % を達成し、Claude Opus 5 と同等の性能を、タスクあたり 93 % 低コストで実現しました。

コミュニティのコメントでは、体験がまちまちです:一部のユーザーは Luna を「自由なペアプログラマー」と評価する一方、他のユーザーは 5.6 バージョンと比べて Luna のコーディングスコアに後退が見られたと報告しています。


コンピュータ使用効率

  • OSWorld 2.0 オフライン(長期間のコンピュータ使用ワークフロー):GPT‑6 Sol(エクストラハイ)は Claude Opus 5(ミディアム)と同等の性能を、約80 % のコスト削減で達成しました。GPT‑6 Luna(マックス)は GPT‑5.6 Sol(ミディアム)を上回り、コストは 10分の1 にまで抑えられました。

アライメントとコミュニケーションスタイル

OpenAI は、Sol と Luna が Astra のアライメント改善を引き継いでおり、誤解を招くコーディング主張の頻度が低いと主張しています。定性的な例では、より簡潔で専門用語を避けたトーン、そして奇妙な表現のアーティファクトが少ないことが強調されています。


プロンプトキャッシュの強化

  • 新たな Prompt Caching Dashboard と診断ツールにより、開発者はキャッシュヒット率や見逃された機会を可視化できます。
  • 推論エフォート や ツールの利用可能性 を調整しても、キャッシュされたプレフィックスが保持されるようになり、キャッシュされた入力トークンの読み取りで最大 90 % の割引が可能になります。
  • GitHub は、数十億回のリクエストにおいて 50 % 以上の新規トークン処理の削減を報告しており、Copilot の応答速度が向上しています。

利用可能時期

  • ChatGPT Work および Codex:Sol と Luna は Plus、Pro、Business、Enterprise、Edu ユーザー向けにライブ配信中。
  • Free/Go ユーザーはデスクトップアプリから Luna にアクセス可能。
  • API識別子:gpt-6-sol および gpt-6-luna。
  • ChatGPT での段階的展開中。モデルは当日の後半に表示される可能性があります。

コミュニティの反応(選定された HN コメント)

  • 価格への影響 – 複数のコメント(例:@simonw、@Cu3PO42)は、Luna の「驚異的な」$0.10/​M‑入力価格がゲームチェンジャーであると強調しています。
  • モデル選択 – Sol と Luna と Astra の使い分けについて議論が行われており、一部のユーザーは、より高い推論レベルが低いベースモデルサイズを補うことができる点に注目しています。
  • パフォーマンスのばらつき – 複数のユーザーが、Luna のコーディングスコアが 5.6 バージョンよりわずかに低下していると報告している一方、Sol はエクストラハイエフォートで顕著な向上を示すものの、推論ステップの増加により遅延が生じる可能性があると指摘しています。
  • キャッシュツール – @apitman などの開発者は、破損したプロキシを修正した後、新しいキャッシュダッシュボードを称賛しています。
  • 競争環境 – コメントでは、OpenAI の価格戦略が Anthropic の Opus 5.5 と比較され、OpenAI の透明性のあるベンチマーク表が強調されています。

まとめ

OpenAI の GPT‑6 Sol と Luna は、Astra の知能の大部分を維持しつつ、価格を半額にしたモデルとして GPT‑6 ファミリーを拡張しました。ベンチマークでは、自動化、事実性、コーディング、コンピュータ使用タスクにおいて優れたコスト効率を示しており、新しく導入されたキャッシュツールにより運用コストもさらに削減されています。このリリースにより、OpenAI は Anthropic および他の最先端モデルと競合する立場を確立し、特に高頻度の開発者ワークフローにおいて強みを発揮します。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch