OpenAI GPT‑6.1 Sol リリース:Astra に迫る性能を 5 分の 1 のコストで

TL;DR

OpenAI は、コーディング、コンピュータ操作、専門業務のベンチマークにおいて GPT‑6 Astra の能力に匹敵または肉薄しつつ、Astra の入出力トークン単価の約 5 分の 1 という低価格を実現したモデル「GPT‑6.1 Sol」を発表しました。この発表は、価格戦略、モデルリリースのスピード、そして新モデルが Opus 5.5 や従来の Sol リリースと比較してどのような立ち位置にあるかについて、Hacker News で活発な議論を巻き起こしました。


GPT‑6.1 Sol とは

  • Astra に迫る知能: エージェントによるコーディング、コンピュータ操作、複雑な専門業務において、GPT‑6 Astra との差を埋めるように設計されています。
  • コスト削減: キャッシュされた入力トークンは 100 万トークンあたり 0.10 ドルで、標準的な入力価格から 95% 割引、GPT‑6 Sol のキャッシュレートよりも 50% 安価です。標準の API 価格は、入力が 100 万トークンあたり 2 ドル、キャッシュされた入力が 100 万トークンあたり 0.10 ドル、出力が 100 万トークンあたり 10 ドルです。
  • 利用可能性: ChatGPT Work および Codex の Plus、Pro、Business、Enterprise、Edu ユーザーが即座に利用可能です。API 経由では gpt-6.1-sol としてアクセスできます。Ultrafast モード(トークン生成速度が最大 8 倍)も近日中に展開される予定です。

ベンチマークのハイライト

タスク GPT‑6.1 Sol vs. GPT‑6 Astra Astra に対するコスト比
DeepSWE v1.1 (ソフトウェアエンジニアリング) Astra のスコアに匹敵、コストは約 20% Astra 価格の 5.4%
GDP.pdf (複雑な PDF の QA) Opus 5.5 を上回り、Astra との差は 1.9 ポイント以内 Astra コストの 50% 未満
AutomationBench (多段階のビジネスワークフロー) Opus 5.5 を 2.2 ポイント、GPT‑6 Sol を 4.8 ポイント上回る Astra コストの約 33%
OSWorld 2.0 (オフラインでのコンピュータ操作) GPT‑6 Sol を 7 ポイント上回り、Astra を 2.1 ポイント下回る Astra コストの約 14%
Terminal‑Bench Science 0.1 (データ分析、シミュレーション) 最大負荷時で Astra の 2 倍以上のスコア、タスクあたり 5.47 ドル(Astra は 23.80 ドル) 75% 以上安価
Factuality (誤りを誘発するプロンプト) エラー率が 11.4% から 7.7% に低下(約 32% 削減) Astra の約 20% のコストで Astra と 1.9 ポイント差

特に断りのない限り、すべてのコスト数値はキャッシュされた入力レート(100 万トークンあたり 0.10 ドル)を前提としています。


安全性とアライメント

  • 透明性の向上: GPT‑6.1 Sol は、壊れた検索ツールをより確実に開示し、ユーザーの明示的な制限を尊重します。
  • 失敗率: 困難なアライメントテストにおいて、GPT‑6.1 Sol が壊れたツールを開示できなかったケースは 2.1% でした(GPT‑6 Sol は 4.9%、Astra は 1.5%)。自動化された安全性レビューを回避しようとする試みは観測されませんでした。
  • システムカード: 詳細な安全性評価は GPT‑6.1 Sol system‑card addendum で確認できます。

Hacker News でのコミュニティの反応

価格設定への称賛

「キャッシュされた入力コストが 100 万トークンあたりわずか 0.10 ドル。これは標準入力価格より 95% 安く、GPT‑6 Sol のキャッシュ入力価格より 50% 安い。これこそが真の大きな発表だ。GPT‑6 Sol より 50% 安いキャッシュは、Codex でより多くの成果をもたらすだろう。」 – minimaxir

モデル品質への懐疑論

「GPT 6 のリリースは……あまり良くなかった。Sol 6 はひどかったので、Opus 5.5 に完全に切り替えた。Sol 5.6 と比較して大幅な退行があり、しばしば愚かな挙動をした。6.1 がそれと大きく異なるとは思えない。」 – the_duke

「Opus 5.5 との比較がほとんどないということは、大したことはないということだ。」 – BrokenCogs

リリース頻度への懸念

「彼らは文字通り 6 日前に GPT 6 Sol をリリースしたばかりだ。週単位のモデルリリースサイクルに加速している。これは……重大なことのように思える。」 – intenex

「GPT 6 Sol はわずか 1 週間で時代遅れになった!彼らがより頻繁にモデルを更新することを恐れていないのは嬉しいことだ。」 – modeless

価格とプランの変更

「OpenAI の新しい 500 ドルの Pro プランには Ultrafast モードが含まれているが、既存の 200 ドルの Pro プランは使用許容量が半分に減らされた。これにより、200 ドルのプランの魅力が低下している。」 – Aboutplants

「真の発表はウルトラファストモードだ……300 t/s での Astra は狂気じみている!」 – vb‑8448

比較ベンチマーク

「Terminal‑Bench Science において、GPT‑6.1 Sol はタスクあたり 5.47 ドル、Astra は 23.80 ドル。75% 以上安価でありながら、強力な科学的機能を提供している。」 – Official blog

「Opus 5.5 との価格/知能の比較では、6.1 Sol は Opus 5.5 Medium より優れていて安価だが、Opus 5.5 High には劣る。」 – AnodicElegy


開発者にとっての意味

  1. 費用対効果の高いエージェント: キャッシュされた入力価格の劇的な引き下げにより、コストを膨らませることなく、多くの呼び出し間で大きなプロンプトの断片を再利用する長文脈エージェントの構築が可能になります。
  2. パフォーマンスのトレードオフ: 多くの専門業務やコーディングのワークロードにおいて、GPT‑6.1 Sol は Astra に近い品質を提供しますが、一部のユーザーからは以前の Sol バージョンと比較して退行が見られるとの報告もあります。特定のタスクでのテストが不可欠です。
  3. 速度の選択肢: 今後登場する Ultrafast モードは最大 8 倍の生成速度を提供し、レイテンシに敏感なアプリケーションに役立ちますが、トークンあたりの価格が高くなる可能性があります。
  4. 安全性の調整: 透明性の向上と失敗率の低下は、より安全なデプロイ環境を示唆していますが、評価は最悪のシナリオに焦点を当てており、日常的な使用を反映していない可能性があります。

今後の展望

前回のモデルから 1 週間以内に新しいモデルを提供するという OpenAI の迅速なリリーススケジュールは、継続的なモデル反復へのシフトを示しています。価格戦略は競合他社に圧力をかけ、LLM を活用したサービスの経済性を再構築する可能性がありますが、モデルの安定性、命名規則、プラン変更に関するコミュニティの懸念は、ユーザーの信頼が依然として重要な要素であることを示しています。開発者は、GPT‑6.1 Sol のキャッシュ入力価格と Ultrafast モードを試しながら、ベンチマークの更新や実際のパフォーマンスを監視し、Opus 5.5 を置き換えるべきか、あるいは GPT‑6 Astra のコスト最適化された代替手段として機能するかを判断する必要があります。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch