Tencent Hy4 Preview Release

Tencentは、高容量の推論と長文コンテキスト処理のために設計された次世代の大規模言語モデル(LLM)であるHy4のプレビュー版をリリースしました。このモデルは、総パラメータ数7700億、トークンあたりのアクティブパラメータ数490億を特徴とし、100万トークンを超えるコンテキストウィンドウをサポートしています。

Recursive Self-Improvement in Training

Hy4 Previewは、再帰的な自己改善ループを実装することで、モデルの開発プロセスにおける重要な節目を迎えました。初めて、モデル自身がいくつかの重要な次元にわたって自身の最適化に貢献しました:

  • Training Methods: トレーニング・プロトコルの自動最適化。
  • Data Strategies: データ選択およびキュレーション・プロセスの洗練。
  • Evaluation Frameworks: モデル自身のテストおよび検証メトリクスの改善。
  • Low-level Operators: 基盤となる計算オペレーターの最適化。

アプローチを提案し、実験を実行し、結果に基づいて反復を行うことで、Hy4 Previewは、生成されたコード、ログ、およびフィードバックがその後の探索ラウンドに情報を提供するフィードバックループを確立しました。

Performance and Market Traction

初期の採用データは、このモデルに対する大きな関心を示しています。コミュニティのレポートによると、Hy4はOpenRouter上で急速な普及を見せており、リリースから数日以内に数兆トークンを処理しています。この高い使用量は、その競争力のある価格設定、具体的には、他のプロバイダーで通常見られる10-20%のキャッシュコストと比較して、低いキャッシュコスト(約5%)に一部起因しています。

Community Feedback and Technical Critiques

リリースを巡るユーザー体験と技術的な議論は、パフォーマンスとアクセシビリティに関していくつかの重要なポイントを浮き彫りにしています:

Model Capabilities

一部のユーザーは、前身であるHy3について、汎用的なエージェント型モデルとしての有効性を指摘し、肯定的な体験を報告しています。しかし、Hy4のコーディング能力に関するエージェントとしての初期フィードバックは、まちまちです。一部のユーザーは、コーディングタスクにおける有用性が限定的であると報告しています。

Infrastructure and Accessibility

現在のホスティング・プロバイダーにおける安定性の問題(タイムアウトやレート制限を含む)に関する報告があり、それがベンチマークの取り組みを妨げています。また、米国の一部のユーザーは、CodeBuddyのような関連ツールへのアクセスに関する問題を報告しています。

Documentation and Presentation

技術的な観察者は、公式リリース資料における「チャート・クライム(グラフの不正)」を批判しています。具体的には、ユーザーはブログ記事内の棒グラフが誤解を招くものであるように見えたと指摘しており、数値が高いことが必ずしも棒の高さと一致していないことや、グラフ内のモデルの順序が論理的なランクに従っていないことを指摘しています。

Open Source vs. Open Weights

Tencentが使用する用語について、コミュニティ内で継続的な議論が行われています。リリースは「オープンソース」と説明されていますが、批判的な人々は、トレーニング・プロセスのソースコードやデータが提供されていないため、これは真のオープンソースではなく「オープンウェイト」モデルであると主張しています。

Open weight is not the same as open source. The current "open weight" models are just opaque binary blobs you can run on your own computer instead of through a web API.

Comparison to Other Models

一部のユーザーは、Hy4の挙動をDeepSeekモデルと比較し、パフォーマンスや汎用的なエージェンシーに類似点を見出していますが、同社の独自のベンチマークにおけるモデルのポジショニングは、オープンウェイト・モデルの現在のフロンティアを脅かす競争力のある試みであることを示唆しています。

Sources

関連