Tencent Hy4 Preview リリース
Tencentは、大規模なパフォーマンスと効率性を実現するために設計された次世代の大規模言語モデル(LLM)であるHy4 Previewをリリースしました。このモデルは、総パラメータ数7700億、アクティブパラメータ数490億のMixture-of-Experts(MoE)アーキテクチャを特徴とし、100万トークンを超えるコンテキストウィンドウをサポートしています。
トレーニングにおける再帰的自己改善
Hy4 Previewは、モデル自身が自身の開発に直接貢献する再帰的自己改善ループを導入しています。Hy4は初めて、トレーニングパイプラインのいくつかのコアコンポーネントの自動最適化に直接参加しました。これには以下が含まれます:
- トレーニング手法
- データ戦略
- 評価フレームワーク
- 低レベルオペレーター
リリースによると、モデルは特定のアプローチを提案し、実験を実行し、結果として得られたログとフィードバックに基づいて反復を行い、その結果、後続の探索ラウンドに情報を提供するフィードバックループを構築しました。
パフォーマンスと市場の牽引力
初期の採用データは、特にサードパーティのAPIプロバイダーを介して、このモデルに対する大きな関心を示唆しています。
APIの採用とコスト
報告によると、Hy4はOpenRouter上で急速な普及を見せており、リリースから数日以内に数兆トークンを処理しています。この採用は、その価格構造、具体的には他のプロバイダーで通常見られる10-20%のキャッシュコストと比較して低い5%のキャッシュコストに一部起因しています。
ベンチマークと比較パフォーマンス
ユーザーが報告したベンチマークは、モデルの能力について様々な見解を提供しています:
- 汎用エージェントタスク: 一部のユーザーは、Hy4の前身であるHy3が、エージェントテストにおいてDeepSeek-4-Flashに近いパフォーマンスを発揮したと報告しています。
- ドイツ語評価: DACH PeerBenchインデックスにおいて、Hy4はHy3と比較して大幅な改善が見られましたが、DeepSeek ProやGLM 5.3 Flashには及ばず、全体で約14位にランクされています。
- コーディング能力: Novita.aiなどのプロバイダーを介してモデルを使用している開発者からのフィードバックは、あまり好意的ではありません。コーディングエージェントとしての有用性が限定的であると報告するユーザーもいます。
コミュニティの批判と技術的観察
リリースに関する技術的な議論では、透明性と提示方法に関していくつかの論争点が高められています。
オープンソース vs オープンウェイト
コミュニティの間で議論となっている点は、Tencentが「オープンソース」という用語を使用していることです。批判的な意見を持つ人々は、ソースコードやトレーニングデータの完全な透明性なしに、ローカル実行用のバイナリブロブを提供しているだけであるため、このモデルは真のオープンソースではなく「オープンウェイト」であると主張しています。
データ可視化に関する懸念
複数のユーザーが、公式リリースで提供されたベンチマークチャートが誤解を招くものであると批判しています。棒グラフが誤解を招くものであるとの主張です。具体的な不満点は以下の通りです:
- モデルのランクによる一貫性のない順序付け。
- 特定の指標ではなく、テーブルの行全体をハイライトして「勝者」を示すこと。
- 数値とチャート内の棒の実際の高さとの間の不一致。
トークン最適化
モデルの内部的な「思考」プロセスに関して、観察がなされています。トークンを節約し、処理効率を最適化するために、モデルが簡略化された語彙(ユーザーによって「caveman speak」と表現されています)を使用しているように見えることが指摘されています。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch