Tencent Hy4 Preview 发布

Tencent 发布了 Hy4 Preview,这是一款专为高规模性能和效率设计的下一代大语言模型 (LLM)。该模型的特点是采用混合专家 (MoE) 架构,总参数量为 7700 亿,激活参数量为 490 亿,支持超过 100 万 token 的上下文窗口。

训练中的递归自我改进

Hy4 Preview 引入了一个递归自我改进循环,模型直接参与了自身的开发。Hy4 首次参与了其训练流水线中几个核心组件的自动化优化,包括:

  • 训练方法
  • 数据策略
  • 评估框架
  • 底层算子

根据发布说明,该模型提出了具体的方法,执行了实验,并根据生成的日志和反馈进行了迭代,从而创建了一个为后续轮次探索提供信息的反馈循环。

性能与市场吸引力

早期采用数据表明,市场对该模型表现出了浓厚的兴趣,特别是在通过第三方 API 提供商使用时。

API 采用与成本

报告显示,Hy4 在 OpenRouter 上获得了快速增长,在发布后的几天内处理了数万亿 token。这种采用在一定程度上归功于其定价结构,特别是 5% 的缓存成本,这低于其他提供商通常看到的 10-20% 的缓存成本。

基准测试与对比性能

用户报告的基准测试提供了对模型能力的混合观点:

  • 通用代理任务:一些用户报告称,Hy4 的前身 Hy3 在代理测试中表现接近 DeepSeek-4-Flash。
  • 德语语言评估:在 DACH PeerBench 指数中,Hy4 被指出较 Hy3 有显著改进,尽管仍低于 DeepSeek Pro 和 GLM 5.3 Flash,排名大约在第 14 位。
  • 编程能力:通过 Novita.ai 等提供商使用该模型的开发者的反馈较不理想,一些人报告称其作为编程代理的实用性有限。

社区批评与技术观察

围绕此次发布的各种技术讨论突出了关于透明度和呈现方式的几个争议点。

开源 vs. 开权重

社区中的一个争论点是 Tencent 使用了“开源”一词。批评者认为,该模型是“开权重”而非真正的开源,因为它仅提供用于本地执行的二进制文件,而没有提供源代码或训练数据的完整透明度。

数据可视化问题

多名用户批评了官方发布中提供的基准测试图表,指责其柱状图具有误导性。具体的投诉包括:

  • 模型按排名顺序不一致。
  • 在表格中突出显示整行以指示“获胜者”,而不是特定的指标。
  • 数值与图表中柱状图的实际高度不一致。

Token 优化

关于模型的内部“思考”过程,已有观察发现,它似乎使用了一种精简、简化的词汇(被用户描述为“原始人语言”)来节省 token 并优化处理效率。

Sources

相关