迈向软件开发的开放模型之变

迈向软件开发的开放模型之变

开放模型提供更大的自主权和数据所有权

在私有推理端点上使用开放权重模型使开发者能够将其工作流程与专有 AI 提供商解耦。通过拥有端点,数据可以直接从本地机器流向私有基础设施并返回,从而减少对第三方生态系统的依赖,并提供数字自主感。

开发者 Matthew Saltz 分享的最近经历表明,通过 Modal 端点从像 Claude 和 ChatGPT 这样的封闭模型转向开放模型(Kimi K3)带来了一种“解放”的体验。Saltz 将这种转变比作从一个功能丰富且笨重的编辑器切换到 Vim,描述了一种“空白感”,以及一种精简的工作流程,消除了供应商锁定的影响。

目标编码任务中的性能平等

虽然前沿模型常因其处理模糊、高层次提示的能力而受到赞誉(例如,“为我构建一个百万美元的 SaaS”),但在用于传统的迭代式软件开发时,开放模型正变得越来越具有竞争力。

小规模迭代 vs. 代理自动化

  • 目标函数: 当任务被分解为小而具体的单元或函数时,开放模型与封闭模型之间的性能差距会显著缩小。一些开发者报告称,像 GLM 这样的模型在用于“橡皮鸭调试”和对小函数进行迭代时,表现可以与 Claude 相当甚至更好。
  • 工具调用: 前沿模型通常在工具调用和复杂助手流程中保持优势。然而,这可以通过优化 harness(周围的代码/工具)来匹配模型的预期输出来缓解,而不是依赖模型去适应 harness。
  • 速度和延迟: 较小的开放模型通常提供更高的每秒 token 数和更低的首 token 时间(TTFT),使其在快速问答循环和敏捷思考过程中更具竞争力。

模型比较与工具

开发者目前正在尝试各种开放权重模型和 harness,以寻找速度与能力之间的最佳平衡:

  • Kimi K3: 因其稳固性和在托管端点上的性能而受到关注。
  • DeepSeek V4 Flash: 被誉为前沿模型的有力竞争者,其性能水平可与 Sonnet 的旧版本相媲美。
  • GLM 5.2: 一些用户描述其在特定场景下感觉优于 Claude Opus。
  • Harnesses: 诸如 OpenCode 和 Codex 之类的工具用于与这些模型进行交互。虽然 Claude Code 因其处理后台进程和代理“扇出”能力而受到赞誉,但 OpenCode 因其简洁、手动且轻量的特性而受到重视。

权衡与考量

转向开放模型涉及几项技术和经济上的权衡:

  • 基础设施成本: 关于私有端点的成本效益存在争议。虽然封闭模型受到大量补贴,但运行私有端点(即使是在租用的硬件上)可能会根据使用量产生不同的成本影响。
  • 隐私: 开放模型的主要驱动力是希望防止对话被输送到大型企业提供商。
  • “自然语言陷阱”: 一些人警告,由于人类天生倾向于自然语言,一个“听起来不错”的模型可能被视为高质量,即使其生成的代码需要严格验证。

摘要: 开发者发现,像 Kimi K3 这样的开放权重模型,当与私有推理端点配对时,能够提供与面向目标编码任务的封闭前沿模型相媲美的数据所有权和迭代速度水平。

标题: 迈向软件开发的开放模型之变

Sources