Kimi K3、Qwen 3.8 与 Anthropic 的潜力及其战略挑战
Kimi K3 与 Qwen 3.8 发布概览
Kimi K3 和 Qwen 3.8 是最先进的开源模型,均于 2026 年 7 月发布,Kimi K3 于 7 月 16 日上线,Qwen 3.8 于 7 月 19 日宣布,两者的性能据称接近 Anthropic 的 Fable 5,且其权重将公开提供。
Frontier Lab 经济学:成本结构与利润率
基础模型的经济学分为高额前期训练成本(研究人员、计算、用电)和以电力与计算为主的推理成本;拥有更多基础设施堆栈可将可变成本转为固定成本,使利润率随使用量增长,而租赁基础设施则使成本与收入成比例。
战略意义:基础设施所有权 vs 仅模型提供商
拥有数据中心或发电设施的公司可以将基础设施变现并扩大利润率,而仅提供模型的公司只能依赖于提供最优或最廉价的模型,这导致在推理成本上不断向下竞争,或必须保持性能领先。
Anthropic 的尴尬处境
Anthropic 专注于监管策略和递归自我改进,使其面临成本劣势——其模型每完成一次任务的费用几乎是竞争对手的三倍——以及产品拆分的风险,因为开源模型逼近其性能且相关创业公司削弱了其产品护城河。
Kimi K3 与 Qwen 3.8 的更广泛影响
多款开源模型的同步发布显示出持续的竞争压力,削弱了纯模型提供商的防御能力,且有利于 Meta、阿里巴巴、SpaceX 和 Google 等垂直整合的企业。
来自 Hacker News 的社区观点
过去几天的开源权重、开源架构发布让我更加确信,最终的胜者将是最快将模型烧录到 ASIC 上的团队。LLM 本身已经能够完成部分芯片设计工作,这在 K3 的新闻稿中已有体现。此外,前沿模型对大多数任务已经“足够好”,并且很快就会达到软件工程的大量需求阈值(如果尚未达到的话)。有没有人认为我们需要 Mythos 级别的模型来规划一次自驾游,或给出烘焙蛋糕的技巧?一款在 ASIC 上以 9,000 token/s 运行的 Fable 5 模型,而不是在消耗电力、使用 Nvidia GPU 的 150 token/s,甚至是巨型 SRAM Cerebras 或 Groq 芯片,都足以满足大多数需求。此外,如果你是企业,转向本地 ASIC 部署可以大幅降低数据外泄以及向潜在竞争对手(如 OpenAI 或 Anthropic)提供数据的风险。少量芯片即可覆盖多种使用场景,并且更安全。LLM 在企业中的许多用例并非前沿数学研究或编码。 – @LarsDu8888
我一直在思考 Figma 事件。如果你不清楚,这里有一段谷歌摘要:---- 董事会离职:Mike Krieger,Anthropic 的首席产品官兼 Instagram 联合创始人,曾任 Figma 董事会成员。他于 4 月 14 日辞职,正好在 Claude Design 新闻曝光前几天。这引发了关于利益冲突以及使用专有产品策略信息的猜测。合作背叛:该发布让科技行业感到不安,因为 Figma 依赖 Anthropic 的模型来驱动其 AI 功能,甚至宣布了联合的 “Code to Canvas” 集成。报告显示 Figma 对 Claude Design 的深度和范围毫无防备。市场反应:“SaaSpocalypse” 论调——担忧主要 AI 基础模型会快速构建应用层并蚕食自己的 SaaS 合作伙伴——在消息公布后得以实现。Figma 的股价在公告后立即下跌 7%。---- 我想对使用 LLM 的人提出建议:应谨慎向这些公司提供数据或依赖它们。如果你在打造 AI 初创公司,一旦你的想法获得牵引,它们很可能会直接与你竞争。你也会受到它们在 API 定价等方面的摆布。 – @overgard
我认为风险被夸大了。首先,在边际上,人们愿意为稍微更好的模型支付高额费用。我个人深知 LLM 为我的工作流带来的价值远高于我每月向前沿实验室支付的 200 美元。我并不想通过微调来进一步降低成本。虽然有极少数声音强烈的用户或公司将 LLM 开支控制在边际,但我认为这只是少数(如果我错了请纠正,我想了解他们的客户群体)。此外,实际的 LLM 只占增值的一小部分。尝试从 LLM API 构建代理式解决方案的人很快会意识到,Claude Code / Codex 的套件价值巨大。虽然有像 OpenCode 这样的开源实现,但远不如前者。换个角度思考。想想微软在维护 Excel 上花费了多少资金。已有开源替代品具备超过 90% 的功能,甚至可以处理和生成 Excel 文件。Google Sheets 的功能可能达到 99%,且对所有人开放,在很多方面更好。但电子表格软件为员工创造的价值远超每年 100 美元左右的成本,这形成了真正的护城河,没人去探索替代方案。 – @bko
令人惊讶的是,Fable 从‘需要被禁用的颠覆性模型’迅速转变为‘还行,不过 OpenAI 同样出色,而且还有几款开源权重的替代品几乎在所有方面都能匹配’。炒作周期在缩短,也许我们真的正进入某种平台期(著名的最后一句话) – @port3000
明显感觉今天的 HN 上被推了一种特定的叙事。 – @a13n
更重要的是,作为可持续的长期业务,纯模型提供商尤其面临风险。Knowledge Atlas、Moonshot Labs 和 Anthropic 在面对 OpenAI、阿里巴巴、SpaceX、Meta 和 Google 时,防御性挑战尤为突出。嗯,OpenAI 为什么不像 Anthropic 那样是“仅模型”提供商?看起来它们同样脆弱。 – @drob518
AI 进步的上限——递归自我改进。在这种情况下,AI 将负责构建更好的模型,使拥有数据中心的人成为赢家。Anthropic/OAI 已经完蛋。AI 进步的下限——平台期。进展放缓,重点是以最低成本提供有意义的峰值能力。今天有消息称 Google 正在打造一款将权重固化在硅片中的 Gemini 芯片。考虑到芯片的最短寿命为 2-3 年,而今天的 2-3 年模型在今天已经失效,他们预计在接下来的三年里不会取得类似的进展。游戏的本质是以最低利润率销售。Anthropic/OAI 已经完蛋。因此,它们的生存依赖于 AI 进步介于这两个极端之间的假设。 – @torginus
对我而言更大的问题是,投资更高能力的通用模型在何时会失去投资回报率?例如——有多少比例的工作流需要这种新型高能力模型?其中有多少可以被围绕它的软件工具所取代?我的意思是,如果软件工具能够通过几次迭代优化查询,是否能得到与一次性高能力模型查询相同的输出? – @yalogin
我认为一个重要问题是这些实验室是否能产出领先于 Anthropic 和 OpenAI 的模型。相关的问题是它们在实现成果时对 Anthropic 和 OpenAI API 的依赖程度——无论是通过蒸馏还是其他方式。如果这些模型是 Anthropic/OpenAI 的衍生品,我预计其性能会更局限,进展也会受限。 – @davidpapermill
这正是 OpenAI 相较于 Anthropic 的优势所在。虽然其模型在最近几个月落后于 Anthropic,但其在产品、消费者体验、站点发布、语音和硬件方面的投入,都指向更明确的护城河。我在此之前也赞同你的观点。我并不认为 OpenAI 拥有比 Anthropic 更强的产品护城河;相反,Claude / mythos 等品牌是 OpenAI 所缺乏的宝贵资产。是的,许多常年在线的 HN 精英工程师倾向于使用 Codex,但如果你真的与行业中的普通工程师交流,代理式编码仍然等同于 Claude Code。对于非工程类的使用场景,Claude 作为对话伙伴要比任何 GPT 系列更令人愉快,我怀疑这已经深深植入模型本身,否则 OpenAI 早已弥合这一差距。 – @piazz
模型一旦构建,最大的成本是推理。虽然我找不到可靠的数据,但如果能了解规模感会很有帮助:使用多少次后其成本等同于训练成本?也就是说,假设已有训练数据和环境,我们只关注计算量——使用 Kimi K3 / Fable 等模型多少小时的推理,才能等同于训练它所需的计算量? – @athrowaway3z
如果要实现 AI 主权和平等,唯一的希望是要么让昂贵模型的运行成本变低,要么让廉价模型承担更少的工作。实现后者需要重新构造工作,使得智能程度较低的 LLM 能更好地胜任,或者将智能浓缩到更小的模型中。 – @sim04ful
2025 年 11 月,我会说 Anthropic 的 Opus 4.5 模型配合 Claude Code 套件是当时唯一能够一次性正确实现明确软件功能的系统。如今,我对使用 Claude 或 Codex 感到同样满意。如果这两者开始向客户收取更多费用或对安全过于狂热,看来会有大量能够胜任的开源权重模型以及真正的开源套件可供使用。甚至 Google 未来也可能推出兼具模型与代理的组合(Gemini 3.1 Pro 仍然相当强大,但我上次尝试使用 Antigravity 时表现不佳)。只要 Anthropic 的业务仍能作为多个强劲竞争者之一而存活,我就感到欣慰。该公司以安全为先的理念促使他们在新模型中增加拒绝率并刻意内置无知。从长远来看,Anthropic 可能最为人记住的是它加速了软件整体的发展,使得其他人能够构建更不胆怯的工具。 – @philipkglass
Dario 可以通过再次参加播客巡演,并以(他的)AI 导致 75% 工作岗位流失来威胁所有人;如果无效,再提升至 85%;如果仍然不奏效,就走极端,目标是 100% 工作岗位流失的言论。 – @spaceman_2020
文章写得很好。我喜欢作者将公司及其策略划分到不同的类别(并非作者的用词选择),以及它们在套件、数据中心、电力、基础模型之间的组合。我很想看到文中提到的公司如何转型以构建自己的护城河。 – @warm_soup
Anthropic 的定价有多少是由于推理成本,或是因为拥有最佳模型而能够获得的额外利润率? – @SubiculumCode
我认为关于 K3/Q3.8 是否能与 Opus 或 Fable 相媲美的争论仍未结束。基准测试变得异常模糊,我尝试过所谓‘与 X 模型相同’的模型,却并不满意。我也尝试过使用 Claude Code 的其他模型以及 OpenCode、Pi 等工具,但没有任何一个能接近使用 Anthropic 模型(主要是 Opus 4.8)时的 Claude Code 效果。我并不是说这些其他模型是垃圾,只是我还没有准备好将它们与 Anthropic 或 OpenAI 的模型等同。我的看法是,LLM 编码(以及更多)的未来可能是路由器,根据每个任务决定使用哪个模型。要知道何时使用 Fable/Opus,何时回退到 DeepSeek/Kimi/Qwen,甚至本地模型。当然这并非前沿实验室的利益所在,但我觉得这里有很多低垂的果实。我讨厌现在几乎只能‘在规划/执行等方面使用同一个模型’(而不必倒立思考)。 – @joshstrange
Anthropic 将在 80% 不需要前沿能力的使用场景中被开源模型压缩,同时在高价值任务(如生物、金融、数学等)上被垂直专用实验室压制,因为这些更小的特定用例模型在成本和速度上胜过它们,并且在性能上匹配或超越其最大的通用模型。即使它们的“抢先实现 AGI”计划也不可能实现,因为只要中国封锁台湾或 Nvidia 切断供应,就能阻止它们吞噬经济的大块份额。不存在一种情形让世界其他地区袖手旁观,让 OpenAI 或 Anthropic 垄断‘AI’。太多国家、资本雄厚的大玩家以及合作伙伴/供应商绝不会允许这种情况发生。Kimi K3 让所有现有玩家能够在前沿重新起步,继续与 OpenAI/Anthropic 竞争。它也为这些实验室的员工提供了更有利可图的路径:以全新账目和干净的资本表启动新实验室,在 K3 基础上构建,而无需在预训练自有模型上投入全部资本支出。许多人已经兑现了股票,毫无问题就能为新实验室筹集数亿美元,使他们一夜之间成为纸面亿万富翁。 – @m_ke
再添一个维度——随着回报的现实让用户收紧 AI 开支的腰包。大型公司可能会转向本地部署模型。 – @zkmon
那么,对于没有 17 台 H100 的普通用户来说,使用 Kimi K3 或 Qwen 3.8 的最经济方式是什么? – @joey64
Anthropic 必须停止恐吓宣传,停止对公众合法前沿 AI 使用的把关!通过蒸馏文明智能构建的 AI 不应只属于特权研究者。 – @chihwei
OAI 看起来比 Anthropic 更加“熟透”。一个正朝 IPO 前进,另一个选择不公开账目,这已经说明了一切。 – @Havoc
我对 Artificial Analysis 的每任务成本指标存在疑问。我们并不确切知道它们的计算方式。但最近,每任务成本成为最受讨论的话题。其逻辑基本是:如果模型 A 在基准 X 上取得 55% 的成绩,而模型 B 为 60%,但 A 的每任务成本便宜 50%,人们会选择 A 而非 B。但这暗示了智能较低的模型 A 的所有输出都是可用的,或许仅比 B 稍差一些。如果 A 的输出不可用,或者只有 1/5 的尝试能得到可用结果怎么办?在这种情况下,用户必须重新运行任务,成本会很快翻倍或三倍,使原来的平均数失真!我认为重试和不稳定的成本会远高于平均 token 成本,这才是用户真正需要承担的成本。AI-Benchy [0](诚然是个人基准)显示的数值与 Artificial Analysis 的数字大相径庭。根据 AA,Opus 4.8 的每任务成本为 $1.80,Kimi K3 为 $0.94。根据 AI Benchy,然而,Opus 4.8 的成功任务成本为 10.7 美分,而 K3 为 19.4 美分。Opus 4.8 的正确测试数量和通过率也高于 Kimi K3。因此,从每可用结果成本来看,Kimi K3 实际上比 Opus 4.8 更贵——这与 AA 的头条数字相反。因此,我不确定是否能相信 AA 的数据,还是需要自行跟踪成本。[0] https://aibenchy.com/compare/anthropic-claude-opus-4-8-mediu...
MiMo 2.5 Pro 也完全正常 – @vsilent
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch