Kimi K3、Qwen 3.8 與 Anthropic 的潛力,以及 Anthropic 的策略挑戰

Kimi K3 與 Qwen 3.8 發布概覽

Kimi K3 與 Qwen 3.8 是最先進的開源模型,於 2026 年 7 月發布,Kimi K3 於 7 月 16 日上線,Qwen 3.8 於 7 月 19 日宣布,據報導兩者的效能接近 Anthropic 的 Fable 5,且其權重將公開提供。

前沿實驗室經濟學:成本結構與利潤率

基礎模型的經濟結構分為高額的前期訓練成本(研究人員、計算資源、電力)以及以電力與計算為主的推論成本;擁有更多基礎設施層級可將變動成本轉為固定成本,使利潤率隨使用量提升,而租用基礎設施則使成本與收入成比例。

策略含意:基礎設施所有權 vs 僅模型提供者

擁有資料中心或發電設施的公司可以將基礎設施貨幣化並擴大利潤率,而僅提供模型的業者必須依賴成為最佳或最便宜的模型,導致在推論成本上不斷向下競爭,或是必須維持效能領先。

Anthropic 的危險處境

Anthropic 專注於監管策略與遞迴自我改進,使其面臨成本劣勢——其模型每完成一項任務的成本幾乎是競爭對手的三倍——以及產品拆解的風險,因為開源模型的效能逼近其表現,且新創公司利用工具削弱其產品護城河。

Kimi K3 與 Qwen 3.8 的更廣泛影響

多個開源模型同時發布顯示出持續的競爭壓力,削弱純模型提供者的防禦能力,並有利於如 Meta、阿里巴巴、SpaceX 與 Google 等垂直整合的玩家。

來自 Hacker News 的社群觀點

過去幾天的開放權重、開放架構發布讓我更確信,最終的贏家將是最快將模型燒錄到 ASIC 的那一方。LLM 本身已能執行部分晶片設計工作,正如 K3 新聞稿所示。此外,前沿模型對廣泛任務已「足夠好」,且很快就會達到軟體工程的大量需求門檻(若尚未達到)。有人認為規劃公路旅行或提供蛋糕食譜建議需要 Mythos 級別的模型嗎?一個在 ASIC 上以 9,000 token/s 運行的 Fable 5 模型,遠超在使用電力、搭配 Nvidia GPU 的 150 token/s,甚至比巨型 SRAM Cerebras 或 Groq 晶片還要足以滿足大多數需求。此外,若您是企業,將資料外洩或提供給如 OpenAI 或 Anthropic 之類的潛在競爭者的風險,若能轉向本地 ASIC 部署則大幅降低。少量晶片即可覆蓋多種使用情境,且更安全。LLM 在企業中的許多使用案例並非前沿數學研究或程式編寫。 – @LarsDu8888

我一直在思考 Figma 事件。如果你不清楚,以下是 Google 的摘要:---- 董事會離職:Mike Krieger,Anthropic 的 CPO 兼 Instagram 共同創辦人,曾坐在 Figma 的董事會。他於 4 月 14 日辭職,正好在 Claude Design 的消息曝光前幾天。此事引發了利益衝突與使用專有產品策略資訊的猜測。合作背叛:此發布使科技產業受到衝擊,因為 Figma 依賴 Anthropic 的模型來驅動其 AI 功能,甚至宣布了「Code to Canvas」的聯合整合。報導指出 Figma 被 Claude Design 的深度與範圍措手不及。市場反應:「SaaSpocalypse」論點——擔憂主要 AI 基礎模型快速構建應用層,侵蝕自身 SaaS 合作夥伴——在消息傳出時得以驗證。Figma 的股價在公告後立即下跌 7%。---- 我想對使用 LLM 的人建議:應謹慎向這些公司提供資料或依賴它們。若你在打造 AI 初創公司,若你的想法已有市場牽引,它們很可能會直接與你競爭。你也會受制於它們的 API 定價等。 – @overgard

我認為風險被過度誇大。首先,在邊際上,人們願意為稍微更好的模型付出高額費用。我個人知道 LLM 為我的工作流程帶來的價值遠高於我每月支付給前沿實驗室的 $200。我並不想為了稍微降低成本而去優化。確實有極少數聲音強烈的群體或公司將 LLM 成本降到邊際,但我認為那是少數(如果我錯了請指正,我想了解他們的客戶基礎)。此外,實際的 LLM 只佔增值的一小部分。任何嘗試從 LLM API 建構代理解決方案的人很快會發現,巨大的價值在於 Claude Code / Codex 的工具。雖然有像 OpenCode 這樣的開源實作,但遠不及。換個角度思考。想想微軟在維護 Excel 上花了多少錢。市面上有 >90% 功能的開源替代品,甚至能處理與產生 Excel 檔案。Google Sheets 可能達到 99%,且對所有人開放,在許多方面更優。但試算表軟體為員工創造的巨大價值,使得每年超過 $100(或其他金額)的收益形成了真正的護城河,沒有人願意去探索替代方案。 – @bko

令人驚訝的是,Fable 從『需要被禁用的顛覆性模型』迅速變成『還好,OpenAI 也同樣出色,且有幾個開放權重的替代方案在幾乎所有方面都相當』。炒作週期正在縮短,也許我們真的正走向某種平台期(最後的名言)。 – @port3000

確實感覺今天在 HN 上被推動了一個特定的敘事。 – @a13n

更重要的是,作為可持續的長期事業,僅模型提供者尤其面臨風險。Knowledge Atlas、Moonshot Labs 與 Anthropic 在面對 OpenAI、阿里巴巴、SpaceX、Meta 與 Google 時,防禦性挑戰更大。嗯。OpenAI 為何不像 Anthropic 那樣是「僅模型」提供者?看起來它們同樣脆弱。 – @drob518

AI 進步的上限——遞迴自我改進。在此情況下,AI 將負責打造更好的模型,使擁有資料中心的人成為贏家。Anthropic/OAI 已經被烤熟。AI 進步的下限——平台期。進展放緩,重點在於以最低成本提供有意義的峰值能力。今天有消息稱 Google 正在打造一款將權重燒錄於矽晶片的 Gemini 晶片。考慮到晶片至少有 2-3 年的壽命,而今天的 2-3 年模型在今天已無用,他們預期未來三年不會取得相同的進展。遊戲在於以最低利潤銷售。Anthropic/OAI 已烤熟。因此,它們的生存依賴於 AI 進步介於這兩個極端之間的假設。 – @torginus

對我而言更大的問題是,投資於更高能力的通用模型何時會停止顯示投資回報率?例如——有多少比例的工作流程需要這種新高能力模型?其中有多少可以被其周邊的軟體工具取代?我的意思是,如果軟體工具能在幾次迭代中優化查詢,是否能得到與一次性高能力模型查詢相同的輸出? – @yalogin

我認為一個重要問題是,這些實驗室是否能產出超越 Anthropic 與 OpenAI 的模型。相關的問題是它們在多大程度上依賴 Anthropic 與 OpenAI 的 API 來達成成果——無論是透過蒸餾或其他用途。如果這些模型是 Anthropic/OpenAI 的衍生品,我預期其效能會較為狹窄,且進展受限。 – @davidpapermill

這是 OpenAI 相較於 Anthropic 的優勢所在。儘管其模型在最近幾個月落後於 Anthropic,但其在產品、消費者體驗、網站發布、語音與硬體方面的投資,都朝向更明顯的護城河。我在此之前與你同感。我不認為 OpenAI 的產品護城河比 Anthropic 更具實質性;相反,Claude / mythos 等品牌是 OpenAI 所缺乏的寶貴資產。的確,許多常在線的 HN 精英工程師已偏好 Codex,但若你真的與產業中的普通工程師交談,代理式編碼仍然等同於 Claude Code。至於非工程用途,Claude 作為對話伴侶遠比任何 GPT 系列更令人愉快,我懷疑這已深植於模型之中,否則 OpenAI 現在早就彌合此差距。 – @piazz

模型建成後,最大的成本是推論。我找不到可靠的數據,但若能提供規模感會很有幫助:使用多少次才等於訓練成本?也就是說,假設你已有訓練資料與環境,我們只關心計算資源——使用例如 Kimi K3 / Fable 多少小時,才能等同於訓練所需的計算量? – @athrowaway3z

若要實現 AI 主權與平等,我們必須讓昂貴模型的運行成本降低,或讓較便宜的模型減少工作量。後者的實現方式包括重新構思工作,使較不智能的 LLM 能更好地配合,或將智慧濃縮至更小的模型。 – @sim04ful

2025 年 11 月,我會說 Anthropic 的 Opus 4.5 模型結合其 Claude Code 工具,是第一且唯一一個能一次性正確實作明確軟體功能的系統。如今,我對使用 Claude 或 Codex 同樣感到滿意。若這兩者開始向客戶收取更多費用或對安全過於熱衷,似乎會有大量具備能力的開放權重模型與真正的開源工具可供使用。甚至 Google 也可能最終推出具備模型加代理的組合(Gemini 3.1 Pro 仍相當強大,但我上次嘗試使用 Antigravity 時表現不佳)。只要 Anthropic 的業務仍能作為多個強大競爭者之一,我就感到欣慰。該公司以安全為先的理念促使他們在新模型中增加拒絕率與刻意內建的無知。長遠來看,Anthropic 可能最被記住的是加速軟體開發,使其他人能打造較不保守的工具。 – @philipkglass

Dario 可以再次上播客巡迴,威脅大家因(他的)AI 造成 75% 的工作流失;若無效,將比例提升至 85%;若仍不奏效,則採取核彈式策略,目標 100% 工作流失。 – @spaceman_2020

寫得很好的文章。我喜歡作者將公司及其策略分類到不同的類別(不是作者的用詞)或是結合工具、資料中心、電力、基礎模型的方式。若能看到提及的公司如何轉型以建立護城河,我會更感興趣。 – @warm_soup

Anthropic 的價格有多少是因為推論成本,或是因擁有最佳模型而能取得的額外利潤? – @SubiculumCode

我認為對 K3/Q3.8 是否與 Opus 或 Fable 等價仍未有定論。基準測試變得相當模糊,我嘗試過標稱「與 X 模型相同」的模型,卻不甚滿意。我也試過其他模型搭配 Claude Code 以及 OpenCode 或 Pi 等工具,仍無法與使用 Anthropic 模型(主要是 Opus 4.8)的 Claude Code 相提並論。我並不是說這些其他模型是垃圾,只是我尚未準備好將它們與 Anthropic 或 OpenAI 的模型等同。未來的 LLM 程式編寫(以及更多)可能會是根據每項任務決定路由至哪個模型的路由器。要知道何時使用 Fable/Opus,何時回退至 DeepSeek/Kimi/Qwen,甚至本地模型。當然這不符合前沿實驗室的利益,但感覺有許多低垂的果實。我討厭現在幾乎只能「對規劃/執行等使用相同模型」(而不必倒立)。 – @joshstrange

Anthropic 將在 80% 不需要前沿能力的使用案例中被開源模型擠壓,且在高價值任務(如生物、金融、數學等)上被垂直專屬實驗室取代,這些較小的特定用途模型在成本與速度上勝過它們,同時匹配或超過其最大通用模型的效能。即使它們以率先達成「AGI」作為最後的救命稻草,也不會實現,因為只要中國封鎖台灣或 Nvidia 切斷供應,即可阻止它們吞食大量經濟。世界不會有任何情況讓其他國家袖手旁觀,讓 OpenAI 或 Anthropic 壟斷「AI」。太多國家、資本雄厚的玩家以及合作夥伴/供應商不會允許此事發生。Kimi K3 讓所有現有玩家得以在前沿重新起步,持續與 OpenAI/Anthropic 競爭。它也為這些實驗室的員工提供了更好、更有利可圖的路徑,能以全新帳目與乾淨的資本表創建新實驗室,基於 K3 建立,而不必將所有資本支出於自行預訓練模型。許多人已經持有股票,且在為新實驗室籌集數億美元時毫無問題,瞬間成為紙上億萬富翁。 – @m_ke

再加入一個維度——使用者在 AI 支出上收緊腰包,因為回報的現實讓他們感受到壓力。大型公司可能會選擇本地部署模型。 – @zkmon

那麼,對於沒有 17 台 H100 的普通使用者,使用 Kimi K3 或 Qwen 3.8 最划算的方式是什麼? – @joey64

Anthropic 必須停止恐嚇,並停止對一般大眾封鎖前沿 AI 的使用!由文明智慧蒸餾而成的 AI 不應只屬於特權研究者。 – @chihwei

OAI 看起來比 Anthropic 更加「熟」了。兩者其中一個正朝 IPO 前進,另一個選擇不公開財報,這已說明一切。 – @Havoc

我對 Artificial Analysis 的每任務成本指標有疑慮。我們不知道他們的計算方式。近期,每任務成本成為最受討論的議題。其邏輯基本上是:如果模型 A 在基準 X 上達到 55%,模型 B 達到 60%,但模型 A 的每任務成本便宜 50%,人們會選擇 A 而非 B。但這暗示較不智能的模型 A 的所有輸出皆可使用,或許只比 B 稍差。但若 A 的輸出不可用,或只能在 5 次嘗試中有 1 次成功,使用者就必須重新執行任務,成本會迅速翻倍或三倍,導致原本的平均數字誤導!我認為重試與不穩定的成本會遠高於平均 token 成本,這才是使用者真正要承擔的成本。AI‑Benchy [0](雖然是一個人製作的基準)顯示的數字與 Artificial Analysis。根據 AA,Opus 4.8 的每任務成本為 $1.80,Kimi K3 為 $0.94。根據 AI‑Benchy,然而,Opus 4.8 的成功任務成本為 10.7 美分,而 K3 為 19.4 美分。Opus 4.8 的正確測試數量與通過率也高於 Kimi K3。因此,若以每可用結果的成本計算,Kimi K3 實際上比 Opus 4.8 更昂貴——與 AA 的標題數字相反。因此,我無法確定是否能相信 AA 的數據,或是需要自行追蹤成本。[0] https://aibenchy.com/compare/anthropic-claude-opus-4-8-mediu...

MiMo 2.5 Pro 也能正常運作 – @vsilent

Sources

相關