✷ 封存 · 5,065 篇 dispatch
全部 dispatch
AgentLensHQ 封存的全部內容——提煉自整個 AI 生態。
Laguna S 2.1 發佈說明:高能力代理編碼模型
Poolside AI 發佈了 Laguna S 2.1,這是一款 118B MoE 模型,其 8B 激活參數在代理編碼與長程推理方面足以與許多更大的前沿模型競爭。
CodeAlmanac: 為 AI 編碼代理打造的動態程式碼庫 Wiki
CodeAlmanac 是一個基於 Python 的工具,透過從 AI 編碼代理的對話與儲存庫資料中提取持久性知識,自動維護基於 Markdown 的程式碼庫 Wiki。
Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber 發佈
Google 發佈了 Gemini 3.6 Flash, 3.5 Flash-Lite, 以及 3.5 Flash Cyber,重點在於 token 效率、更低的延遲以及為代理工作流提供專業的網路安全能力。
AI 與前沿技術週報:智能集群、機器人技術與開源權重模型的崛起
AI 的前沿正轉向自主智能集群、如 Kimi K3 等高性能開源權重模型,以及將具身智能整合進人形機器人技術中。
AI × 加密貨幣綜述:代理商業的崛起與可驗證基礎設施
AI 與區塊鏈的交叉正從簡單的聊天機器人轉變為以自主機器對機器支付、可驗證身份與去中心化計算市場為特徵的代理經濟。
Computable: GPU 容量的次級市場
Computable 是一個由 Y Combinator 支持的平台,允許使用者透過即時流動性與批發價格,在特定的日曆週內買賣與贖回 GPU 小時。
三維雅可比猜想反例說明
Terence Tao 於 2026 年的部落格文章展示了一個明確的多項式映射 F:C^3 → C^3,其雅可比行列式恆為非零常數但不可逆,從而提供了三維雅可比猜想的反例。
Claude Opus 4.7 發佈說明 / 有什麼新功能
Anthropic 已發佈 Claude Opus 4.7,其在軟體工程、高解析度視覺與代理可靠性方面有顯著進展,同時維持與 Opus 4.6 相同的定價。
Claude Opus 4.5 發佈:頂尖的程式編寫、代理與生產力模型
Anthropic 發佈了 Claude Opus 4.5,這是一款全新的旗艦模型,在軟體工程、長程代理任務與生產力工作負載方面表現優於先前模型,同時使用更少的 Token,且每百萬 Token 的成本僅為 5 至 25 美元。
AI 繪畫競技場:GPT-5.6 Sol、Claude Fable 5、Gemini 3.6 Flash 與 Grok 4.5 之比較
透過使用彩色鉛筆工具集對四個前沿視覺模型進行技術評估,結果顯示 GPT-5.6 Sol 在品質與效率方面領先,而 Claude Fable 5 成本顯著較高且邊際效益遞減。
vLLM AFD Plugin:針對 MoE 推論實現 Attention 與 FFN 解耦
vLLM AFD Plugin 引入了 Attention-FFN 解耦 (AFD) 技術,允許混合專家模型 (MoE) 中的 Attention 與 FFN 路徑進行獨立擴展與執行,以優化服務吞吐量與延遲。
在 NVIDIA B300 GPU 上使用 vLLM 服務 GLM-5.2
vLLM 透過實作 P/D 分離、投機填充和 IndexerCache 優化,在 24 顆 NVIDIA B300 GPU 上達成 GLM-5.2-NVFP4 的生產 SLA 合規。
Hugging Face 將 Nunchaku 4-bit Diffusion 推論整合至 Diffusers
Hugging Face 已將 Nunchaku Lite 整合至 Diffusers 函式庫,實現 4-bit 權重與激活值 (W4A4) 量化,可減少高達 50% 的 VRAM 使用量並提升約 30% 的推論速度。
ChatGPT 健康功能上線
OpenAI 已為美國用戶推出 ChatGPT 中的健康功能,使 AI 能安全地連接到 Apple Health 和醫療記錄,提供個人化且具情境感知的健康見解。
Grok Build Workflows 發佈
xAI 在 Grok Build 中推出了 Workflows,允許使用者透過將任務分發到數百個平行代理人來編排複雜任務,這些代理人會驗證結果並在單次背景執行中回傳報告。
AI 與程式設計難度的轉變
AI 已將軟體開發的主要挑戰從技術回憶和語法轉移到高階架構判斷與驗證。
Claude 不是編譯器:Vibe-Engineering 的興起
Bryan Mikaelian 認為,像 Claude 這樣的 LLM 並非單純將自然語言轉換為程式碼的編譯器,而是垂直整合的資源,讓工程師能夠在整個軟體堆疊中做出高階策略與架構決策。
透過 3D Gaussian Splatting 進行 Grace Cathedral 的數位保存
Vincent Woo 使用 Gaussian Splatting 與 PlayCanvas 建立了舊金山 Grace Cathedral 的沉浸式 3D 導覽,實現了對複雜建築細節的高保真數位保存。
Anthropic Economic Index Connector for Claude
Anthropic 為 Claude 推出了連接器,允許用戶查詢 Anthropic Economic Index 以分析 AI 如何在不同職業、任務和地區中使用。
US Tech Giants Accumulate $1.65 Trillion in Off-Balance Sheet AI Debt
五大美國科技巨頭已累積約 1.65 兆美元的隱藏債務,用於資助 AI 基礎設施,並利用特殊目的載體 (SPVs) 將這些負債保留在主要資產負債表之外。
Qwen-Image-3.0 發佈說明
Qwen-Image-3.0 是一款專注於生產力的基礎圖像生成模型,具備支持 4.5k token 輸入以進行複雜佈局、精確的 10px 文字渲染,以及原生支持 12 種語言的功能。
Kimi K3、Qwen 3.8 與 Anthropic 的潛力,以及 Anthropic 的策略挑戰
Moonshot Labs 的 Kimi K3 與阿里巴巴的 Qwen 3.8 的發布顯示,開源模型能匹配 Anthropic 的 Fable 5 效能,挑戰 Anthropic 依賴利潤率的商業模式,並凸顯擁有基礎設施的策略優勢。
AI 產生的反例在 2026 年壓倒人類數學家
在 2026 年,AI 系統如 ChatGPT、Sol 與 Claude Fable 已自動生成並形式化了多個重要猜想的反例——包括 Erdős 的單位距離猜想、Grothendieck 的群綱問題以及雅可比猜想——顯示機器現在已能在「反例」上超越人類數學家。
Kimi Work:知識工作者的桌面 AI 代理 – 功能、接受度與批評
Kimi Work 是一個本地安裝的 AI 桌面代理,整合檔案存取、透過 WebBridge 進行網頁自動化、排程任務以及代理群集,但 HN 評論者指出其 UI 幾乎直接複製了 Claude Codex,提出隱私與資料主權的疑慮,並質疑其定價與原創性。
中國開放權重 AI 策略 vs 美國封閉模型:為何開放分發可能正在贏勢
中國的開放權重 AI 策略正逐漸取得市場份額,可能削弱美國的封閉模型商業模式,進而重塑全球 AI 生態系統。
Cursor Agent Swarms and Model Economics
Cursor 證明了層級化的 "planner-worker" 代理群集可以透過策略性地混合頂尖模型與高效模型,以高精確度並在顯著降低成本的情況下,在 Rust 中重建 SQLite。
Google DeepMind $40M 承諾支持創世任務
Google 正承諾提供 4000 萬美元的 AI 代幣與雲端積分,以支持美國能源部的創世任務,為研究人員提供存取前沿 AI 工具的機會,如 AlphaEvolve 與 AlphaFold 3。
OpenAI Project Camellia: AI 基礎設施開發於埃芬漢縣
OpenAI 正在開發 Project Camellia,這是一項位於喬治亞州埃芬漢縣的私人資助數據中心項目,擁有 3.2 GW 電力合約以及 8000 萬美元的社區利益。
新聞機構如何利用 AI 推進其使命 – OpenAI 合作夥伴概覽
OpenAI 報告指出,全球新聞機構正在使用其技術來簡化新聞工作、個人化讀者體驗並加強業務運營,具體詳見其 2026 年 7 月的合作夥伴更新。
OpenAI 正在推進國家科學的新時代
OpenAI 正與美國政府及 Genesis 任務合作,將前沿 AI 模型整合到國家實驗室和大學中,以加速科學發現。
Anthropic 增加對 Public First Action 的支持至 4000 萬美元
Anthropic 向 Public First Action 追加捐贈 2000 萬美元,使其總捐款達到 4000 萬美元,以支持非黨派的公共教育和 AI 安全防護政策工作。
AI 智能經濟學:為何中國開源權重模型並非前沿威脅
對 AI 市場的分析顯示,雖然像 Kimi K3 和 Qwen3.8 Max 這樣的中國模型正接近尖端技術水平,但真正的競爭優勢在於智能的成本結構 (COGS) 而非單純的 token 價格或開源權重。
Nativ: Apple Silicon 本地 AI 模型執行器
Nativ 是一款開源、採用 MIT 授權的桌面應用程式,讓使用者透過 MLX-VLM 框架在 Apple Silicon (M1+) 上本地執行來自 Google, Cohere, 和 Liquid AI 的精選開源權重模型。
OpenCode 分析:安全性漏洞與架構缺陷
對 OpenCode 的技術深度分析,強調了包括 RCE 漏洞與無效的指令過濾在內的關鍵安全性風險,以及與提示詞快取失效相關的重大效能問題。
OpenAI Presence: 企業級 AI 代理人部署框架
OpenAI Presence 是一個可投入生產的框架,用於在語音和聊天渠道部署可信的 AI 代理人,結合模型推理、政策、防護欄以及 Codex 驅動的改進迴路。
Searchlight Cyber wp2shell WordPress RCE 於 GPT‑5.6 Sol Ultra 發現
Searchlight Cyber 使用 GPT‑5.6 Sol Ultra 並耗費約 25 美元的運算資源,發現 WordPress 批次 API 中的預驗證 SQL 注入,並將其串接至遠端程式碼執行(RCE),此漏洞據稱可為利用者帶來 50 萬美元的報酬。
Measuring AI-Generated Writing on arXiv: Trends and Limitations
對 12,750 篇 arXiv 論文的研究顯示,最近的投稿中約有 32% 被標記為機器寫作,其中 Computer Science 的盛行率最高,達到 65%。
Claude Opus 4.8 發佈說明
Anthropic 已發佈 Claude Opus 4.8,這是一個升級版模型,具有改進的推理能力、更高的誠實度以及新的代理型能力,同時引入了動態工作流和努力程度控制功能。
Anthropic Agent Skills 發佈
Anthropic 推出了 Agent Skills,這是一個具備可移植性與可組合性的指令與腳本框架,讓 Claude 能夠在 Claude apps、Claude Code 和 API 中執行專門任務。
Anthropic Claude Sonnet 4.5 發佈:頂尖的程式碼編寫模型與全新開發者工具
Anthropic 發佈了 Claude Sonnet 4.5,這是其最強大且最符合對齊原則的前沿模型,提供頂尖的程式碼編寫、推理與電腦使用效能,同時推出了 Claude Agent SDK 與重大產品升級。
Anthropic Claude Haiku 4.5 發佈:以三分之一的成本與兩倍的速度提供接近前沿等級的程式碼編寫效能
Anthropic 發佈了 Claude Haiku 4.5,這是一款小型模型,能以約 Sonnet 4 三分之一的成本與兩倍以上的速度,提供接近前沿等級的程式碼編寫品質。
Xiaomi-Robotics-1: 使用 100,000 小時數據擴展視覺-語言-動作模型
Xiaomi-Robotics-1 是一款機器人基礎模型,透過在 100,000 小時的軌跡數據上進行「非具身」預訓練,打破了機器人技術中的數據瓶頸,並在移動操作任務中達到了尖端(SOTA)的性能。
AI 與前沿技術綜述 – Kimi K3、代理基準與向混合、具成本效益 AI 系統的轉變
Kimi K3 在代理基準上表現優異,結合新路由技巧、開放權重發布與工具管理最佳實踐,顯示出 AI 堆疊正快速向混合模式轉變:以低成本模型處理日常工作,將昂貴的前沿模型保留給規劃階段。
AI × 加密貨幣綜述:代理付款、去中心化運算、代幣化代理、可驗證 AI 與市場
AI 代理正透過加密鐵路實現付款、運算、代幣化執行、零知識驗證與去中心化市場,重塑自主軟體的交易與證明方式。
Claude Design 發佈說明
Anthropic 推出了 Claude Design,這是一款由 Claude Opus 4.7 驅動的 AI 協作工具,讓使用者能夠利用整合的設計系統來建立和完善視覺作品、原型以及行銷素材。
Claude Fable 與 Jacobian 猜想的反例
一個名為 Claude Fable 的 AI 模型據稱提供了 Jacobian 猜想的反例,這是一個長達 85 年未解的數學難題。
Claude for Small Business
Anthropic 推出了 Claude for Small Business,這是一套連接器與代理型工作流套件,可將 Claude 直接整合到 QuickBooks、PayPal 與 HubSpot 等常見的小型企業工具中。
Claude Opus 4.6 發佈說明
Anthropic 已發佈 Claude Opus 4.6,具備 1M token 上下文窗口、頂尖的代理編碼與推理能力,以及開發者用於自適應思考與努力程度的新控制功能。
NTT DATA Group Codex 實施與成果
NTT DATA Group 透過將 Codex 部署給 9,000 名員工,作為更廣泛 AI 轉型策略的一部分,將複雜的事件分析流程從三天縮短至 30 分鐘。
vLLM Kimi K3 支援預覽
vLLM 正在為 Moonshot AI 的 Kimi K3(一個具有混合 KDA/完整注意力架構和原生視覺支援的 2.8 兆參數模型)準備 day-0 開源服務支援。