✷ 归档 · 5,064 篇 dispatch
全部 dispatch
AgentLensHQ 归档的全部内容——提炼自整个 AI 生态。
Laguna S 2.1 发布说明:高能力智能体编程模型
Poolside AI 发布了 Laguna S 2.1,这是一个拥有 8B 激活参数的 118B MoE 模型,在智能体编程和长程推理方面可以与规模大得多的前沿模型相媲美。
CodeAlmanac: 面向 AI 编程代理的动态代码库维基
CodeAlmanac 是一个基于 Python 的工具,它通过从 AI 编程代理的对话和仓库数据中提取持久化知识,自动维护一个基于 Markdown 的代码库维基。
Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber 发布
Google 发布了 Gemini 3.6 Flash, 3.5 Flash-Lite, 和 3.5 Flash Cyber, 重点关注智能体工作流的 token 效率、更低的延迟和专门的网络安全能力。
AI 与前沿技术综述:代理群体、机器人技术与开源权重模型的崛起
摘要:AI 的前沿正向自主代理群体、高性能的开源权重模型(如 Kimi K3)以及具身智能在类人机器人中的融合转变。
AI × Crypto 综述:智能体商业与可验证基础设施的兴起
AI 与区块链的交汇正从简单的聊天机器人转向由自主机器对机器支付、可验证身份和去中心化计算市场定义的智能体经济。
Computable: GPU 容量的二级市场
Computable 是一个由 Y Combinator 支持的平台,允许用户通过即时流动性和批发价格,在特定日历周内买卖和兑换 GPU 小时数。
对雅可比猜想反例的消化
展示了一个三变量多项式映射,其雅可比行列式为常数非零,从而推翻了三维的雅可比猜想,并表明局部可逆性并不保证全局可逆性。
Claude Opus 4.7 发布说明 / 更新内容
Anthropic 发布了 Claude Opus 4.7,在软件工程、高分辨率视觉和智能体可靠性方面取得了显著进展,同时保持与 Opus 4.6 相同的价格。
Claude Opus 4.5 发布:业界领先的编码、智能体与生产力模型
Anthropic 宣布推出 Claude Opus 4.5,这一新旗舰模型在软件工程、长周期智能体任务和生产力工作负载方面均超越此前模型,同时使用远少于以往的 token,定价为每百万 token 5 至 25 美元。
TITLE: AI 绘图竞技场:比较 GPT-5.6 Sol、Claude Fable 5、Gemini 3.6 Flash 和 Grok 4.5
摘要: 使用彩色铅笔工具集对四种前沿视觉模型进行的技术评估表明,GPT-5.6 Sol 在质量和效率方面领先,而 Claude Fable 5 的成本显著更高,收益递减。
vLLM AFD Plugin:为 MoE 推理实现 Attention 与 FFN 解耦
vLLM AFD Plugin 引入了 Attention-FFN 解耦 (AFD),允许混合专家模型 (MoE) 中的 Attention 和 FFN 路径进行独立扩展和执行,从而优化推理吞吐量和延迟。
使用 vLLM 在 NVIDIA B300 GPU 上部署 GLM-5.2
通过实施 P/D 解耦、投机填充和 IndexerCache 优化,vLLM 在 24 块 NVIDIA B300 GPU 上实现了 GLM-5.2-NVFP4 的生产级 SLA 合规性。
Hugging Face 将 Nunchaku 4-bit Diffusion 推理集成至 Diffusers
Hugging Face 已将 Nunchaku Lite 集成到 Diffusers 库中,实现了 4-bit 权重和激活 (W4A4) 量化,可将 VRAM 使用量降低高达 50%,并将推理速度提高约 30%。
ChatGPT 中的健康功能上线
OpenAI 已面向美国用户推出了 ChatGPT 中的健康功能,允许 AI 安全地连接 Apple Health 和医疗记录,以提供个性化、具备上下文感知能力的健康见解。
Grok Build Workflows 发布
xAI 在 Grok Build 中引入了 Workflows,允许用户通过将任务分发到数百个并行智能体来编排复杂任务,这些智能体会在单次后台运行中验证结果并汇报。
AI 与编程难度的转变
AI 已将软件开发的主要挑战从技术记忆和语法转向了高层架构判断和验证。
Claude 不是编译器:Vibe‑Engineering 的崛起
Bryan Mikaelian 认为,Claude 等 LLM 并非仅把自然语言编译成代码的编译器,而是垂直集成的资源,使工程师能够在整个软件栈上做出高层战略和架构决策。
通过 3D Gaussian Splatting 实现 Grace Cathedral 的数字化保存
Vincent Woo 使用 Gaussian Splatting 和 PlayCanvas 创建了一个沉浸式的 Grace Cathedral 3D 导览,实现了对复杂建筑细节的高保真数字化保存。
Anthropic Economic Index Connector for Claude
Anthropic 为 Claude 推出了一个连接器,允许用户查询 Anthropic Economic Index 以分析 AI 在不同职业、任务和地区的使用情况。
美国科技巨头积累了1.65万亿美元的表外AI债务
五家主要的美国科技公司已积累了约1.65万亿美元的隐藏债务,用于资助AI基础设施,利用特殊目的载体(SPVs)将这些负债保持在它们的主要资产负债表之外。
Qwen-Image-3.0 发布说明
Qwen-Image-3.0 是一个专注于生产力的基础图像生成模型,其特点是支持 4.5k token 输入以实现复杂布局、精确的 10px 文本渲染,并原生支持 12 种语言。
Kimi K3、Qwen 3.8 与 Anthropic 的潜力及其战略挑战
Moonshot Labs 的 Kimi K3 与阿里巴巴的 Qwen 3.8 的发布表明,开源模型可以匹配 Anthropic 的 Fable 5 性能,这对 Anthropic 依赖利润率的商业模式构成挑战,并凸显拥有基础设施的战略优势。
AI 生成的反例在 2026 年压倒人类数学家
在 2026 年,ChatGPT、Sol 与 Claude Fable 等 AI 系统自动生成并形式化了多个重要猜想的反例——包括 Erdős 的单位距离猜想、Grothendieck 的群方案问题以及雅可比猜想——展示了机器现在能够在反例上超越人类数学家。
Kimi Work AI 桌面代理 – 功能、定价与社区反馈
Kimi Work 是一款本地运行的 AI 桌面代理,能够自动化文件、网页浏览和计划脚本,但 Hacker News 社区批评其大量 UI 抄袭并对隐私存有顾虑。
中国开放权重 AI 战略 vs 美国封闭模型:为何开放分发可能正在取胜
中国的开放权重 AI 战略正在抢占市场份额,可能削弱美国的封闭模型商业模式,进而重塑全球 AI 生态系统。
Cursor Agent Swarms and Model Economics
Cursor 展示了通过策略性地混合使用前沿模型和高效模型,分层 "planner-worker" 智能体集群可以在以极高的准确度并在显著降低成本的情况下,在 Rust 中重建 SQLite。
TITLE: 谷歌DeepMind 4000万美元致力于创世纪任务
SUMMARY: 谷歌承诺提供4000万美元的人工智能代币和云积分,以支持美国能源部的创世纪任务,为研究人员提供对如AlphaEvolve和AlphaFold 3等前沿人工智能工具的访问。
OpenAI Project Camellia: 埃芬汉县的人工智能基础设施开发
OpenAI 正在埃芬汉县、佐治亚州开发 Project Camellia,这是一个私人资助的数据中心项目,具有 3.2 GW 的电力合同和 $80 million 的社区福利。
新闻组织如何利用 AI 推进其使命 – OpenAI 合作伙伴概览
OpenAI 报道称,全球新闻组织正在使用其技术来简化新闻工作、个性化读者体验并加强业务运营,正如其 2026 年 7 月合作伙伴更新中所详细说明的。
OpenAI 推动国家科学的下一个时代
OpenAI 正与美国政府和 Genesis Mission 合作,将前沿 AI 模型融入国家实验室和大学,以加速科学发现。
Anthropic 将对 Public First Action 的支持增加至 4000 万美元
Anthropic 已向 Public First Action 追加捐赠 2000 万美元,使其总捐赠额达到 4000 万美元,以支持非党派的 AI 安全公共教育和政策工作。
AI 智能经济学:为什么中国开源权重模型不是前沿威胁
对 AI 市场的分析显示,虽然像 Kimi K3 和 Qwen3.8 Max 这样的中国模型正在接近最先进的能力,但真正的竞争优势在于智能的成本结构(COGS)而非原始的 token 价格或开源权重。
Nativ: Apple Silicon 本地 AI 模型运行器
Nativ 是一款开源、采用 MIT 许可的桌面应用程序,允许用户使用 MLX-VLM 框架在 Apple Silicon (M1+) 设备上本地运行来自 Google, Cohere, 和 Liquid AI 的精选开源权重模型。
OpenCode 分析:安全漏洞与架构缺陷
对 OpenCode 的技术深度剖析,重点突出其关键安全风险,包括 RCE 漏洞和无效的命令过滤,以及与提示缓存未命中相关的显著性能问题。
OpenAI Presence: 企业 AI 代理部署框架
OpenAI Presence 是一个生产就绪的框架,用于在语音和聊天渠道部署可信的 AI 代理,将模型推理与政策、防护栏以及 Codex 驱动的改进循环相结合。
Searchlight Cyber wp2shell WordPress RCE 通过 GPT‑5.6 Sol Ultra 发现,仅耗费 $25
Searchlight Cyber 使用 GPT‑5.6 Sol Ultra 发现了 WordPress Batch API 中的预认证 SQL 注入,并将其链式利用至远程代码执行,整个过程仅花费 $25,展示了为何漏洞交易商愿意为此类零日支付高达 $500 k。
Measuring AI-Generated Writing on arXiv: Trends and Limitations
对 12,750 篇 arXiv 论文的研究显示,最近提交的论文中约 32% 被标记为机器编写,其中 Computer Science 的流行度最高,达到 65%。
Claude Opus 4.8 发布说明
Anthropic 发布了 Claude Opus 4.8,这是一个升级版模型,具有改进的推理能力、更高的诚实度以及新的代理能力,同时引入了动态工作流和精力控制功能。
Anthropic Agent Skills 发布
Anthropic 推出了 Agent Skills,这是一个可移植且可组合的指令和脚本框架,允许 Claude 在 Claude apps、Claude Code 和 API 中执行专门的任务。
Anthropic Claude Sonnet 4.5 发布:最先进的编程模型与全新开发者工具
Anthropic 发布了 Claude Sonnet 4.5,这是其能力最强且对齐度最高的前沿模型,在提供顶级编程、推理和计算机使用性能的同时,推出了 Claude Agent SDK 和重大产品升级。
Anthropic Claude Haiku 4.5 发布:以三分之一的成本和两倍的速度实现接近前沿水平的编程性能
Anthropic 发布了 Claude Haiku 4.5,这是一款小模型,能以大约 Sonnet 4 三分之一的成本和两倍以上的速度提供接近前沿水平的编程质量。
Xiaomi-Robotics-1: 通过 100,000 小时数据扩展视觉-语言-动作模型
Xiaomi-Robotics-1 是一款机器人基础模型,它通过在 100,000 小时的轨迹数据上进行“无具身”预训练,打破了机器人技术的数据瓶颈,并在移动操作任务中实现了最先进的性能。
AI 与前沿技术综述 – Kimi K3、代理基准与向混合、低成本 AI 系统的转变
Kimi K3 在代理基准上表现强劲,结合新的路由技巧、开源权重发布以及工具管理最佳实践,标志着 AI 堆栈快速向混合模式转变:廉价模型处理日常工作,昂贵的前沿模型用于规划。
AI × 加密综述:代理支付、去中心化计算、代币化代理、可验证 AI 与市场
AI 代理正迁移到加密轨道,实现支付、计算、代币化执行、零知识验证和去中心化市场,重塑自主软件的交易方式和工作证明。
Claude Design 发布说明
Anthropic 推出了 Claude Design,这是一款由 Claude Opus 4.7 驱动的 AI 协作工具,用户可以使用集成的设计系统来创建和完善视觉作品、原型和营销素材。
Claude Fable 与雅可比猜想的反例
据报道,一个名为 Claude Fable 的 AI 模型产生了一个雅可比猜想(Jacobian Conjecture)的反例,这是一个存在了 85 年之久且尚未解决的数学问题。
Claude for Small Business
Anthropic 推出了 Claude for Small Business,这是一套连接器和智能体工作流,可将 Claude 直接集成到 QuickBooks、PayPal 和 HubSpot 等常见的小企业工具中。
Claude Opus 4.6 发布说明
Anthropic 发布了 Claude Opus 4.6,其特点是拥有 1M token 上下文窗口、行业领先的智能体编码和推理能力,以及面向开发者的新型自适应思维和 effort 控制功能。
NTT DATA Group Codex 实施与结果
NTT DATA Group 通过向 9,000 名员工部署 Codex,将复杂的事件分析流程从三天缩短至 30 分钟,这是更广泛的 AI 转型战略的一部分。
vLLM Kimi K3 支持预览
vLLM 正在为 Moonshot AI 的 Kimi K3 准备 day-0 开源服务支持,这是一个具有 2.8 万亿参数的模型,具有混合 KDA/全注意力架构和原生视觉支持。