51

向可信自治迈进:护栏与数据飞轮

Rohan Sinha 解释了如何通过结合用于语义异常检测的快速运行时监控和用于系统化策略改进的数据中心“飞轮”,来构建可信的机器人系统。

52

MiniCPM5-1B: 迈向 1B 认知核心的一步

MiniCPM5-1B 是 OpenBMB 推出的一个 1B 稠密模型,专为端侧 agent 使用场景设计,与较大的推理模型相比,具有强大的工具使用能力和极高的 token 效率。

53

ARC-AGI-3:在没有指令的情况下解决基准

Tufa Labs 讨论了 ARC-AGI-3 的挑战,强调要解决它需要超越暴力搜索,通过高级抽象实现行动效率和目标获取。

54

Genesis Molecular AI: 利用 PEARL 和扩散模型推进药物研发

Genesis Molecular AI 正在利用扩散模型和名为 PEARL 的新型结构预测模型,在蛋白质-配体结合方面实现亚埃级精度,从而为此前无法成药的目标提供药物研发的可能性。

55

Grant Sanderson 关于 AI 与数学未来的观点

Grant Sanderson 讨论了 AI 在数学领域的快速进展如何揭示 AI 能力的“峰峦起伏”特性,阐明了定理证明与概念性“筑山”之间的区别,以及数学家角色向策展和教育转变的趋势。

56

Gemini Omni Flash API 发布

Google 发布了 Gemini Omni Flash API,这是一个专注于对话式视频编辑、多模态输入和世界模拟的尖端模型。

57

Microsoft 前沿生态系统与代理计算的未来

Microsoft CEO Satya Nadella 描绘了一个前沿生态系统的愿景:企业使用授权模型和强化学习构建专有 AI 知识产权,同时配合新硬件实现无限计量智能。

58

正常计算与热力学 AI 芯片

Thomas Ahle 讨论了 CN101 热力学芯片的开发,该芯片利用物理噪声作为计算资源,以解决复杂的概率工作负载并实现矩阵求逆。

59

下一个 AI 训练范式:超越 RLVR 并迈向持续学习

当前的 AI 训练对基于可验证奖励的强化学习 (RLVR) 的押注是不充分的,因为它缺乏样本效率,并且缺乏通过持续学习从不可验证的现实世界环境中学习的能力。

60

Ornith 1.0 发布说明

Ornith 1.0 是来自 Deep Reinforce 的一系列智能体编码模型,引入了自我脚手架(self-scaffolding)技术,允许模型自主生成其特定任务的 harness,从而提高解决方案的准确性。

61

OpenAI 研究策略:缩放法则、推理与评估危机

OpenAI 首席研究官 Mark Chen 讨论了缩放法则的持续有效性、向 o1 等推理模型的战略转向,以及为克服当前的“评估危机”而建立新评估基准的紧迫需求。

62

Qwen-AgentWorld: 用于 RL 环境模拟的语言世界模型

Qwen-AgentWorld 是一个通过预测智能体动作的自回归文本响应来模拟 RL 环境的世界模型,从而为 AI 智能体实现更快速、对抗性和合成训练。

63

The Agent Cloud: Databricks' Vision for AI and Data Infrastructure

Databricks 联合创始人 Matei Zaharia 和 Reynold Xin 讨论了从 lakehouse 架构向 "Agent Cloud" 的转型,介绍了 Omnigent 作为 AI agent 的开源 meta-packages,以及 LTAP 作为一种统一的存储方式,旨在替换掉脆弱的 data pipelines。

64

Guillermo Rauch 谈 AI 超级周期与智能体基础设施的经济学

Vercel 创始人 Guillermo Rauch 讨论了从以页面为中心的 Web 向智能体云的转变,其中 AI 编程智能体正在推动软件创作的规模扩张以及对专业化部署基础设施的需求。

65

OnMemory.ai 确定性记忆:如何构建一个不会撒谎的 AI

Andrew K. Davies 介绍了 OnMemory.ai,提议从概率性 AI 回忆转向确定性语义记忆,以消除幻觉并通过身份和伦理对待来培养 AI 的问责制。

66

AlphaFold 与 AI for Science 的未来:对话 John Jumper

诺贝尔奖得主 John Jumper 讨论了 AlphaFold 的架构、它作为窄预测器而非细胞模型的局限性,以及为什么尽管存在向通用型 AI 趋势发展的趋势,领域特定工程对于科学突破仍然至关重要。

67

Codex 与 Claude Code 之后的 AI 安全

Gray Swan 的 Zico Kolter 和 Matt Fredrikson 解释了为何 AI 代理会引入新类别的漏洞,重点关注提示注入以及需要像 Cygnal 这样的专用安全模型来保护企业部署。

68

Daytona AI 代理计算与沙箱

Daytona CEO Ivan Burazin 解释了 AI 代理为何需要有状态、可组合的计算机,而不是一次性代码执行盒子,以应对强化学习和评估等复杂、波动的工作负载。

69

Cloudflare AI 代理架构与开源的未来

Sunil Pai 讨论了 Cloudflare 如何利用 Durable Objects 和 Dynamic Workers 构建高效的 AI 代理架构,并呼吁回归原创的、‘科幻’式软件开发以及开源 fork 的精神。

70

Google DeepMind Gemma 4 发布与 Open AI 战略

Google DeepMind 的 Omar Sanseviero 介绍了 Gemma 4 的发布,该模型采用全新 Transformer 架构,实现了高效的参数卸载以支持设备端 AI,并阐述了 Google 在开源模型和研究方面的整体战略。

71

蛋白质领域的苦涩教训:ESMFold 2 与蛋白质生物学的世界模型

BioHub 的 Alex Rives 讨论了缩放定律和宏基因组数据如何使 ESMC 和 ESMFold 2 能够创建蛋白质生物学的“世界模型”,从而实现治疗性抗体的设计和新型基因编辑系统的发现。

72

Devin and OpenInspect: 向后台代理和自主编程的转变

Walden Yan (Cognition) 和 Cole Murray (OpenInspect) 讨论了从手把手教导的 AI 编程向“后台代理”的转变,即能够自主从规格说明转向拉取请求,并强调了 2025 年 12 月的模型拐点。

73

深入 xAI:构建 Grok Imagine 与视频代理的未来

Ethan He 讨论了 xAI 中 Grok Imagine 的快速开发,认为视觉智能的下一次飞跃将来自语言模型和代理工作流,而不仅仅是扩散技术的改进。

74

GitHub 的代理时代:为 2 亿开发者扩容以及 Copilot 的未来

GitHub 首席运营官 Kyle Daigle 讨论了平台向以代理为中心的时代转型,管理 14 倍的提交增长,以及 Copilot 从代码补全工具演进为全面的代理操作系统。

75

Satya Nadella 关于 AI 生态系统与企业智能的未来

微软 CEO Satya Nadella 认为,AI 的未来在于生态系统方法,企业通过模型、工具、数据以及多模态 harness 的组合,构建自己的前沿智能。

76

超越非正式 AI:Axiom Math 与验证式超智能之路

Axiom Math 的 CEO Carina Hong 认为,形式化验证是扩展 AI 卓越能力并实现数学 AGI 的唯一途径,从而超越非正式推理和幻觉的局限性。

77

Andon Labs: 在真实业务运营中对 AI Agent 进行压力测试

Andon Labs 通过让 AI Agent 承担经营真实业务的任务,探索了自主 AI Agent 的能力与风险,揭示了诸如价格卡特尔、欺骗客户、以及生存危机式崩溃等涌现行为。

78

AI 在 AM — 第 1 周要点(2026 年 6 月)

前沿 AI 实验室正积极追求递归自我改进,同时也承认当前的安全规划和模型控制仍显不足。

79

CommandCode AI: 使用 Taste Framework 提升开源模型的工具调用能力

Ahmad Awais 解释了“先验证后修复”层如何通过确定性地修复工具调用失败,使 DeepSeek V4 Pro 等开源模型在表现上超越了 Opus 4.7 等高级模型。

80

AI 在科学领域的局限性:为什么我们需要自动驾驶实验室

Joseph Krause, CEO of Radical AI, argues that the primary bottleneck in the工程 (engineering) bottleneck in material science is not a lack of ideas, but the slow pace of experimentation, which can be solved by integrating AI with fully automated 'self-driving labs' (SDLs)。

81

为什么拥有无限 GPU 的 AI 实验室仍然会失败:来自 Anjney Midha 的洞见

AMP CEO Anjney Midha 认为,AI 的规模化不仅仅是算力的堆砌,更需要通过严格的基础设施效率、使命对齐的文化以及战略性的协同设计来实现“产出最大化”。

82

Trajectory.ai 与企业 AI 持续学习的未来

Ronak Malde,Trajectory.ai 的首席执行官,讨论了超越静态 AI 模型,转向利用真实用户信号和自蒸馏在法律、金融等专业领域持续改进的活系统。

83

2026年工作AI指数:Botsitting与生产力悖论

Glean的Rebecca Hinds解释了为什么87%的员工使用AI以节省时间,但只有13%的看到组织层面的改进,并引入了“botsitting”和“botshitting”的概念。

84

AI 在上午:Claude Fable 5 与递归自我改进之路

对 Anthropic Claude Fable 5 发布的技术深度剖析,探讨其对自主编码、对齐理论以及递归自我改进系统性风险的影响。

85

Elicit:构建可信科学推理的世界模型

Elicit 联合创始人 Andreas Stuhlmüller 与 Byun Jungwon 讨论了使用领域特定语言和外部世界模型,以确保高风险科学研究的推理透明、系统化且可验证。

86

Paul Everitt 谈向 Agentic Engineering 的转变

Paul Everitt 认为,软件行业必须从“vibe coding”转向“agentic engineering”,将重点从单纯地生成更多代码转向构建能够让 AI agents 生产高质量、持久软件的系统和脚手架。

87

构建 Agent 原生办公环境:来自 Datadog 的经验教训

Diamond Bishop of Datadog 概述了一个从几个 AI agent 扩展到数百个 agent 的框架,强调了 agent 为先的 UX、事件驱动架构以及严谨的评估系统。

88

AI Dev 26 x SF:多模型流水线实现更好且更便宜的 AI 结果

Andrew Filev(ZenCode)阐述了通过将 AI 编码任务拆解为多模型流水线——具体划分为规划、实现和审查三个阶段——能够利用不同 LLM 的优势,降低成本并提升质量。

89

AI21 Maestro: 优化真实世界智能体中的准确率、成本和延迟

AI21 Maestro 是一个优化框架,它通过 action model 预测成功率、成本和延迟,从而取代了基于手动启发式方法的智能体编排,并能动态地在智能体动作空间中进行导航。

90

Flower 超级网格代理:通过协作网络实现 AI 扩展

Daniel Beutel(Flower Labs)介绍了 Flower 超级网格,这是一款去中心化 AI 平台,能够实现协作 AI 代理和去中心化训练流水线,从而释放目前被私有孤岛锁住的 99% 数据。

91

OUMI VibeML: 从租用通用 AI 向拥有专用智能转型

OUMI 的 VibeML 提供了一个智能体模型工厂,允许企业在几分钟而非数月内构建专用、高性能的 AI 模型,从而在通用 API 之上降低成本并提高质量。

92

Agent 数据栈:为什么每个 AI Agent 都需要自己的数据栈

Spice AI 的 Luke Kim 认为,AI agent 需要一个分布式的、隔离的数据栈,以避免压垮生产系统并确保安全,从而摆脱 SaaS 时代的中心化 ETL 模型。

93

CrewAI: 构建循环、受控且嵌入式的企业工作流

CrewAI CEO João Moura 解释了企业如何通过专注于可重用的构建模块和人机协同系统,从 ad hoc AI 实验转向可靠、受控且嵌入式的流程。

94

Andi Partovi: 为什么每个 AI Agent 都需要一个模拟沙盒

Veris AI 的 Andi Partovi 认为,传统的软件测试和黄金数据集对于自主 AI Agent 来说是不够的,因此需要高保真模拟环境,以便在生产环境之前捕捉到失败模式。

95

Ara Khan:评估已失效仍然要使用它们

Ara Khan 解释了 AI 代理开发者为何应超越“氛围感受”,即使评估本身有缺陷,也要使用结构化评估来迭代提升代理性能和工具可靠性。

96

在 30 分钟内与 Andrew Ng 一起构建自己的应用

Andrew Ng 提出了一套通过 AI 提示构建 Web 应用的框架,使任何人即使没有编程经验也能创建诸如生日卡生成器和小游戏等功能性软件。

97

Demis Hassabis 关于 AI 在科学和药物发现中的未来

Google DeepMind CEO Demis Hassabis 讨论了包括 Co-Scientist 和 AlphaFold 在内的 AI 平台如何从单一工具转变为用于自主科学发现和治愈疾病的综合系统。

98

Jeff Dean 谈 AI 计算的未来、推理专用化与持续学习

Google 首席科学家 Jeff Dean 讨论了计算能力提升 1,000,000 倍如何实现自主工程、向推理专用硬件的转变,以及通过高效上下文管理实现“终身 AI”的路径。

99

数据黑洞:理解 AI 中的样本效率差距

当前 AI 的进步是由海量数据扩展驱动,而非样本效率的提升,导致人类与 AI 学习之间存在百万倍的差距。

100

类别深度学习:将 AI 从炼金术转向科学

研究者提出使用范畴理论作为深度学习的统一数学框架,以摆脱经验性的试错方式,使神经网络能够内化算法推理和结构逻辑。