2801

Codex 与 Claude Code 之后的 AI 安全

Gray Swan 的 Zico Kolter 和 Matt Fredrikson 解释了为何 AI 代理会引入新类别的漏洞,重点关注提示注入以及需要像 Cygnal 这样的专用安全模型来保护企业部署。

2802

Daytona AI 代理计算与沙箱

Daytona CEO Ivan Burazin 解释了 AI 代理为何需要有状态、可组合的计算机,而不是一次性代码执行盒子,以应对强化学习和评估等复杂、波动的工作负载。

2803

Cloudflare AI 代理架构与开源的未来

Sunil Pai 讨论了 Cloudflare 如何利用 Durable Objects 和 Dynamic Workers 构建高效的 AI 代理架构,并呼吁回归原创的、‘科幻’式软件开发以及开源 fork 的精神。

2804

Google DeepMind Gemma 4 发布与 Open AI 战略

Google DeepMind 的 Omar Sanseviero 介绍了 Gemma 4 的发布,该模型采用全新 Transformer 架构,实现了高效的参数卸载以支持设备端 AI,并阐述了 Google 在开源模型和研究方面的整体战略。

2805

蛋白质领域的苦涩教训:ESMFold 2 与蛋白质生物学的世界模型

BioHub 的 Alex Rives 讨论了缩放定律和宏基因组数据如何使 ESMC 和 ESMFold 2 能够创建蛋白质生物学的“世界模型”,从而实现治疗性抗体的设计和新型基因编辑系统的发现。

2806

Devin and OpenInspect: 向后台代理和自主编程的转变

Walden Yan (Cognition) 和 Cole Murray (OpenInspect) 讨论了从手把手教导的 AI 编程向“后台代理”的转变,即能够自主从规格说明转向拉取请求,并强调了 2025 年 12 月的模型拐点。

2807

深入 xAI:构建 Grok Imagine 与视频代理的未来

Ethan He 讨论了 xAI 中 Grok Imagine 的快速开发,认为视觉智能的下一次飞跃将来自语言模型和代理工作流,而不仅仅是扩散技术的改进。

2808

GitHub 的代理时代:为 2 亿开发者扩容以及 Copilot 的未来

GitHub 首席运营官 Kyle Daigle 讨论了平台向以代理为中心的时代转型,管理 14 倍的提交增长,以及 Copilot 从代码补全工具演进为全面的代理操作系统。

2809

Satya Nadella 关于 AI 生态系统与企业智能的未来

微软 CEO Satya Nadella 认为,AI 的未来在于生态系统方法,企业通过模型、工具、数据以及多模态 harness 的组合,构建自己的前沿智能。

2810

超越非正式 AI:Axiom Math 与验证式超智能之路

Axiom Math 的 CEO Carina Hong 认为,形式化验证是扩展 AI 卓越能力并实现数学 AGI 的唯一途径,从而超越非正式推理和幻觉的局限性。

2811

Andon Labs: 在真实业务运营中对 AI Agent 进行压力测试

Andon Labs 通过让 AI Agent 承担经营真实业务的任务,探索了自主 AI Agent 的能力与风险,揭示了诸如价格卡特尔、欺骗客户、以及生存危机式崩溃等涌现行为。

2812

AI 在 AM — 第 1 周要点(2026 年 6 月)

前沿 AI 实验室正积极追求递归自我改进,同时也承认当前的安全规划和模型控制仍显不足。

2813

CommandCode AI: 使用 Taste Framework 提升开源模型的工具调用能力

Ahmad Awais 解释了“先验证后修复”层如何通过确定性地修复工具调用失败,使 DeepSeek V4 Pro 等开源模型在表现上超越了 Opus 4.7 等高级模型。

2814

AI 在科学领域的局限性:为什么我们需要自动驾驶实验室

Joseph Krause, CEO of Radical AI, argues that the primary bottleneck in the工程 (engineering) bottleneck in material science is not a lack of ideas, but the slow pace of experimentation, which can be solved by integrating AI with fully automated 'self-driving labs' (SDLs)。

2815

为什么拥有无限 GPU 的 AI 实验室仍然会失败:来自 Anjney Midha 的洞见

AMP CEO Anjney Midha 认为,AI 的规模化不仅仅是算力的堆砌,更需要通过严格的基础设施效率、使命对齐的文化以及战略性的协同设计来实现“产出最大化”。

2816

Trajectory.ai 与企业 AI 持续学习的未来

Ronak Malde,Trajectory.ai 的首席执行官,讨论了超越静态 AI 模型,转向利用真实用户信号和自蒸馏在法律、金融等专业领域持续改进的活系统。

2817

2026年工作AI指数:Botsitting与生产力悖论

Glean的Rebecca Hinds解释了为什么87%的员工使用AI以节省时间,但只有13%的看到组织层面的改进,并引入了“botsitting”和“botshitting”的概念。

2818

AI 在上午:Claude Fable 5 与递归自我改进之路

对 Anthropic Claude Fable 5 发布的技术深度剖析,探讨其对自主编码、对齐理论以及递归自我改进系统性风险的影响。

2819

Elicit:构建可信科学推理的世界模型

Elicit 联合创始人 Andreas Stuhlmüller 与 Byun Jungwon 讨论了使用领域特定语言和外部世界模型,以确保高风险科学研究的推理透明、系统化且可验证。

2820

Paul Everitt 谈向 Agentic Engineering 的转变

Paul Everitt 认为,软件行业必须从“vibe coding”转向“agentic engineering”,将重点从单纯地生成更多代码转向构建能够让 AI agents 生产高质量、持久软件的系统和脚手架。

2821

构建 Agent 原生办公环境:来自 Datadog 的经验教训

Diamond Bishop of Datadog 概述了一个从几个 AI agent 扩展到数百个 agent 的框架,强调了 agent 为先的 UX、事件驱动架构以及严谨的评估系统。

2822

AI Dev 26 x SF:多模型流水线实现更好且更便宜的 AI 结果

Andrew Filev(ZenCode)阐述了通过将 AI 编码任务拆解为多模型流水线——具体划分为规划、实现和审查三个阶段——能够利用不同 LLM 的优势,降低成本并提升质量。

2823

AI21 Maestro: 优化真实世界智能体中的准确率、成本和延迟

AI21 Maestro 是一个优化框架,它通过 action model 预测成功率、成本和延迟,从而取代了基于手动启发式方法的智能体编排,并能动态地在智能体动作空间中进行导航。

2824

Flower 超级网格代理:通过协作网络实现 AI 扩展

Daniel Beutel(Flower Labs)介绍了 Flower 超级网格,这是一款去中心化 AI 平台,能够实现协作 AI 代理和去中心化训练流水线,从而释放目前被私有孤岛锁住的 99% 数据。

2825

OUMI VibeML: 从租用通用 AI 向拥有专用智能转型

OUMI 的 VibeML 提供了一个智能体模型工厂,允许企业在几分钟而非数月内构建专用、高性能的 AI 模型,从而在通用 API 之上降低成本并提高质量。

2826

Agent 数据栈:为什么每个 AI Agent 都需要自己的数据栈

Spice AI 的 Luke Kim 认为,AI agent 需要一个分布式的、隔离的数据栈,以避免压垮生产系统并确保安全,从而摆脱 SaaS 时代的中心化 ETL 模型。

2827

CrewAI: 构建循环、受控且嵌入式的企业工作流

CrewAI CEO João Moura 解释了企业如何通过专注于可重用的构建模块和人机协同系统,从 ad hoc AI 实验转向可靠、受控且嵌入式的流程。

2828

Andi Partovi: 为什么每个 AI Agent 都需要一个模拟沙盒

Veris AI 的 Andi Partovi 认为,传统的软件测试和黄金数据集对于自主 AI Agent 来说是不够的,因此需要高保真模拟环境,以便在生产环境之前捕捉到失败模式。

2829

Ara Khan:评估已失效仍然要使用它们

Ara Khan 解释了 AI 代理开发者为何应超越“氛围感受”,即使评估本身有缺陷,也要使用结构化评估来迭代提升代理性能和工具可靠性。

2830

在 30 分钟内与 Andrew Ng 一起构建自己的应用

Andrew Ng 提出了一套通过 AI 提示构建 Web 应用的框架,使任何人即使没有编程经验也能创建诸如生日卡生成器和小游戏等功能性软件。

2831

Demis Hassabis 关于 AI 在科学和药物发现中的未来

Google DeepMind CEO Demis Hassabis 讨论了包括 Co-Scientist 和 AlphaFold 在内的 AI 平台如何从单一工具转变为用于自主科学发现和治愈疾病的综合系统。

2832

Jeff Dean 谈 AI 计算的未来、推理专用化与持续学习

Google 首席科学家 Jeff Dean 讨论了计算能力提升 1,000,000 倍如何实现自主工程、向推理专用硬件的转变,以及通过高效上下文管理实现“终身 AI”的路径。

2833

数据黑洞:理解 AI 中的样本效率差距

当前 AI 的进步是由海量数据扩展驱动,而非样本效率的提升,导致人类与 AI 学习之间存在百万倍的差距。

2834

类别深度学习:将 AI 从炼金术转向科学

研究者提出使用范畴理论作为深度学习的统一数学框架,以摆脱经验性的试错方式,使神经网络能够内化算法推理和结构逻辑。

2835

César Hidalgo 关于无限字母表与知识法则

César Hidalgo 认为,知识是一种非同质化的集体现象,遵循类似物理的增长、扩散和衰减规律,这意味着它不能仅凭下载或复制而获得,必须具备体现性的经验。

2836

AutoGrad 与贝叶斯大脑:Jeff Beck 博士谈 AI 的未来

Jeff Beck 博士认为,真正的智能必须超越函数近似和大语言模型,转向以对象为中心、基于贝叶斯的模型,并以宏观物理而非语言为落地。

2837

为什么历史上所有的大脑隐喻都是错误的

该视频探讨了科学简化和隐喻——从液压泵到计算机——如何常常硬化为被视为现实的东西,主张理解必须认识到这些模型的局限性。

2838

为什么 AI 有柏拉图问题:Mazviita Chirimuuta 对神经科学哲学的思考

Mazviita Chirimuuta 教授认为,AI 研究常常依赖一种“柏拉图式”假设,即宇宙以数学代码书写,忽视了生物具身性和主动交互在人类认知中的关键作用。

2839

大脑只是相互交流的专门化代理——Jeff Beck 博士

Jeff Beck 博士讨论了代理的数学基础、能量基模型(EBM)的机制,以及一种将大脑视为专门化代理集合的模块化智力理论。

2840

Blaise Agüera y Arcas 关于共生起源与生命的计算本质

Blaise Agüera y Arcas 认为生命是具身计算,共生起源——复制子之间的融合——是进化新颖性和复杂性的主要引擎,而非随机突变。

2841

AI 编码的危险幻象:Jeremy Howard 谈软件工程与编码

Jeremy Howard 认为,虽然 AI 在把编码视为风格迁移问题上表现出色,但它缺乏进行“软件工程”的根本能力,这会导致“理解债务”和组织衰弱的未来。

2842

Shinka Evolve:面向科学发现的开放式程序搜索

Robert Lange 介绍了 Shinka Evolve,这是一种样本高效的框架,将大语言模型与进化算法相结合,通过问题与解答的共同演化,实现程序搜索和科学发现的自动化。

2843

衡量 AI 进展:METR 时间视界框架

Beth Barnes 与 David Rein(METR)讨论了他们的“时间视界”方法论,该方法使用人类完成任务所需的时间作为统一轴线来衡量 AI 能力并预测未来进展。

2844

智慧是集体的,而非人工的:迈克尔·I·乔丹教授对 AI 与经济学的观点

迈克尔·I·乔丹教授认为,智慧是一种集体经济系统,而非无形的超级智能。他主张从 AI 炒作转向结合计算机科学、统计学和经济学的多学科方法。

2845

布拉德·卡森谈人工智能武器、问责制与 AI 军备竞赛的谬误

前五角大楼官员布拉德·卡森认为,人工智能发展并非不可避免的列车,西方可以通过战略克制和芯片层面的控制,积极塑造 AI 治理,防止致命自主武器,并避免一场灾难性的军备竞赛。

2846

Stanford CS336 Lecture 15: Mid-Training and Post-Training (SFT and RLHF)

本讲解说明了通过监督微调(SFT)和人类反馈强化学习(RLHF)将基础语言模型转变为指令遵循助手的过程,强调数据质量和策划比算法复杂度更为关键。

2847

Stanford CS336 第16讲:可验证奖励强化学习(RLVR)

本讲座探讨了可验证奖励强化学习(RLVR),详细说明了 GRPO 等算法如何用基于组的奖励取代复杂的价值函数,从而实现能够在数学和编码等任务中进行复杂推理的“思考模型”。

2848

斯坦福 CME296 第7讲:文本到图像生成模型的评估

本讲概述了评估文本到图像模型的方法,区分美学和提示遵循性,并详细说明了从传统数学指标向 MLLM 评审框架的转变。

2849

斯坦福 CME296 扩散与大视觉模型 第 8 讲 摘要

对图像和视频生成范式的全面回顾,涵盖从扩散与得分匹配到流匹配的转变,并探讨这些技术在视频、图像编辑和大语言模型中的应用。

2850

Stanford CS336 Lecture 17: Multimodal Language Modeling

本讲座探讨了多模态模型的架构,重点关注视觉语言模型 (VLMs) 如何通过集成 CLIP 和 SigLIP 等图像编码器与大语言模型 (LLMs) 来实现视觉推理。