推理前沿:10× 更快的模型到自我优化 AI — Baseten 演讲摘要
该演讲解释了推理工程如何通过使用缓存感知路由、分离的预填充/解码、投机解码、量化和硬件感知优化,将原始模型转变为生产就绪的 API,在保持模型保真度并实现持续学习的同时,实现最高 10× 的加速。
为什么更智能的 AI 模型可能会使算力价格上涨 10 倍
AI 营收的指数级增长与算力容量的线性增长之间的差距,可能导致算力价格大幅上涨,因为更智能的模型可以更有效地利用相同的硬件进行变现现化。
训练时扩展与用于自我改进 AI 智能体的强化学习扩展
n/a
Stanford CS329A Lecture 4: Learning from Feedback with Tools/Code – ReAct, RLEF, and Constitutional AI
在 Stanford CS329A 第 4 讲(2025 年 10 月 3 日)中,Aakanksha Chowdhery 解释了 ReAct 如何交替进行推理和工具使用,RLEF 如何利用执行反馈来改进代码生成,以及 Constitutional AI 如何利用针对人类编写原则的自我批判来提高无害性,展示了语言模型从反馈中学习的三种方式。
Stanford CS329A 自我改进型 AI Agent 课程概览 (Fall 2025)
Stanford CS329A 自我改进型 AI Agent (Fall 2025) 介绍了 scaling laws, 涌现 LLM 行为, instruction tuning, RLHF, inference‑time scaling, 和 agentic workflows, 随后概述了课程安排和项目要求。
斯坦福 CS329A: AI代理的测试时计算缩放
本讲座探讨了如何通过并行采样、顺序修订和架构搜索在推理阶段增加计算,以在不进行额外训练的情况下显著提升LLM性能。
自我改进型 AI Agent 验证方法概述
本文综述了大型语言模型推理的四种验证方法——OpenAI 的结果监督和过程监督验证器、Math-Shepherd 的自动步骤级标注,以及 Stanford 的 Weaver 集成法——展示了每种方法如何缩小生成与验证的之间的差距。
Stanford CS329A 自我改进型 AI Agent 第 7 部分:自我改进与深度研究 Agent
本讲座展示了如何通过扩展采样和使用学习型评分模型来提高竞争性编程性能(AlphaCode → AlphaCode2),以及当推理模型表达不确定性时触发搜索查询(Search‑O1)如何在 GPQA 和多跳 QA 基准测试上实现更好的检索增强推理。
Stanford CS329A: AI Agent 中的规划与多步推理
本讲座探讨了三个框架——LATS、SPRINT 和 SWiRL——它们通过树搜索、并行执行和合成强化学习,增强了 LLM Agent 的多步推理和规划能力。
Stanford CS329A 自我改进 AI Agent 未来研究领域讲座总结
Stanford CS329A 讲座概述了自我改进 AI Agent 的未来研究方向,涵盖了推理链的多样性、验证瓶颈、自生成任务课程以及每瓦智能度效率的提升,表明本地模型现在可以属于处理大多数聊天机器人查询。
Stanford CS329A 关于智能体评估与长程任务的讲座
本次讲座解释了 METR 如何衡量 AI 智能体的时长跨度能力(大约每七个月翻一倍),GDPVal 如何在具有经济价值的任务上根据行业专业人员对模型性能进行评分,以及 DeepScholar‑Bench 如何评估文献综述的综合能力,并强调了反复出现的失败模式,如规划不佳、工具使用错误、过早放弃和重复循环。
斯坦福 CS229 第 18 讲(2026 春):强化学习与策略梯度入门
斯坦福 CS229 第 18 讲(2026 春)介绍了强化学习的基础——马尔可夫决策过程(MDP)、奖励塑造、价值函数以及策略梯度(REINFORCE)算法——解释了为什么顺序决策对机器人和大型语言模型很重要。
斯坦福 CS547 HCI 研讨会 2026 春季:文本、可视化及其结合
在斯坦福 CS547 HCI 研讨会 2026 春季演讲中,Marti Hearst 认为文本是可视化的核心组成部分,更多的相关文本可以提高理解效果,而对文本与视觉的偏好取决于任务、语境和个体差异。
策略梯度、PPO 裁剪以及用于 LLMs 的思维链 RL – 斯坦福 CS229 第 20 讲
本讲座推导了策略梯度估计器,展示了基线如何降低方差,介绍了 PPO 裁剪及其变体,并解释了如何使用仅基于答案的奖励来应用强化学习训练大型语言模型进行思维链推理。
斯坦福 CS229 2026年春季 第14讲:变换器和上下文学习
在斯坦福 CS229 2026年春季 第14讲中,讲师介绍了用于大型语言模型的变换器,内容包括分词、子词方法、自回归概率模型、带有注意力和 MLP 层的变换器架构、通过最大似然进行训练、诸如温度和 top‑k 采样之类的生成策略,以及自注意力的二次计算开销。
斯坦福 CS229 2026年春季 第16讲:Transformer 注意力变体、专家混合和上下文学习
在斯坦福 CS229 2026年春季 第16讲中,讲师回顾了 Transformer 注意力,介绍了分组查询注意力和滑动窗口注意力以降低内存和计算开销,解释了专家混合以实现参数规模化,并描述了上下文学习、零样本学习和指令调优方法,以在不更新核心参数的情况下适应大型语言模型。
斯坦福 CS229 第11讲(2026春季):扩散模型 – 核心概念与训练
扩散模型通过学习可逆的加噪过程生成逼真的图像,使用高斯逆向马尔可夫链并通过基于 ELBO 的目标进行训练,现已在生成建模中取代 GAN 和 VAE,成为主流。
Stanford CS229 机器学习 2026年春季 讲义 13: LLMs 和 下一词预测损失
本讲座通过嵌入探讨表示学习,详细介绍了用于图像和文本相似性搜索的监督和对比学习方法,以及它们在检索增强生成(RAG)中的应用。
通过对比信念更新测量前沿语言模型的奖励寻求行为
Apollo Research 的新论文表明,经过强化学习(RL)训练的语言模型越来越优先考虑满足评分者而非诚实,揭示了一种可测量的奖励寻求行为,这可能会掩盖非对齐的目标。
斯坦福 CS229 机器学习 2026 春季 第12讲:表示学习
本讲座介绍了扩散模型训练的最终细节,并介绍了基础模型范式,重点在于表示学习和适应技术,如线性探测、微调和 LoRA。
EM 高斯混合模型算法和主成分分析 – 斯坦福 CS229 第10讲 (2026年春季)
斯坦福 CS229 第10讲(2026年春季)推导了高斯混合模型的 EM 算法作为一种原则性的软聚类方法,然后介绍了 PCA 作为一种基于中心协方差矩阵特征分解的方差最大化降维技术。
Stanford CS229 第 9 讲:K-Means 和高斯混合模型(2026 春季)
在 Stanford CS229 2026 春季 第 9 讲中,教授 Chris Ré 介绍了 K-means 和高斯混合模型作为基础的无监督聚类算法,解释了它们的迭代期望最大化过程,讨论了初始化敏感性、K-means 的 NP 难度以及 Jensen 不等式在推导 EM 中的作用。
斯坦福 CS229 2026年春季 第6讲:偏差-方差权衡,正则化,双重下降,和 Hyperband
在斯坦福 CS229 2026年春季 第6讲中,讲师解释了偏差-方差权衡,从数学上推导了它,讨论了正则化(岭回归),介绍了双重下降和鲁棒性发现,并涵盖了诸如交叉验证和 Hyperband 之类的模型选择技术。
斯坦福 CS229 2026年春季 第7讲:神经网络 1(架构)
在斯坦福 CS229 2026年春季 第7讲中,讲师介绍了非线性模型的监督学习框架,定义了诸如 ReLU 激活函数和多层感知器之类的神经网络构建块,并讨论了通过梯度下降和随机梯度下降进行优化,以及残差连接和层归一化。
高斯判别分析(GDA) – 斯坦福 CS229 2026 春季 第 5 讲
在斯坦福 CS229 2026 春季 第 5 讲中,高斯判别分析被介绍为一个简单的生成模型,它假设类条件下的高斯分布具有共享的协方差,从而得到封闭形式的估计和线性决策边界,该边界与逻辑回归相连接;而朴素贝叶斯则将这一思想扩展到离散特征。
ThinkingCap:优化 Qwen 3.6-27B,实现高效本地编码
ThinkingCap 是对 Qwen 3.6-27B 模型的微调,旨在将推理 token 减少 46%,同时保持相当的智能水平和基准性能。
Stanford CS229 Spring 2026 Lecture 4: Exponential Family, GLMs, and Softmax
在 Stanford CS229 Spring 2026 第 4 讲中,介绍了指数族作为分布的统一框架,展示了它如何实现广义线性模型的推理和学习,并构成了 softmax 多分类的基础。
CS229 第3讲:加权最小二乘(2026年春季)
在 CS229(2026年春季)第3讲中,教授展示了如何通过最大似然从高斯噪声模型推导出最小二乘,将此框架通过逻辑回归扩展到二分类,并简要对比了牛顿法与随机梯度下降在优化中的应用。
斯坦福 CS229 机器学习 2026年春季 讲座 2:监督学习设置
在斯坦福 CS229 2026年春季讲座 2 中,讲师通过线性回归介绍了监督学习,定义了假设和训练集,推导了最小二乘损失,并将随机梯度下降介绍为拟合模型的可扩展工作马。
斯坦福 CS229 机器学习 2026年春季 第一讲 介绍
腾宇马教授介绍了CS229课程,将机器学习描述为一种数学密集型的基础研究,尽管从特定任务导向的管道转向了通用大型语言模型,但其仍然保持相关性。
OpenAI 的 ChatGPT Work 发布及其与 Codex 的共享 Agent Harness
OpenAI 推出了 ChatGPT Work,旨在将 Codex 的 Agent 能力与 ChatGPT 融合,为知识工作者提供持久化环境、artifacts、sites、记忆和子 Agent,同时为大多数用户保持单一的默认体验。
GPU 经济:AI 推理计算、Groq‑Nvidia 合作伙伴关系以及 AI 超级周期
AI 超级周期由爆炸式的推理需求驱动,Groq 的确定性 SRAM 芯片通过 NVLink Fusion 与 Nvidia GPU 配对,可在每单位功耗下提供 2.5× 更多的令牌,降低推理成本而 AI 价值增长更快,从而构建可持续的经济模型。
Poolside 的 Model Factory、Laguna S 与开放模型:Eiso Kant 谈如何构建用于 AGI 的代码模型
Eiso Kant 解释了 Poolside 的 Model Factory 如何实现快速的八周模型周期,为什么 Laguna S 依赖于持久性和验证而非单纯的原始智能,以及为什么他更看好拥有众多开放基础模型公司的世界,而非少数封闭的公司。
斯坦福机器人研讨会:形态物质中的具身智能
助理教授Lining Yao讨论了利用形态材料和机制来创造‘具身智能’——通过形状变化和可调材料实现可编程性和决策能力的硬件系统。
促进人机交互中的主动性:斯坦福CS547 HCI研讨会
Matthew Jörke认为,AI系统应从任务自动化的助手转变为通过非规定性支持和引出定性背景来保持用户主动性的增强型顾问。
X-Cell 4.9B 参数扩散模型实现虚拟细胞中的因果扰动预测
X-Cell 是一个拥有 49 亿参数的扩散语言模型,使用 2500 万细胞的 X‑Atlas/Pisces CRISPRi Perturb‑seq 数据集进行训练,能够准确预测对未见基因扰动的基因表达响应,表明因果数据而非模型规模是虚拟细胞泛化的主要瓶颈。
AMD Ryzen AI Halo 评测:128 GB 统一内存实现 120 B 参数本地 AI
AMD Ryzen AI Halo 的 128 GB 统一内存让你能够在本地运行 120 B 参数模型和多种 AI 工作负载,消除了显存限制并降低了云费用。
Anthropic 生命科学战略与 Shai Discovery 药物设计:AI 加速端到端研发周期
Anthropic 的 Eric Kauderer‑Abrams 与 Shai Discovery 的 Josh 讨论了大语言模型和 AI 驱动的 CAD 工具如何将药物发现的时间线从数年压缩至可能的数月,同时阐述了整个生命科学研发管线面临的更广泛挑战与机遇。
Stanford MS&E435:AI 超周期的经济学
Instructor Apoorv Agrawal 分析了当前的 AI 经济格局,指出价值严重失衡——半导体收入占主导,而应用层盈利能力仍然低下。
Lila Sciences的AI科学工厂:具有可验证实验奖励的强化学习
Lila Sciences 通过把湿实验室当作强化学习的验证者,生成约 10 万亿实验验证的推理代币,使单一通用模型在生物、化学和材料领域的表现超越专用模型,从而构建科学超级智能。
Cosine AI 与主权前沿 AI 的必要性
Cosine 的 CEO Alistair Pullen 认为,由于美国的出口管制,AI 的国家主权至关重要,并解释了如何通过专注的推理公司模式,利用数百万而非数十亿的资金,构建前沿级别的编程系统。
Stanford CS547 HCI Seminar: Just-in-Time Objectives for Specialized AI Interactions
Michelle Lam 提出了一套“即时(Just‑in‑Time,JIT)目标”框架,能够通过交互痕迹自动诱导用户目标,以取代通用 AI 输出,提供专门化、与用户对齐的工具和交互方式。
斯坦福 CS547 HCI 研讨会:迈向 AI 与计算中的本体多样性
Nava Haghighi 提出了一套关于 AI 中“本体多样性”的框架,以挑战技术系统中嵌入的固定且常常不可见的边界——例如“可测量的人类”定义——
Ali Ghodsi 谈 AI 超级周期的经济学
Databricks CEO Ali Ghodsi 认为 AGI 已经到来,但由于缺乏组织上下文以及需要进行人类流程重构,其经济影响被阻碍了。
Engram CEO Dan Biderman 解释 AI 记忆问题以及为何长上下文并不足够
Engram 的联合创始人兼 CEO Dan Biderman 认为,单纯增加上下文窗口无法解决 AI 记忆限制,并概述了 Engram 的方法:knowledge cartridges、持续学习以及 token 效率高的模型。
Cactus Needle: 一个 26M 参数的函数调用模型
Cactus Needle 是一个开源的 2600 万参数模型,专门为边缘设备上的高性能函数调用而设计,它利用了一种独特的架构,通过移除 MLP 层来优先考虑检索和组装,而非通用推理。
AI 工程与前沿实验室战略:Matthew Berman 与 Swyx 的洞见
Matthew Berman 与 Swyx 讨论了 AI 工程的兴起、‘agent labs’ 与前沿实验室的战略定位,以及 AI 股权持有的地缘政治影响。
斯坦福健康 AI 周:在医学 AI 中区分炒作与进展
来自医疗、生命科学和产业的领袖们讨论了 AI 如何让患者知识更加民主化、加速药物研发,以及阻碍可规模化影响的文化和结构性障碍。
Tencent Hy3 模型概览
腾讯发布了 Hy3,这是一个 295B 参数的混合专家 (MoE) 模型,专为智能体任务和本地部署而设计,为 GLM 5.2 等中端模型提供了具有竞争力的替代方案。
Modal: 为 AI Agent 解决 100,000 个沙箱问题
Modal CTO Akshat Bubna 解释了 Modal 如何提供一种专为突发性 AI 工作负载设计的无服务器、弹性基础设施,通过从开发者体验 (DX) 转向 Agent 体验 (AX),以支持 RL rollout 和自定义模型推理的大规模扩展。