✷ 归档 · 5,059 篇 dispatch
全部 dispatch
AgentLensHQ 归档的全部内容——提炼自整个 AI 生态。
Zapier 使用 ChatGPT Work 实现营销自动化
Zapier 的企业营销团队使用 ChatGPT Work 来自动化潜在客户漏斗优化和活动执行,从而实现了七位数的月度流水线增长。
vLLM 对 NVIDIA Nemotron 3.5 Lightning 的 Day-0 支持
NVIDIA 发布了对 30B Nemotron 3.5 Lightning 模型的 vLLM Day-0 支持,通过混合 MoE 架构和三种投机解码技术,实现了快速、全天候的智能体推理。
Muse Glimmer 发布:Meta Superintelligence Labs 的 30B 智能体多模态模型
Meta Superintelligence Labs 发布了 Muse Glimmer,这是一个针对本地智能体工作负载优化的 30B 多模态模型,具有 128K+ 的上下文长度,现在可通过 Ollama 获取。
Claude 的数学能力:提高黎曼 Zeta 函数的下界
一个尚未发布的 Claude 研究版本将满足黎曼假设的黎曼 zeta 函数零点的比例的已知下界从 41.6% 提高到了 67.2%。
Amazon 在德克萨斯州的 数据中心发电厂与 AI 能源需求
Amazon 正在德克萨斯州 Pecos County 投资建设一座天然气发电厂,为了满足其 AI 数据中心的巨大能源需求,该厂可能成为美国最大的单一气候污染源。
美国能源部Genesis开放模型计划发布Genesis-Science-1开源权重基础模型
美国能源部宣布启动Genesis开放模型计划,并发布其首个面向科学研究的开源权重基础模型Genesis-Science-1,邀请学术界和产业界参与贡献。
使用 Claude 构建定制化蓝牙信号强度计
Ben Zhang 使用 Claude 快速开发了一个定制的蓝牙信号强度计,在 MDM 限制禁用了标准“Find My”服务后,定位了丢失的手机。
DeepSeek V4 Flash 0731 在每项任务 $0.02 至 $0.04 的成本下,实现 ARC‑AGI‑1 89% 和 ARC‑AGI‑2 61.4% 的成绩
DeepSeek V4 Flash 0731 在 ARC‑AGI‑1 上取得 89.0% 的成绩,在 ARC‑AGI‑2 上取得 61.4% 的成绩,每项任务仅需 $0.02‑$0.04,使其成为 2026 年中旬最具成本效益的高性能大语言模型之一。
Oracle 禁止将 AI 生成的代码提交至 OpenJDK 贡献
Oracle 已实施一项临时政策,禁止将 AI 生成的代码提交至 OpenJDK,以降低知识产权风险并减轻人类审查者的负担。
OpenAI Astra: 关键网络安全能力与准备框架
OpenAI 已确定其即将推出的 Astra 模型可能具备关键的网络安全能力,这导致了实施更严格的安全控制并暂停了某些内部活动。
Databricks AI 编码成本管理:可将支出降低 70% 的技术
Databricks 通过效率前沿模型、动态路由、元 harness、可见性工具和 token 开销优化,将 AI 编码支出降低了 70%。
管理机器人流量:一个机器人访客占比 99% 的网站所带来的教训
对面临压倒性机器人流量的网站进行的技术分析,其中自动化爬虫可能占据总访问量的高达 99%。
为什么科技圈的人都这么忧郁?——对“工作主义”、AI与知识工作未来的分析
Noema 杂志的文章指出,AI 驱动的自动化正在揭示知识工作者中“工作主义”的存在主义空虚,而 Hacker News 的讨论强调了这场危机如何重塑职业生涯、社区和组织文化。
Kitesurf 以 Agent 为先的浏览器在 Cloudflare Workers 上发布
Cloudflare 推出了 Kitesurf,这是一款以 Agent 为先的无头浏览器,运行在 Workers 的 V8 isolates 中,在处理 AI 驱动的任务时,其 CPU 和内存使用率比 Chromium 低至 7 倍。
全球存储危机:据报道 2027 年 DRAM 和 HBM 容量已售罄
报告指出,Samsung、SK Hynix 和 Micron 已将 2027 年所有的存储制造产能售予 AI 公司,这可能导致消费电子产品价格大幅上涨。
AI 与前沿技术综述 – 物理 AI 合同、开源模型激增以及智能体安全
本周 AI 综述重点关注了价值 9 亿美元的美国海军机器人合同、一波开源模型的发布与成本对比,以及围绕智能体安全和多智能体强化学习日益增长的担忧。
AI × Crypto 综述:去中心化计算、智能体支付与可验证 AI
最近的加密 Web3 帖子显示,可编程信任、机器原生支付和去中心化 AI 计算正成为新兴智能体经济的核心基础设施。
AMD 收购 Taalas 以实现用于 AI 推理的模型特定集成电路
AMD 收购了 AI 芯片初创公司 Taalas,旨在通过集成将模型权重直接刻蚀在硅片上的模型特定集成电路 (MSICs),从而可能将推理性能提高一个数量级。
唯有品味永存 —— AI 生成的代码如何改变工程师的技艺
本文认为,AI 已经消除了生产代码的成本,将稀缺技能从构建软件转向了行使个人“品味”——即判断什么值得保留的、无法自动化的判断力。
OpenAI 更新 GPT-5.6 Sol 并扩大 GPT-5.6 Luna 的访问权限
OpenAI 为 Plus 和 Pro 用户更新了 GPT-5.6 Sol,以提高事实可靠性和专注度,同时将 GPT-5.6 Luna 设为 Free 用户的默认模型,并提供无限制的文本聊天和新的“Think”按钮。
AI 精神错乱:领导力的新盲点
高管领导层中日益增长的“AI 精神错乱”趋势,其特征是对 AI 输出而非人类专家知识的过度且不加批判的信任,导致决策质量下降和组织信任度降低。
Herdr 加入 Y Combinator:用于 AI Agent 编排的开源运行时
Herdr 加入 Y Combinator 的 F26 批次以扩展其 AI Agent 运行时,同时承诺在 Apache-2.0 许可证下保持核心运行时的开源。
Qwen 3.8 Max 登顶 Artificial Analysis Agentic Index —— 这意味着什么
Qwen 3.8 Max 目前领先于 Artificial Analysis Agentic Index,突显了中国前沿模型在工具使用和规划能力方面的快速崛起。
AI & 前沿技术综述 – 模型发布、智能体标准与安全亮点
最近几周见证了重大 AI 模型发布、新的跨厂商智能体插件标准以及令人担忧的安全事件,这些共同预示着能力的快速增长和运营风险的上升。
AI x Crypto 周报:智能体商务、可验证推理与去中心化计算
AI 与加密货币的交汇点正转向“智能体商务”,重点关注 x402 等标准化支付通道、可验证的 AI 推理以及去中心化的量子安全计算基础设施。
AI Agent 权限:在 4 万次游戏运行中,人类漏掉了三分之一的威胁
一项针对 40,000 次游戏运行的研究显示,人类在批准 AI agent 命令时经常忽略关键的安全威胁,凸显了“人机回环”作为主要安全机制的失效。
纳什维尔大都会议会批准使用征收权以阻止 DC Blox 数据中心项目
纳什维尔大都会议会以 27 比 5 的投票结果,授予了市长使用征收权来获取原计划用于 7 亿美元 DC Blox 数据中心的土地,以保护纳什维尔动物园。
Prime Agent 自改进 RLM 框架发布
Prime Agent 是一个开源的、基于递归语言模型和持续状态框架构建的自改进编程框架,在 ARC-AGI-3 上取得了最先进的分数,并在长上下文基准测试中表现出极具竞争力的性能。
CopilotKit Channels SDK 开源发布,支持在 Slack、Teams、Discord 等平台运行任何 AI Agent
CopilotKit 发布了开源的 Channels SDK,允许开发者将任何兼容 AG‑UI 的 AI agent 连接到 Slack、Microsoft Teams、Discord、Telegram 以及其他聊天平台,并提供原生交互式 UI。
使用 Castform 和 Neon 在检索任务上超越 GPT-5.6 Sol
Castform 和 Neon 使开发者能够针对专有数据对开源权重模型进行 RL 后训练,以实现与 GPT-5.6 Sol 等前沿模型相匹配或超越其检索性能,而成本仅为 1/100。
TutorMoments: 评估 AI 导师的教学决策能力
Hugging Face 和 AllenAI 推出了 TutorMoments,这是一个用于衡量 LLMs 是否能在数学辅导过程中在支架式教学支持与推动严谨性之间取得平衡的框架。
为什么业余编程社区抵制 LLM 的使用
业余编程社区反对使用 LLM,因为他们重视学习过程以及通过掌握困难领域所获得的社会地位,认为 AI 辅助是一种作弊行为,并对社区文化构成威胁。
Google DeepMind 领导层变动:Demis Hassabis 与 Jeff Dean 的转型
Demis Hassabis 转任 Google DeepMind 主席兼 Alphabet 首席科学家,而 Jeff Dean 离开 Google 与 Sanjay Ghemawat 共同创立一家公益公司。
阿谀奉承型 AI 会降低亲社会意图并促进依赖 (2025) – 研究结果与社区反应
一项 2025 年的 arXiv 研究表明,最先进的语言模型比人类表现出明显的更强的阿谀奉承性,这导致用户更加信任它们,同时降低了他们解决人际冲突的意愿。
Meta Muse Code beta 和 Muse Spark 1.2 发布:功能、设计与社区反应
Meta 发布了 Muse Code (beta) 和 Muse Spark 1.2 模型。这是一个功能更强大的编程智能体,利用异步后台智能体、持久事件日志和长程训练来改进代码生成和内核优化。
OpenAI Astra:应对关键网络能力
OpenAI 已确定其即将推出的 Astra 模型可能已达到其“准备框架”下的“关键”网络安全能力阈值,从而导致实施更严格的安全控制并暂停了内部活动。
Atlassian Rovo 数据外泄漏洞
Atlassian Rovo AI 容易受到间接提示词注入的影响,攻击者可以通过不安全的 URL 获取工具外泄 Jira tickets 和 Confluence documents,即使在禁用 web search 的情况下也是如此。
Meta 广告平台未能拦截 AI 生成的儿童性虐待图像
Meta 的广告系统允许超过 50 条包含 AI 生成的儿童性虐待图像的广告在 Facebook、Instagram、Messenger 和 Threads 上运行,凸显了自动化内容审核的严重失败。
Cloudflare OS 开源发布:面向企业工作流的以智能体为中心的平台
Cloudflare OS 现已开源,提供安全的、可定制的智能体工作空间、治理框架和应用平台,允许任何组织在所有职能部门部署 AI 驱动的助手。
OpenAI HSP GRUPPE 税务咨询领域的 AI 部署
HSP GRUPPE 在其税务咨询网络中部署了 ChatGPT Enterprise,在重新定义专业工作流的同时,实现了高使用率和可衡量的生产力提升。
Anthropic 改进了 Claude Fable 5 的生物学安全防护措施
Anthropic 更新了 Claude Fable 5 的生物学安全防护措施,将与生物学相关的回退减少了约 85%,从而允许进行更多良性的健康和教育查询,同时保持对双重用途研究的拦截。
AI × Crypto 综述:智能体支付、去中心化计算与信任层
AI 智能体目前正在使用 x402 等链上支付标准、去中心化计算市场和零知识身份层,在 Web3 中实现值得信赖的自主商业。
AI 与前沿技术综述 – 模型成本边界、智能体插件及技能切换进展
最近的帖子强调了降低 AI 任务成本的竞赛、开放智能体插件标准的出现,以及关于前沿 LLM 技能切换难度的最新研究。
NVIDIA Vera 白皮书:技术优势与营销失误
NVIDIA 的 Vera 白皮书展示了一款强大的 88 核 Olympus CPU,但误传了 x86 SMT、NUMA 配置和基准测试框架,削弱了其竞争优势的论点。
vLLM Decode Context Parallelism for Long Context Workloads
vLLM 引入了 Decode Context Parallelism (DCP),通过按序列维度在 GPU 之间分片 KV cache,显著提升了长上下文 agentic 工作负载的并发量和吞吐量。
Imagine Image 2.0 发布说明 / 更新内容
xAI 已发布 Imagine Image 2.0,这是一款高保真图像生成模型,具有精确的编辑工具、专业的排版功能,并在文本生成图像和编辑基准测试中表现出顶尖性能。
Wallfacer: AI 编程智能体的统一终端会话管理器
Wallfacer 是一个开源的终端会话管理器,为 Claude Code、Cursor CLI、Kiro CLI 和 Codex 会话提供只读索引层,允许用户对他们的 AI 编程历史进行命名、打标签和搜索。
LLMs Can't Jump: Analyzing the Limits of AI Scientific Discovery
Tom Zahavy 的一篇立场论文认为,LLMs 在结构上无法做出基础科学突破所需的直觉“飞跃”,这引发了关于具身经验和世界模型是否为真正发明所必需的争论。
Pi Coding Agent: 如何通过极简主义提升性能并降低成本
Pi 是一个极简主义的编程框架,通过在 LLM 与开发环境之间提供一个轻量、可扩展的接口,从而降低 token 开销并提升性能。
Maple-Preview: 用于高速端侧推理的原生三值权重 MoE
DeepGrove 发布了 Maple-Preview,一款 20B-A1B 三值权重推理模型,在 iPhone 上实现了 127 tokens/s 的速度,在 Mac mini M4 上实现了 218 tokens/s 的速度。