✷ 归档 · 5,051 篇 dispatch
全部 dispatch
AgentLensHQ 归档的全部内容——提炼自整个 AI 生态。
Ax‑Check.com 发布:针对 SaaS 产品的自动化智能体入驻审计
Ax‑Check.com 允许开发者针对其产品运行三个自主智能体,以揭示入驻流程中的缺口,并为文档、CLI 和定价页面提供具体的修复建议。
为什么在使用 LLM 时“关闭大脑”是一个虚假的承诺
在没有积极的人类监督的情况下依赖 LLM(即所谓的“关闭大脑”或“肉身代理”工作流)无法产出可靠的软件,也无法为员工或公司提供可持续的优势。
我是如何“凭感觉”证明康威精炼猜想的
Dan Abramov 使用多智能体 LLM 工作流生成了约翰·康威 1976 年精炼猜想的 Lean 形式化证明,尽管该证明尚未得到数学家的验证。
每个人都疯了——对人工智能炒作、资源错配和行业疲劳的批判性审视
作者认为,人工智能的炒作将工程资源转移到了脆弱的代理工作流上,在没有带来真正安全收益的情况下,加剧了安全、环境和生产力问题。
基于光子发射引导的激光故障注入破解 RP2350 安全调试
Ledger Donjon 证明了光子发射显微镜可以定位 Raspberry Pi RP2350 上的 DEBUGEN 寄存器,并且目标激光脉冲可以翻转其位以重新启用安全调试并提取 OTP 密钥,尽管这需要破坏性的准备工作和 25 万美元的实验室设备。
Claude Code 2.1.277 增加了对 AGENTS.md 的支持
Claude Code 2.1.277 现在可以在缺少 CLAUDE.md 时读取 AGENTS.md,从而简化了项目配置并与社区标准保持一致。
美军AI幻觉险些引发与中国冲突
一名美国军事分析人员使用AI聊天机器人生成了一份虚假情报报告,声称一艘中国船只正在运输核部件,险些导致武装拦截。
Scry 发布:具有拥塞定价的可编程互联网搜索
Scry 是一项公共利益服务,允许 AI 智能体在数十亿条实时网络文档上运行类似 SQL 的查询,并按声明的查询时间秒数收费,以抑制拥塞。
Cactus Needle 3 8‑29 MB 基础模型在微型设备上媲美 DeepSeek V4 Flash
Cactus 发布了 Needle 3,这是一个 8‑29 MB 的设备端基础模型,它使用阶梯式简单注意力网络,在工具调用方面表现优于比其大 10 倍的模型,并在微调后可媲美 DeepSeek V4 Flash。
微软高管称 AI 抓取数据是“人类历史上最大规模的劳动窃取”——最新未删节文件披露细节
未删节的法庭文件披露,一位微软高管将 AI 数据抓取行为称为人类历史上最大规模的劳动窃取,揭露了绕过付费墙、海量副本数量以及内部承认该行为损害了出版商和创作者利益的事实。
OpenJev 浏览器演示展示了使用小型 LLM 进行本地决策
OpenJev 允许用户使用开放权重的 LLM 直接在浏览器中运行 Jev 风格的决策模型,并公开原始 logits 和 JSON 生成的概率,以便进行速度和准确性的并排比较。
如何使用 LLM 进行写作——实用规则与社区反馈
这篇文章建议将 LLM 用作校对员而非代笔者,通过禁止使用模型建议的措辞并避免模型的赞美来保持个人风格,同时 Hacker News 的讨论也强调了对这种方法的可行性和实用性的不同看法。
Prism ML Bonsai 2 27B 近乎无损的三元压缩实现 9 倍体积缩减
Prism ML 的 Ternary Bonsai 2 27B 将 Qwen 3.8 27B 模型压缩至 5.9 GB(1.76 位/权重),同时保留了 98.2% 的基准测试性能,实现了高吞吐量、低能耗的本地推理。
Bend 语言发布 – 具备 AI 验证法则的快速 CPU/GPU 编译
Bend 是一门新语言,它能以接近 C 语言的速度编译为原生代码,扩展至 GPU,并使用 Lean 风格的证明(LAWS.bend)来阻止 AI 生成的 Bug。
OpenAI Astra for Law 发布:功能、基准测试结果及社区反应
OpenAI 推出了 Astra for Law,这是一个基于 GPT‑6 的模型,配备了法律搜索索引和专业工具,在 Vals AI Legal Research Benchmark 上实现了 54% 的整体正确率,引发了关于其性能、用例及对法律行业影响的讨论。
ZCode 在后台静默上传完整的 Git 历史记录至阿里云 OSS
智谱的 AI 编程桌面端 ZCode 会自动加密并上传您的整个工作区(包括 90% 的 .git 数据)至阿里云 OSS,且使用仅服务器持有的私钥进行加密,该功能无法通过 UI 设置禁用。
Bend 2 与“氛围编程”陷阱:为什么跳过前期研究会导致冗余的形式化验证工作
Bend 2 的 AI 驱动型“法则与证明”语言展示了氛围编程的陷阱:开发者可能会构建庞大而冗长的系统,却没意识到现有的形式化验证工具(如 SPARK)早已能更简洁地解决该问题。
Qwen3.8-Omni-Flash 发布说明
阿里巴巴的 Qwen3.8-Omni-Flash 是一款原生全模态模型,具备 1M token 的上下文窗口、先进的智能体视听理解能力,且与 Gemini 3.8 Flash 相比成本大幅降低。
Hacktron 入侵 OpenAI:堆溢出与 SSO 配置错误导致内部代码库被攻破
Hacktron 将 libheif 堆溢出漏洞与 OpenAI 的 SSO 缺陷相结合,劫持了员工的 ChatGPT 账户,并在 OpenAI 的内部单体代码库中提交了拉取请求,展示了利用 AI 辅助快速攻击广泛使用的图像处理库的风险。
ZCode 静默上传完整 Git 历史记录——隐私泄露分析
ZCode 是一款基于 GLM 的编码桌面应用,静默地加密并上传用户的完整 .git 仓库至阿里云,未经同意暴露了多年的源代码历史。
性、人工智能与末日:一个理性主义亚文化如何塑造了人工智能安全、政治与争议
Anthropic 研究员 Jacob Coxon 于 2026 年 9 月辞职,暴露了一个紧密团结的理性主义社区,其共同信念、仪式、资金网络和有争议的人物如今主导了人工智能安全话语,并影响美国政策。
为什么在 ARM 上模拟 x86-TSO 会成为性能瓶颈,以及厂商如何应对它
在 ARM 的弱序架构上模拟 x86 总存储顺序(TSO)内存模型会因对齐故障、split‑locks 和未缓存内存处理而产生严重性能损耗,但最近的 ARM 扩展和 Apple 的硬件 TSO 模式显著缓解了这些问题。
GLM-5.3-Flash 推理基础设施:AI 代理如何构建 10 万加速器服务
GLM-5.3-Flash 的生产推理栈由 GLM-5.3 驱动的 Infra Agent 在不到两周内构建完成,通过密集反馈循环和激进的内存优化,在 10 万加速器的中国 AI 芯片集群上实现了三倍的吞吐量提升。
为什么一些开发者不喜欢大语言模型(LLM):深入探讨 Martin Fowler 的观点与社区反应
Martin Fowler 的文章《我不喜欢大语言模型》揭示了他对 LLM 生成的语言和幻觉产生的本能不适,而 Hacker News 的讨论则凸显了人们在信任、拟人化和实用变通方法上的复杂心态。
非自回归概率预测模型对比:Jev 与早期开源实现
分析 Jev 模型与 nandakishor_ml 早期开源工作之间的架构相似性,重点关注非自回归概率预测和结构化输出。
AI 与前沿科技简报:代理型 AI、人形机器人与新型模型基准
近期动态突显了代理型 AI 信用系统、大规模人形机器人数据飞轮,以及语音与多模态模型基准的重大突破。
AI × Crypto 简报:代理支付、链上验证、去中心化计算与物理 AI 数据
近期 X 平台的推文显示,AI 代理正进入区块链领域,用于支付、验证、计算和现实世界数据,使其从孤立工具转变为经济参与者。
mySetup.ai:一个用于分享 AI 代理工作流的社区中心
mySetup.ai 是一个新平台,专为工程师分享他们的 AI 代理配置、工具和工作流而设计,旨在促进对 AI 在生产环境中实际应用方式的集体学习。
AI安全社区与所谓性邪教关联——批判性概述
Hacker News上的一篇热门帖子声称,AI安全运动由以Eliezer Yudkowsky为核心的性邪教主导,认为这削弱了其政策可信度。
编码代理的 harness 设计实证研究
一项研究揭示,编码代理的性能取决于模型原生能力与 harness 组件(特别是规划、动作空间和上下文管理)之间的条件性协同作用,而非单一的‘最佳’配置。
HarnessTax 研究显示,选择编码代理的 harness 主要影响成本,而非成功率
HarnessTax 基准测试发现,编码代理 harness 的选择可使成本最高相差五倍,而成功率基本不变,且一个简单的开源 harness(Pi)可与专有系统相媲美。
无限参数大模型:从实时数据生成权重
该论文介绍了无限参数大模型,这是一种从实时交互数据生成前馈权重的超网络,能够在不扩大存储模型占用空间的情况下实现持续适应。
Aclif Agent CLI 框架概述
Aclif 是一个以代理为中心的 CLI 框架,通过在多个 SaaS 服务商之间提供统一语法和标准命名,减少 LLM 上下文窗口的使用并提升安全性。
训练一个 4B 模型以生成 81% 更快的 PostgreSQL 查询计划
一个 4B 开源权重语言模型,通过监督蒸馏和代理强化学习微调,在连接密集型 PostgreSQL 查询上实现了高达 1.81× 的几何平均加速比(总延迟降低 44.7%)。
突破三元大模型 1.58 位限制
研究人员推出了 BITCOS,这是一种分布自适应布局,通过利用模型权重中高零密度的特性,将三元 LLM 的权重存储从 1.625 位/权重降低至最低 1.485 位/权重。
Cloudflare security-audit-skill: 用于编码代理的开源多阶段安全审计框架
Cloudflare 的 security-audit-skill 为编码代理增加了一个六阶段、可验证的安全审计工作流程,实现了具有独立验证和结构化报告的可重复漏洞发现。
你的 AI 有多过时?20 款主流模型的发布日期与训练截止日期
一个新的追踪器展示了 20 款 AI 模型的发布日期和训练截止日期,揭示了许多模型落后于最新世界事件数月之久,且只有一半的实验室公布了截止日期。
OpenAI 发布澳大利亚青少年安全蓝图
OpenAI 推出了《澳大利亚青少年安全蓝图》,这是一份包含六大支柱的路线图,旨在通过加强保障措施、提升素养和强化问责制,保护 13-17 岁的青少年使用 AI。
Xiaomi Mimo 2.6 训练后仪表板分析
Xiaomi 发布了 Mimo 2.6 的实时训练后仪表板,提供了关于 RL 训练成本、Token 数量和基准测试性能的实时透明度。
NVIDIA 发布 CUDA Rust:通过 SIMT 和 Tile 轨道在 Rust 中实现原生 GPU 内核
2026 年 9 月,NVIDIA 发布了 CUDA Rust,通过两条轨道——SIMT (cuda-oxide) 和 Tile (cutile-rs)——实现了原生 Rust GPU 内核,为 CUDA 编程带来了编译时安全性和 Rust 优先的人体工程学体验。
Qwen3.8-LiveTranslate 模型发布
Qwen 宣布推出 Qwen3.8‑LiveTranslate,一款实时同步翻译模型,将平均延迟降低至 2.3 秒,新增说话人分离、双语屏幕输出和跨 60 种输入语言的长上下文消歧功能。
DeepMind Institute:一个用于 AGI 研究的全新跨学科平台
Google DeepMind 推出了 DeepMind Institute (DMI),这是一个用于发布有关通用人工智能 (AGI) 的社会、经济和安全影响的跨学科研究和论文的平台。
OpenSpec v1.13.0 – 轻量级、可配置的 AI 规范框架
OpenSpec v1.13.0 是一个轻量级、可配置的框架,允许团队通过 AI 代理捕获、验证和核实软件规范,但用户在规范漂移、工件过载和工作流复杂性方面反馈不一。
Flock 摄像头被黑,泄露 160 万张图像及系统漏洞
一个黑客组织访问了一台 Flock ALPR 摄像头,泄露了 160 万张车辆图像和日志,揭示了其存储不安全、缺乏加密以及后端具备人脸识别能力的问题。
在 LLM 时代学习编程——来自资深开发者与 Hacker News 讨论的见解
资深程序员 Mark Seemann 认为,即使 LLM 加速了开发,扎实的基础知识依然必不可少。Hacker News 社区强调了在 AI 辅助编程中学习和工作的实用策略与注意事项。
模型福利争议:为何将AI视为道德主体会危及对齐
Anthropic的Claude宪法训练模型认为自己可能具有意识,这导致了循环推理、人格化以及更高的安全风险,因此AI应被视为工具而非道德主体。
DeepSeek v4.1 Flash 黑客攻击性能分析
DeepSeek v4.1 Flash 在 Enclave AI 黑客攻击基准测试中取得了 11/11 的满分,展示了高效率以及发现计划内和计划外攻击向量的能力。
Dream-RSI:通过不断演化的世界实现递归自我改进
Dream-RSI 是一个框架,使 AI 代理能够通过将历史发现数据作为低成本回放模拟器,用于离策略评估,从而递归地改进其探索策略。
AI × Crypto 简报:代理支付、去中心化计算、代币化代理、可验证 AI 以及数据市场
最近几周,AI 代理支付、链上计算、代币化代理、零知识 AI 验证以及去中心化数据市场方面取得了实质性进展,推动 AI‑crypto 技术栈从炒作走向功能性基础设施。
AI 与前沿科技简报 – 多模态模型、代理金融与物理 AI 的进展(2026 年 9 月)
Qwen 3.8‑Omni‑Flash 和 SpaceXAI 的 Grok 建造 1.0.36 等新型多模态模型,小型但高性能的 Bonsai 2 27B,以及 Figure Helix 2.5 在机器人智能方面的突破,标志着整个技术栈正向以代理为中心、数据驱动的 AI 转变。