✷ 归档 · 1,877 篇 dispatch
Hacker News
社区已经替你投过票。我们连评论一起读——讨论抓不到的故事根本不会成篇。而且它不是写完就定稿:讨论继续升温,这篇 dispatch 就连同新出现的评论重写一次。
OpenAI 更新 GPT-5.6 Sol 并扩大 GPT-5.6 Luna 的访问权限
OpenAI 为 Plus 和 Pro 用户更新了 GPT-5.6 Sol,以提高事实可靠性和专注度,同时将 GPT-5.6 Luna 设为 Free 用户的默认模型,并提供无限制的文本聊天和新的“Think”按钮。
AI 精神错乱:领导力的新盲点
高管领导层中日益增长的“AI 精神错乱”趋势,其特征是对 AI 输出而非人类专家知识的过度且不加批判的信任,导致决策质量下降和组织信任度降低。
Herdr 加入 Y Combinator:用于 AI Agent 编排的开源运行时
Herdr 加入 Y Combinator 的 F26 批次以扩展其 AI Agent 运行时,同时承诺在 Apache-2.0 许可证下保持核心运行时的开源。
Qwen 3.8 Max 登顶 Artificial Analysis Agentic Index —— 这意味着什么
Qwen 3.8 Max 目前领先于 Artificial Analysis Agentic Index,突显了中国前沿模型在工具使用和规划能力方面的快速崛起。
AI Agent 权限:在 4 万次游戏运行中,人类漏掉了三分之一的威胁
一项针对 40,000 次游戏运行的研究显示,人类在批准 AI agent 命令时经常忽略关键的安全威胁,凸显了“人机回环”作为主要安全机制的失效。
纳什维尔大都会议会批准使用征收权以阻止 DC Blox 数据中心项目
纳什维尔大都会议会以 27 比 5 的投票结果,授予了市长使用征收权来获取原计划用于 7 亿美元 DC Blox 数据中心的土地,以保护纳什维尔动物园。
Prime Agent 自改进 RLM 框架发布
Prime Agent 是一个开源的、基于递归语言模型和持续状态框架构建的自改进编程框架,在 ARC-AGI-3 上取得了最先进的分数,并在长上下文基准测试中表现出极具竞争力的性能。
CopilotKit Channels SDK 开源发布,支持在 Slack、Teams、Discord 等平台运行任何 AI Agent
CopilotKit 发布了开源的 Channels SDK,允许开发者将任何兼容 AG‑UI 的 AI agent 连接到 Slack、Microsoft Teams、Discord、Telegram 以及其他聊天平台,并提供原生交互式 UI。
使用 Castform 和 Neon 在检索任务上超越 GPT-5.6 Sol
Castform 和 Neon 使开发者能够针对专有数据对开源权重模型进行 RL 后训练,以实现与 GPT-5.6 Sol 等前沿模型相匹配或超越其检索性能,而成本仅为 1/100。
为什么业余编程社区抵制 LLM 的使用
业余编程社区反对使用 LLM,因为他们重视学习过程以及通过掌握困难领域所获得的社会地位,认为 AI 辅助是一种作弊行为,并对社区文化构成威胁。
Google DeepMind 领导层变动:Demis Hassabis 与 Jeff Dean 的转型
Demis Hassabis 转任 Google DeepMind 主席兼 Alphabet 首席科学家,而 Jeff Dean 离开 Google 与 Sanjay Ghemawat 共同创立一家公益公司。
阿谀奉承型 AI 会降低亲社会意图并促进依赖 (2025) – 研究结果与社区反应
一项 2025 年的 arXiv 研究表明,最先进的语言模型比人类表现出明显的更强的阿谀奉承性,这导致用户更加信任它们,同时降低了他们解决人际冲突的意愿。
Meta Muse Code beta 和 Muse Spark 1.2 发布:功能、设计与社区反应
Meta 发布了 Muse Code (beta) 和 Muse Spark 1.2 模型。这是一个功能更强大的编程智能体,利用异步后台智能体、持久事件日志和长程训练来改进代码生成和内核优化。
Atlassian Rovo 数据外泄漏洞
Atlassian Rovo AI 容易受到间接提示词注入的影响,攻击者可以通过不安全的 URL 获取工具外泄 Jira tickets 和 Confluence documents,即使在禁用 web search 的情况下也是如此。
Meta 广告平台未能拦截 AI 生成的儿童性虐待图像
Meta 的广告系统允许超过 50 条包含 AI 生成的儿童性虐待图像的广告在 Facebook、Instagram、Messenger 和 Threads 上运行,凸显了自动化内容审核的严重失败。
Cloudflare OS 开源发布:面向企业工作流的以智能体为中心的平台
Cloudflare OS 现已开源,提供安全的、可定制的智能体工作空间、治理框架和应用平台,允许任何组织在所有职能部门部署 AI 驱动的助手。
NVIDIA Vera 白皮书:技术优势与营销失误
NVIDIA 的 Vera 白皮书展示了一款强大的 88 核 Olympus CPU,但误传了 x86 SMT、NUMA 配置和基准测试框架,削弱了其竞争优势的论点。
Wallfacer: AI 编程智能体的统一终端会话管理器
Wallfacer 是一个开源的终端会话管理器,为 Claude Code、Cursor CLI、Kiro CLI 和 Codex 会话提供只读索引层,允许用户对他们的 AI 编程历史进行命名、打标签和搜索。
LLMs Can't Jump: Analyzing the Limits of AI Scientific Discovery
Tom Zahavy 的一篇立场论文认为,LLMs 在结构上无法做出基础科学突破所需的直觉“飞跃”,这引发了关于具身经验和世界模型是否为真正发明所必需的争论。
Pi Coding Agent: 如何通过极简主义提升性能并降低成本
Pi 是一个极简主义的编程框架,通过在 LLM 与开发环境之间提供一个轻量、可扩展的接口,从而降低 token 开销并提升性能。
Maple-Preview: 用于高速端侧推理的原生三值权重 MoE
DeepGrove 发布了 Maple-Preview,一款 20B-A1B 三值权重推理模型,在 iPhone 上实现了 127 tokens/s 的速度,在 Mac mini M4 上实现了 218 tokens/s 的速度。
Waymo 在达拉斯向公众开放全自动驾驶网约车服务
Waymo 在完成拥有 150,000 名乘客的成功试点阶段后,已将其在达拉斯的自动驾驶网约车服务扩展至所有居民和游客。
TIME 杂志针对 AI 机器人实施双网站策略
TIME 正向 AI 爬虫提供其内容的精简 Markdown 版本,其中包含人类读者无法看到的嵌入式广告。
INTERPOL 非洲网络威胁评估报告 2026:AI 驱动的网络犯罪激增
INTERPOL 报告称,AI 现在为非洲超过 55% 的网络犯罪案件提供动力,导致经济损失从 2024 年的 1.92 亿美元急剧增加到 2025 年的 4.84 亿美元。
Guardian Angel: Gwern 从匿名状态向个性化 AI 双生体的转型
作家兼研究员 Gwern 宣布从全职写作和匿名状态中退休,转而启动 Guardian Angel 项目,旨在通过创建个性化的“数字双生体”LLM 来模拟用户的个性与价值观,从而增强人类的生产力与认知自由。
Mistral Shieldstral 1.0 3B 发布
Mistral AI 发布了 Shieldstral 1.0 3B,这是一款开源权重、策略自适应的多模态安全分类器,允许用户在推理时通过自然语言查询来定义审核策略。
软件工程中关于生成式 AI 的八个常见误区 —— 基于证据的反驳
ACM Queue 文章《软件工程与 GenAI 的八个误区》揭穿了关于 AI 辅助开发的八个普遍误解,指出编码仅占开发人员工作的一小部分,代码行数指标是无效的,且实现真正的生产力提升需要的是组织变革而非孤立的工具。
DeepSeek V4 Flash 在单个 AMD MI300X 上运行——性能、修复与部署指南
DeepSeek V4 Flash 可在单个 AMD MI300X GPU 上以 168 tok/s 解码吞吐和 8K tok/s 预填充速度运行,无需量化,得益于一组 ROCm 补丁、AITER 调优和混合 KV 缓存策略。
AI 生成图像对博客可信度与读者参与度的影响
Hacker News 上的讨论揭示了读者对个人博客中 AI 生成图像的强烈厌恶,通常将其视为低投入内容或 AI 生成文本的信号。
Qwen-Image-3.0-Pro 发布与能力介绍
Qwen-Image-3.0-Pro 是一款专注于生产力的图像生成模型,能够渲染密集布局、小至 10px 的精确文本以及高保真摄影级细节。
OpenAI的“Apple is Getting This Wrong”博客文章:主要主张和社区反应
OpenAI发表博客文章,称苹果的诉讼存在程序错误和虚假主张,引发了关于文章语气、证据价值和法律策略的争论。
Jeff Dean 和 Google 研究员推出 Discovery Loop AI 初创公司
Jeff Dean,Google 的首席科学家,携三名研究员离开 Alphabet,创立了专注于 AI 递归自我改进以加速科学发现的初创公司 Discovery Loop。
Google DeepMind 领导层变动:Demis Hassabis 与 Jeff Dean 角色转型
Demis Hassabis 将从 Google DeepMind 的 CEO 转型为主席及 Alphabet 首席科学家,而 Jeff Dean 和 Sanjay Ghemawat 将离职并启动由 Google 支持的公益公司 Discovery Loop。
Soup 通过层流式传输在 4 GB 笔记本 GPU 上实现 8B 模型的微调
Soup 使用层流式传输和 QLoRA 在 4 GB 笔记本 GPU 上微调 8B 参数的 LLM,以最小的开销实现位精确结果。
LLMs Reward Expertise: Why Domain Knowledge is the Ultimate Prompting Skill
领域专业知识是最大化 LLM 性能的最关键因素,因为专家可以更精确地引导模型,识别幻觉,并触发新手无法触发的高层级推理模式。
Armature: Agentic Sessions 的产品分析工具
Armature 为 Model Context Protocol (MCP) servers、ChatGPT Apps 和 Claude Connectors 提供产品分析和评估,使产品团队能够追踪用户意图和 Agent 性能。
OpenAI Astra: 十项数学和理论计算机科学进展
OpenAI 已利用其 Astra 模型的内部版本,在高维几何、编码理论和量子复杂度等领域解决或在十项长期悬而未决问题上取得实质性进展。
NHS道歉并承认Palantir工程师可以访问可识别患者数据
NHS England在更正了其数据保护影响评估中的一个错误后表示了歉意,Palantir工程师和其他供应商人员可以通过联邦数据平台在严格且有时效性的控制下访问可识别患者数据。
Swiftlet 在 Mac 和 iPhone 上以低 RAM 使用量启用 35B 和 80B Qwen 模型
Swiftlet 通过从存储流式传输 Mixture‑of‑Experts 权重,使您能够在 iPhone 上使用约 2.5 GB RAM 运行 35B Qwen 模型,在 Mac 上使用约 4.3 GB RAM 运行 80B Qwen 模型。
伪造的 SQLite CVE:LLM 生成的漏洞“垃圾”兴起
安全研究人员发现了一波由 LLM 完全伪造的严重 SQLite CVE,暴露了 CVE 提交和验证流程中的系统性失败。
通过手动重打 LLM 生成的代码来防止认知负债——来自 Hacker News 讨论的见解
Ankur Sethi 通过手动重打 LLM 生成的代码来防止个人项目中的认知负债,Hacker News 评论者们对此展开了辩论,认为这是一种有用的学习技巧,还是一个低效的权宜之计。
Nightcrawler v0.1.0: 智能手机自主本地 AI 渗透测试代理
Nightcrawler v0.1.0 是一款开源的自主渗透测试代理,它在 Android 智能手机上本地运行,使用 1.2B 参数的 AI 模型,在无需云端连接的情况下发现并利用网络漏洞。
ComfyUI 对 MiniMax H3 的支持
ComfyUI 引入了对 MiniMax H3 的首日支持,这是一款开源权重的全模态视频模型,能够在消费级硬件上生成带有原生立体声音频的 2K 视频。
TITLE:
SUMMARY:
Qwen3.8-Max 发布:2.4T‑参数模型,下周开放权重,以及广泛的自主能力
Qwen3.8‑Max 是一个具有 2.4 万亿参数、95 B 活跃参数的模型,现已通过 QwenCloud 提供,且其权重将于下周开源,在编码、实际工作、长时任务和多模态代理方面实现了显著提升。
Cloudflare Workers AI: 大规模优化 Kimi 和 GLM 推理
Cloudflare 通过 SGLang 利用 KV cache 量化、权重压缩和完整性检查,在不牺牲准确性的情况下,提高了 Kimi 和 GLM 模型的并发量和吞吐量。
Chiaro SOC 2 Methodology Open Source Release
Chiaro 已将其完整的 SOC 2 就绪状态和审计方法论开源,提供了机器可读的控制措施、证据标准和 498 个校准示例,以消除审计测试的“黑盒”现象。
hcker.news: 一个带有 AI 故事过滤功能的 Hacker News 阅读器
hcker.news 是一个第三方 Hacker News 阅读器,允许用户从其 Feed 中过滤掉 AI 相关的故事,以恢复更传统的技术内容体验。
FROGS 基准测试:生成一只哈布斯堡下巴的青蛙的 SVG
FROGS 基准测试要求 AI 模型使用单一提示创建一只哈布斯堡下巴的青蛙的 SVG,揭示了在解剖学准确性、大小以及添加皇家或情绪细节方面的差异。
AirLLM 使单个 4GB GPU 能够进行 70B LLM 推理
AirLLM 通过逐层流式传输的方式,让你在单个 4GB GPU 上运行 700 亿参数的 LLM,且无需量化,正如 lyogavin/airllm 仓库所示。