GPT-5.6 Luna vs. GPT-6 Astra 代码审查对比
执行摘要
GPT-5.6 Luna 是进行通用代码正确性审查的性价比之选,其发现已验证漏洞的比例为 GPT-6 Astra 的 75%,而成本仅为后者的 3.6%。然而,Luna 在安全敏感领域(特别是身份验证和权限逻辑)表现出显著的性能差距,这使得它在没有人类或高能力模型监督的情况下,不适合进行高风险代码审查。
性能与成本对比
在针对 AI-Code-Review-Evals 组织 50 个公开拉取请求(pull requests)的基准测试中,GPT-5.6 Luna 和 GPT-6 Astra 被测试了它们在识别真实漏洞的同时忽略样式和文档问题的能力。
关键指标
| 指标 | GPT-5.6 Luna | GPT-6 Astra |
|---|---|---|
| 已验证漏洞数量 | 69 | 92 |
| 精确度 (已验证/总发现数) | 74% | 96% |
| 总成本 (50 个 PR) | $0.20 | $5.66 |
| 每个已验证漏洞的成本 | $0.0030 | $0.061 |
| 平均每次审查的耗时 | 23s | 36s |
Luna 的成本优势非常显著:单次审查的成本约为 $0.0041,而 Astra 的成本为 $0.113。就每个已验证漏洞而言,Astra 的成本是 Luna 的 20 倍。
模型弱点分析
安全与授权差距
Luna 在审查身份与访问管理 (IAM) 代码时性能大幅下降。在专注于身份验证和权限逻辑的 Keycloak 代码库中,Luna 仅发现了 6 个已验证漏洞,而 Astra 发现了 14 个。
按漏洞类别划分,Luna 仅识别了 24 个已验证安全漏洞中的 9 个,而 Astra 识别了 19 个。基准测试强调了廉价模型在处理“全局”逻辑时表现挣扎——即漏洞并非显现在单行代码上,而是源于变更如何影响整体权限模型。
精确度与噪声
Luna 的精确度显著低于 Astra。凭借 74% 的精确度,Luna 的发现结果中大约有四分之一是误报。这为开发者来说造成了“噪声”问题,如果误报率过高,开发者可能会开始忽略 AI 的建议。
互补优势
尽管 Astra 的整体表现优于 Luna,但 Luna 发现了 25 个 Astra 错过的已验证漏洞。在测试池中总共 143 个已验证漏洞中,44 个是由两个模型共同发现的。如果对每个拉取请求都同时使用两个模型,总共可以识别 117 个漏洞(占总数的 82%),总成本为 $5.86。
社区洞察与不同观点
行业从业者对这些模型在实际工作流中的应用提出了几种批判性视角:
- 误报的成本: 多个开发者认为,与处理误报的工程成本相比,每个 PR 的 $0.10 价格差异可以忽略不计。一位用户指出,“处理误报是昂贵的。”
- 集成策略: 有人建议 AI 不应直接接入 CI/CD 流水线。相反,AI 应该由 PR 作者或人类审查员进行过滤,在建议到达作者之前先进行过滤。
- 智能体工作流 (Agentic Workflows): 经验丰富的用户推荐了一种“协调员”方法。例如,使用高能力模型(如 Fable)来协调多个专注于特定领域(如复杂度或性能)的专业化子智能体(如 Luna)并合成结果。
- “合理性”陷阱: 一位开发者警告说,不要信任低能力模型,因为它们“听起来比实际合理得多”,这可能导致人类的松懈以及“小”错误的累积,最终导致系统性失效。
方法论
该研究使用了 50 个故意引入缺陷的公开拉取请求。发现结果通过双重评审系统进行验证:只有当 GPT-6 Astra 和 GPT-5.6 Sol 均认为某项发现是真实漏洞时,该问题才会被计为“已验证”。模型被提供了 diff,但没有提供额外的代码库历史或调用图。价格基于 Luna 的 $0.20/$1.20 (输入/输出) 和 Astra 的 $10/$50 每百万 token。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch