OpenAI Astra for Law 发布:功能、基准测试结果及社区反应
Astra for Law 提供以法律为中心的 AI 技术栈
OpenAI 发布了 Astra for Law,这是其 GPT‑6 Astra 模型的一个版本,结合了大规模法律搜索索引、用于分析和写作的自定义指令,以及 26 个用于 Relativity 和 Clio 等工具的生态系统插件。该产品通过“受信任访问计划”(Trusted Access program)提供给选定的律所,并将很快通过 API 以 gpt-6-astra-law 的形式提供。
- 法律搜索索引 – 涵盖美国判例法、法规、条例、法院规则和行政裁决,涉及超过 2.3 亿个 URL,每日更新。该索引整合了 Free Law Project 的馆藏,其中包括超过 99.9% 已发布的美国判例意见。
- 自定义指令 – 指导模型将研究应用于客户事实、起草论点、发现弱点以及区分判决理由与附带意见。
- 隐私控制 – 为符合条件的律所提供零数据保留(ZDR),并默认将 ChatGPT Enterprise 排除在人工审查之外。
- 合作伙伴插件 – 26 个新插件将模型连接到现有的法律技术栈(例如 iManage, Intapp, DeepJudge, Thomson Reuters HighQ),9 个社区构建的插件增加了 47 种自定义技能。
基准测试表现显示出可衡量的提升
OpenAI 在 Vals AI Legal Research Bench(200 个美国法律研究问题)上评估了 Astra for Law。该基准测试衡量了来源检索和答案质量。
| 指标 | Astra for Law | GPT‑6 Astra (网页搜索) |
|---|---|---|
| 整体正确率 (all‑pass) | 54.0% | 38.7% |
| 部分得分加权通过率 | 90.0% | (未披露) |
| 找到的参考案例 (判例法问题) | 多 24% | — |
| 检索到的相关段落 (目标集) | 多达 54% | — |
54% 的 all‑pass 得分代表了相比仅使用网页搜索的基础 GPT‑6 模型有 40% 的相对提升,且该模型生成的答案也更全面。
现实世界的试点展示了工作流集成
OpenAI 重点介绍了与三家精英律所的早期合作:
- Sullivan & Cromwell – 构建了一个协议分析器,将律所的谈判手册和先例注入合同审查中,自动建议修订和起草建议。
- Ropes & Gray – 创建了一个交易尽职调查系统,镜像了律所的数据室工作流,将发现追溯到源文档并标记收购关键条款。
- Cooley – 推出了 GO Public,这是一个资本市场助手,指导 IPO 文件准备、风险识别和跨文档影响分析。
这些试点展示了律所如何在保留数据和审查控制权的同时,将 Astra for Law 嵌入到专有流程中。
Hacker News 上的社区反应
此次发布引发了热烈的讨论(674 条评论)。主要主题包括:
基准测试比较 – 用户指出,Astra for Law 的 54% all‑pass 得分略低于 Anthropic 的 Claude Opus 5 和 Muse Spark 1.3 Max(在同一基准测试中得分为 55.29%)。在部分得分评分下,Astra for Law 达到了 90% 的加权通过率,与 Claude Opus 5 的 90.58% 相当。
"顶尖水平是三方平手……Astra for Law 达到了 54.0%……Astra for Law 达到了 90.0%" – @nerevarthelame
实际效用 – 几位评论者强调,AI 仍然需要律师的监督,特别是在细致的起草和监管合规方面。
"我尝试用 AI 起草合同……律师做了很多更正。对真正律师的需求将持续存在" – @halamadrid
经济影响 – 人们对计费工时模式以及初级律师和律师助理可能面临的失业问题表示担忧。
"工作速度越快,意味着律师的计费工时越少" – @phyzix5761 "入门级律师助理将被淘汰" – @melonpan7
治理与信任 – 与 Latham & Watkins 的合作以及零数据保留的引入被强调为迈向法律级信任的步骤,但怀疑论者警告了潜在的利益冲突以及对稳健水印的需求。
"律师不是开发人员;他们的工作可以追溯到他们本人。水印可能至关重要" – @elpakal
竞争格局 – 用户指出,其他 AI 实验室(Anthropic, Google)正在追求类似的垂直领域,市场可能会围绕特定律所的合作伙伴关系而碎片化。
"OpenAI 与 Latham & Watkins 合作,Freshfields 与 Anthropic 合作……谁会赢?" – @msy
技术局限性 – 一些参与者报告了幻觉、逻辑错误以及处理 PDF 的困难,表明该模型尚未为所有法律任务做好生产准备。
"Astra 对法律摘录得出了错误的结论并重复了该错误" – @varispeed
发布对法律技术生态系统的意义
- 专用工具优于通用模型 – Astra for Law 与基础 GPT‑6 模型之间的性能差距凸显了特定领域提示词、检索工具和插件的价值。
- API 访问将扩大采用范围 – 通过向 API 客户(例如 Harvey, Legora)开放
gpt-6-astra-law,OpenAI 使初创公司能够将法律智能嵌入到合同审查工具、判例法搜索平台和合规仪表板中。 - 数据治理将成为差异化因素 – 随着客户对保密性的要求提高,零数据保留和律所层面的道德防火墙可能成为竞争护城河。
- 基准测试将推动未来改进 – 54% 的 all‑pass 得分并不算高,这预示着有充足的迭代空间;OpenAI 承诺持续进行模型升级,并根据律师反馈扩大评估范围。
总结
OpenAI 的 Astra for Law 将 GPT‑6 与海量的美国法律语料库、自定义推理指令和一套插件打包在一起,在领先的法律研究基准测试中实现了 54% 的 all‑pass 正确率,比基础模型有 40% 的相对提升。早期的律所试点展示了具体的工作流集成,而社区则强调了律师监督、数据治理以及对性能和经济影响保持现实预期的必要性。此次发布标志着向高利润法律市场中的垂直 AI 产品迈出了决定性的一步,为 AI 实验室和律所之间的竞争奠定了基础。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch