OpenAI Astra for Law 發布:功能、基準測試結果與社群反應
Astra for Law 提供專注於法律的 AI 技術堆疊
OpenAI 宣布推出 Astra for Law,這是其 GPT‑6 Astra 模型的一個版本,結合了大規模法律搜尋索引、用於分析與寫作的自訂指令,以及 26 個適用於 Relativity 和 Clio 等工具的生態系統外掛程式。該產品透過「信任存取」(Trusted Access) 計畫提供給特定事務所,並將很快透過 API 以 gpt-6-astra-law 的形式提供。
- 法律搜尋索引 – 涵蓋美國判例法、法規、條例、法院規則以及超過 2.3 億個網址的行政裁決,每日更新。該索引整合了 Free Law Project 的資料庫,其中包括超過 99.9% 已發布的美國判例意見。
- 自訂指令 – 指導模型將研究應用於客戶事實、起草論點、發現弱點,並區分判決理由 (holdings) 與附帶意見 (dicta)。
- 隱私控制 – 為符合條件的事務所提供零資料保留 (Zero Data Retention, ZDR),並預設將 ChatGPT Enterprise 排除在人工審查之外。
- 合作夥伴外掛程式 – 26 個新外掛程式將模型連接到現有的法律科技堆疊(例如 iManage、Intapp、DeepJudge、Thomson Reuters HighQ),另有 9 個社群開發的外掛程式增加了 47 種自訂技能。
基準測試表現顯示出顯著提升
OpenAI 在 Vals AI Legal Research Bench(200 個美國法律研究問題)上評估了 Astra for Law。該基準測試衡量了來源檢索與答案品質。
| 指標 | Astra for Law | GPT‑6 Astra (網路搜尋) |
|---|---|---|
| 整體正確率 (all‑pass) | 54.0% | 38.7% |
| 部分給分加權通過率 | 90.0% | (未公開) |
| 找到的參考案例 (判例法問題) | 多 24% | — |
| 檢索到的相關段落 (目標集) | 多達 54% | — |
54% 的 all‑pass 分數代表相較於僅使用網路搜尋的基礎 GPT‑6 模型,有 40% 的相對提升,且該模型產出的答案也更為全面。
實際試點展示了工作流程整合
OpenAI 強調了與三家頂尖事務所的早期合作:
- Sullivan & Cromwell – 建立了一個協議分析器,將事務所的談判策略手冊與先例注入合約審查中,自動建議修改紅線與草擬建議。
- Ropes & Gray – 創建了一個交易盡職調查系統,鏡像了事務所的資料室工作流程,將調查結果追溯至原始文件,並標記出對收購至關重要的條款。
- Cooley – 推出了 GO Public,這是一款資本市場助理,指導 IPO 文件準備、風險識別與跨文件影響分析。
這些試點展示了事務所如何在保留資料與審查控制權的同時,將 Astra for Law 嵌入其專有流程中。
Hacker News 上的社群反應
此次發布引發了熱烈討論(674 則留言)。主要主題包括:
基準測試比較 – 使用者指出 Astra for Law 的 54% all‑pass 分數略低於 Anthropic 的 Claude Opus 5 與 Muse Spark 1.3 Max(在同一基準測試中得分為 55.29%)。在部分給分評分下,Astra for Law 達到了 90% 的加權通過率,與 Claude Opus 5 的 90.58% 相當。
「頂尖者呈現三方平手……Astra for Law 達到了 54.0%……Astra for Law 達到了 90.0%」 – @nerevarthelame
實際用途 – 幾位評論者強調,AI 仍然需要律師的監督,特別是在細緻的起草與法規遵循方面。
「我嘗試用 AI 起草合約……律師做了很多修正。對真正律師的需求將會持續存在」 – @halamadrid
經濟影響 – 人們對計費工時模式以及初級律師與律師助理可能面臨的失業問題表示擔憂。
「工作速度越快,意味著律師的計費工時越少」 – @phyzix5761 「初階律師助理將會被淘汰」 – @melonpan7
治理與信任 – 與 Latham & Watkins 的合作以及零資料保留的引入被視為邁向法律級信任的步驟,但懷疑論者警告可能存在利益衝突,並強調需要強大的浮水印技術。
「律師不是開發者;他們的工作可以追溯到他們本人。浮水印可能至關重要」 – @elpakal
競爭格局 – 使用者指出其他 AI 實驗室(Anthropic、Google)正在追求類似的垂直領域,市場可能會圍繞事務所特定的合作夥伴關係而碎片化。
「OpenAI 與 Latham & Watkins 合作,Freshfields 與 Anthropic 合作……誰會贏?」 – @msy
技術限制 – 一些參與者報告了幻覺、邏輯錯誤以及處理 PDF 的困難,這表明該模型尚未為所有法律任務做好生產準備。
「Astra 對法律摘錄得出了錯誤的結論,並重複了該錯誤」 – @varispeed
此次發布對法律科技生態系統的意義
- 專業化工具優於通用模型 – Astra for Law 與基礎 GPT‑6 模型之間的效能差距,凸顯了特定領域提示詞、檢索工具與外掛程式的價值。
- API 存取將擴大採用 – 透過向 API 客戶(例如 Harvey、Legora)開放
gpt-6-astra-law,OpenAI 使新創公司能夠將法律智慧嵌入合約審查工具、判例法搜尋平台與合規儀表板中。 - 資料治理將成為差異化因素 – 隨著客戶對機密性的要求提高,零資料保留與事務所層級的道德防火牆可能成為競爭護城河。
- 基準測試將推動未來改進 – 54% 的 all‑pass 分數顯示仍有很大的迭代空間;OpenAI 承諾持續進行模型升級,並透過律師回饋擴大評估範圍。
總結
OpenAI 的 Astra for Law 將 GPT‑6 與龐大的美國法律語料庫、自訂推理指令以及一套外掛程式打包在一起,在領先的法律研究基準測試中達到了 54% 的 all‑pass 正確率,相較於基礎模型有 40% 的相對提升。早期的事務所試點展示了具體的工作流程整合,而社群則強調了律師監督、資料治理以及對效能與經濟影響保持現實預期的必要性。此次發布標誌著向高利潤法律市場的垂直 AI 產品邁出了決定性的一步,為 AI 實驗室與律師事務所之間的競爭奠定了基礎。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch