斯坦福法学院研究:AI在法律辅导中胜过法学教授
AI生成的答案优于人类同伴的回应
一项由斯坦福法学院的Julian Nyarko教授领导的研究显示,法学教授在绝大多数情况下更倾向于AI生成的学生提问答案,而非由同事撰写的回应。在近3000个匿名对比的盲测中,AI在正面对决中赢得了75%,这表明大型语言模型(LLM)能够有效地担任诸如合同法等复杂学科的辅导员。
这一发现意义重大,因为法律推理需要细致的判断力和在模糊情境中导航的能力,而非仅仅是简单的事实回忆。研究显示,教授们将AI的回答标记为“教学有害”的比例仅为3.5%,而同伴撰写的答案则为12%。
研究方法与范围
研究团队包括来自耶鲁、纽约大学和芝加哥大学的同事,重点关注AI作为法学院学生辅导员的潜力。研究使用了16位法学教授,他们编写了40个具有代表性的合同法问题,这些问题是学生在办公时间常见的询问。这些教授在不知答案是由AI还是人类同伴生成的情况下对回复进行评估。
为确保有效性,研究人员对AI的回答进行了校准,使其在长度和结构上与人类答案相匹配。研究测试了多种模型,包括Google的NotebookLM和Gemini 2.5 Pro,结果发现评估者认为NotebookLM(使用了额外的法律资源)略胜一筹。
对法律教育的影响
虽然结果表明AI能够达到法律教育者用于评估论证的专业标准,研究人员强调这并不意味着要全面取代人类教师。Nyarko教授警告说,讨论的焦点应从AI是否能提供高质量回答转向如何负责任地部署这些工具以惠及学生。
该研究的第一作者Alejandro Salinas指出,AI辅导员能够提供高质量、随需应答的支持,补充课堂教学,并有可能在判断密集的领域扩大对专家指导的获取渠道。
批判性分析与反驳
尽管研究结果积极,但该研究在方法论和结论上受到技术和法律界的批评:
统计与方法论担忧
批评者认为,16位教授的样本量过小,难以提供有意义的统计检验力。一些观察者指出,结果可能受到特定因素的偏倚:
- 答案长度偏差: 有分析师认为答案长度是胜率的强预测因素,且教授们被要求简洁,可能导致他们的答案比AI更短、信息不够完整。
- 模型选择: 有人担心结果主要使用了Google模型,可能导致偏见。
- 训练数据重叠: 有人认为AI可能在生成问题所用的教材上进行过训练,使任务更像是记忆而非推理。
实际与伦理风险
从业者的讨论凸显了学术辅导与专业法律实践之间的差异:
- 问责制: 一个反复出现的担忧是责任问题。如果AI提供错误的法律建议,缺乏明确的责任归属框架。
- 推理与幻觉: 批评者指出,LLM在交叉质询时无法解释其陈述的根本依据,且可能出现幻觉式的来源或依赖过时的法规。
- 学术与实践: 一些从业者认为,法学教授的偏好反映了学术和理论推理,这与私人法律实践的需求有显著差异。
“法律学术界本应对事物持有独特观点,并对问题提供新颖的哲学答案……它并未揭示太多新信息。”
可及性潜力
相反,也有人将这些发展视为民主化法律知识的途径。通过降低法律培训成本并提供“首轮”辅导工具,AI有望让无法负担昂贵法律顾问的人群更容易获得法治。