跳转到主要内容
ToolPotion

2026年法律工作中的AI:合同、研究与合规,如何规避风险

基准测试揭示AI在哪些方面超越律师、在哪些方面失败。2026年制裁记录、Rule 11核查流程,以及保护特权的供应商条款。

···18 分钟阅读

在文件问答方面,AI超越了律师基准(Harvey 94.8% vs 70.1%),但在合同标记修改方面则落后(65.0% vs 79.7%),数据来源:Vals Legal AI Report。无论供应商演示如何宣传,这一差距决定了你在法律工作中将AI授权使用的边界。

负面代价如今已有明确数字。Couvrette v. Wisnovsky案中,两名律师被罚款$110,204.38并遭驳回。Withers v. City of Aberdeen案最终以两名律师被暂停在该地区出庭资格两年并移交律师协会调查收场。

即便是专门为法律领域打造的工具也无法保你平安:斯坦福RegLab测量到Lexis+ AI和Westlaw AI辅助研究的幻觉率在17%至33%之间

因此本文按风险等级组织内容:基准测试允许你授权给AI的任务、案例法禁止的内容、能够通过Rule 11审查的核查流程,以及决定特权是否存续的四项供应商条款。

基准测试允许你在法律工作中委托给AI的任务

两项独立基准测试划定了界线,而这条线与供应商营销所宣称的位置并不相符。AI在信息提取和摘要工作上大幅超越律师基准,在起草判断和搜索结构化公开文件方面则处于劣势。

AI超越律师基准的领域

Vals Legal AI Report在离散任务上将法律AI产品与律师对照组进行了比较。在文件问答方面,Harvey得分94.8%,律师基准为70.1%。在文件摘要方面,CoCounsel达到77.2%,律师为50.3%。在庭审记录分析方面,Harvey取得77.8%,律师为53.7%(Vals AI)。这些任务历来耗费大量初级律师工时,差距超过20个百分点。

法律研究领域同样发生了变化。后续Vals基准测试对210道题进行了盲评,结果显示Counsel Stack得81%、Alexi得80%、ChatGPT得80%、Midpage得79%,律师基准为71%(LawSites)。通用ChatGPT与专用研究产品打平,当供应商向你报出五位数的席位价格时,这一结果值得你停下来想一想。

律师仍占优势的领域

合同标记修改是最明显的短板。律师得分79.7%,Harvey仅65.0%;EDGAR研究方面,律师70.1%,Oliver为55.2%(Vals AI)。如果你工具栈中某款产品以合同标记为主要卖点,这个卖点已超越了实测表现。用它来标记条款供人工审查,发出的标记修改版仍需律师把关。

像主任律师一样解读基准测试

将每个分数视为针对某一具体任务的授权决策。品牌层面的结论经不起数据检验。Harvey在文件问答上胜出,却在标记修改上落败——同一款产品,截然相反的结论。

因此,购买前先问清基准测试的测量对象。一款在从你提供的文件中提取答案方面得分94.8%的工具,并未告诉你它自行查找权威资料时是否会编造引用。这是两种不同的失败模式,后果各异,制裁数字只与后者挂钩。当你从我们目录中的124条法律服务列表中筛选时,请按你需要覆盖的任务类型排序。

任何低于律师基准分数的输出,在离开你的办公桌前都必须逐行审查。

幻觉风险使AI不适用的场景

购买法律专用工具可将虚构内容大约减少一半,但不能降至零;而「减半」与「归零」之间的差距,正是制裁风险所在。

17–33%:专业法律研究工具仍会出错的比例

斯坦福RegLab和HAI对大多数律所已购买的两款产品进行了预注册测试,发现Lexis+ AI幻觉率约为17%,Westlaw AI辅助研究约为33%,GPT-4则为43%。准确率方面同样如此:Lexis+ AI为65%,Westlaw AIAR为42%。旗舰级研究产品中每三个答案就有一个含有捏造或依据错误的内容,仅凭抽查是难以消化这种风险的。

该研究预印本发布于2024年5月,此后工具已持续更新迭代。但它仍是唯一一份针对这些产品进行的预注册独立基准测试,且没有任何供应商发布过能证明数字已改变的复现研究。

为什么「法律级别」和「RAG接地」不等于安全声明

检索增强生成将模型锚定在真实语料库中,但并不能阻止模型将一个真实案件描述为它从未做出的裁定,也无法阻止它将看似合理的引用页码拼接到错误的判决意见上。斯坦福团队直接审查了营销材料,发现供应商关于「100%无幻觉的有链接法律引用」的声明存在夸大。将「法律级别」视为关于训练语料库的声明,你在Rule 11下的风险暴露是另一个独立问题。

绝不能在未经核实的情况下离开的三类输出

引用、引语和裁定。每条案例引用都要调出来逐字阅读。每段引用文字都要与原文逐字符核对。每一处对法院裁定的描述都要与判决意见核实,因为这是引用检查器也会漏过的失败模式:案件存在,报告号码正确,但命题是捏造的。

其他一切都是效率问题。这三项是提交问题,这一区别比你选择哪家供应商更重要。

同样的规则适用于研究之后的环节。如果你将简报或庭审记录送入摘要工具处理,摘要只是你自行阅读的起点,不能替代阅读本身。任何从摘要提取进入提交文件的内容,都要再次经过上述三项核查。

2026年制裁记录:出错的代价

在考虑订阅费之前,先计算一下损失风险。一份错误提交文件已让一支法律团队付出$110,204.38并失去客户案件(Greenberg Rothstein),让两名外州律师失去在联邦地区出庭的权利长达两年(JD Journal)。两者均为附有金额的有案可查的法院命令。

从约200个案例到一年内的1,668个

联邦法院本身引用的Damien Charlotin的AI幻觉案例数据库,截至2026年7月2日追踪到1,668个案例:其中美国1,163个,英国59个,653个案件的责任方是执业律师而非自行诉讼的当事人。2025年中期时数量约为200个。这条曲线是你向持怀疑态度的合伙人展示的数字。

如果你要发布数据,请引用实时数据库而非任何二手追踪器。案例数量每日更新,各追踪器之间有时相差数百个案例。

653这个数字比总数更重要。它意味着约五分之二的追踪事件来自持有律师执照且有职业责任险的律师,这与将ChatGPT输出复制粘贴进诉状的自诉方风险截然不同。

Couvrette v. Wisnovsky:$110,204.38的标杆案例

在Couvrette v. Wisnovsky案(No. 1:21-cv-00157-CL,D. Or.)中,法院对两名律师合计裁定$110,204.38并驳回诉讼。圣迭戈临时出庭律师Stephen Brigandi承担了其中$95,998.72:$15,500的货币制裁加上$80,498.72的被告律师费。波特兰本地律师Tim Murphy因签署未经核实的文件被裁定$14,205.66。这批文件中,在五个月内提交的三份简报中共包含15处捏造案件引用和8处虚构引语。

如果你曾作为外州首席律师的申请代理人,请仔细看看本地律师那个数字。他人研究带来的一万四千美元损失,如今已有先例。

Whiting、Withers与第九巡回法院:罚款升级为停职

仅2026年第一季度,AI相关法院制裁就至少达$145,000,其中包括在第六巡回法院Whiting v. City of Athens案中对两名律师各处$15,000的惩罚性罚款,加上对方律师费和双倍诉讼费,原因是数十条错误或不存在的引用(ComplexDiscovery)。此后金钱不再是处罚的上限。

在Withers v. City of Aberdeen案(N.D. Miss.,2026年6月8日)中,法官Sharion Aycock发现双方律师的文件中均存在虚假案例。她取消了原定审判,将两名外州首席律师在该地区出庭资格暂停两年、撤销其临时出庭许可,对所有记录在案的律师处以$1,000至$3,500不等的罚款,并通知了州律师协会。2026年2月,第九巡回法院将奥兰治县移民律师Mike Sethi和William Rounds暂停出庭资格六个月并各罚款$2,500,主要原因是他们将AI生成的错误描述为笔误(Metropolitan News-Enterprise)。

将这份制裁清单与任何供应商的ROI幻灯片对比一下。我们目录中有据可查的AI部署案例研究量化了节省的工时;但没有一个案例能抵消两年停职的损失。

律师受罚的原因是掩盖错误,而非犯错本身

仔细阅读制裁记录,会发现一个规律,它改变了你应该优化的方向。筛选幻觉数据库中有货币和职业制裁的案例,会发现律师很少仅仅因为在AI工具上犯错而受到处罚。他们受罚是因为被发现后拒绝承认、一意孤行或推卸责任(Damien Charlotin FAQ)。

这是一个认知框架的转变。你不可能发现每一处捏造引用,所以不要构建一个假设你永远能发现的流程,而要为你漏掉的那一天做好预案。

Charlotin自身筛选结果揭示的规律

重大处罚集中在被发现后的行为上。对于一个说「我用了某工具,没有核实,这是更正后的简报,我会支付对方时间成本」的律师,法官有相当大的容忍度。但对于声称引用属实或将责任推给助理的律师,法官几乎毫无容忍。

Noland案与举报对方虚假引用的义务

Noland案将这一义务向外延伸。该案法院拒绝命令向对方律师支付制裁款,注意到被申请人从未提醒法院注意那些捏造内容,并且似乎只在接到说明理由通知后才得知此事(LawSites)。你的核查义务既涵盖你提交的简报,也涵盖你收到的简报。核查对方援引的权威,并将你发现的内容告知法院。

为什么「笔误」让两名律师付出了六个月停职的代价

2026年2月,第九巡回法院将奥兰治县移民律师Mike Sethi和William Rounds暂停在该法院出庭六个月,并各罚款$2,500。六个月停职源于错误引用被发现后的处理方式。他们未披露不准确内容来自生成式AI,而是将其描述为笔误,法院将该命令作为对全体律师的警告(Metropolitan News-Enterprise)。

合同审查与证据开示:AI最具说服力的应用场景

证据开示是让证据从暗示性变为压倒性的环节。本文其他任务都附带着核查成本的警告,但这个任务有一项研究支撑:机器打败了你律所很可能正在使用并计费的方法。

文件审查:88%召回率 vs 主动学习的64%

Redgrave在包含45,004份文件的语料库上将GenAI与主动学习进行了对比,GenAI实现了88%召回率和1%遗漏率,而传统技术辅助审查方法的召回率为64%,遗漏率为3%(Redgrave)。召回率是你找到的内容,遗漏率是你在丢弃文件中错过的内容;在这样规模的语料库上将遗漏率从3%降至1%,意味着减少了约900份被遗漏的响应性文件。

将其作为可辩护性论据使用。如果对方律师质疑你的审查方案,「我们使用了在已发布的45,004份文件基准测试中召回率更高的方法」,比一张按文件收费的报价单更有说服力。成本节约随之而来。

初步合同筛查 vs 最终标记修改

将合同工作一分为二,基准测试的结论在两个方面都很清晰。初步筛查是信息提取:找出赔偿上限、标记每个自动续约条款、标出200份供应商保密协议中哪些偏离了你的模板。这与文件问答的模式相同,Harvey在该领域以94.8%对70.1%的律师基准胜出(Vals AI)。可以委托给AI。

最终标记修改是另一半,在这方面同一基准测试显示律师以79.7%对Harvey的65.0%胜出。标记修改是带有法律后果的谈判立场,请保留人工操作。

电商与医疗合同组合的实践

高量、低差异的合同组合是最佳应用场景。拥有数百份近似供应商条款的电商运营商,或处理付款方协议和BAA的医疗集团,主要价值来自条款提取和偏差标记,而非任何起草功能。我们目录中列有217款AI文档和PDF工具,以及550款智能AI工具;对于这项工作,列表中提取端的工具比生成端更重要。

将阈值设在过渡点:任何读取文件并报告内容的工具都可以大批量运行,辅以抽样审查。任何起草由他人签署文件的工具,在文件发出前必须有律师署名。

能经受Rule 11审查的核查流程

以下流程一旦成为习惯,每份简报大约需要十分钟。它从导致律师受到制裁的原因倒推而来,因此每个步骤对应案例记录中的一种失败模式,而非某家供应商的最佳实践页面。

从一手来源而非工具链接中提取每条引用

自行打开Westlaw、Lexis、CourtListener或法院自己的案卷,检索判决意见。不要点击AI给你的链接,不要因为工具显示了看似合理的报告卷号和页码就接受引用。捏造的引用附带捏造的元数据。在Couvrette v. Wisnovsky案中,伪造内容在五个月内经过三份简报流传,在有人调出原始案件之前无人察觉(Greenberg Rothstein)。

对方律师的引用也要如此操作。已有法院因律师未能标记对方的捏造内容而对其进行处罚,注意到他们似乎只在收到说明理由通知后才得知此事(LawSites)。

核查引语,再核查裁定

真实案件可能附有虚构引语。Couvrette案在15个不存在的案件之外,还涉及8处捏造引语(Greenberg Rothstein);第六巡回法院在Whiting v. City of Athens案中对两名律师各处$15,000罚款,既涵盖被曲解的引用,也涵盖不存在的引用(ComplexDiscovery)。在判决意见中全文搜索引语,然后阅读足够多的上下文段落,确认该案件支持你简报中所述的命题。

记录提示词、模型版本和人工审查人

为每份提交文件保留一行记录:日期、工具和模型版本、提示词、AI生成的引用、每条引用的核查人及核查时间。德克萨斯州伦理意见705明确将生成输出的能力和监督责任归于律师本人(Texas Center for Legal Ethics),而同期日志是将这一责任义务从声明转化为说明理由听证中的证据的关键。

发现提交后幻觉时的披露脚本

在24小时内以书面形式采取行动,在任何人追问之前主动披露。提交更正通知,说明四件事:哪些具体引用有误、它们来自哪款AI工具、你未经核实就提交了、你已撤回或更正了哪些内容。自行承担责任,不要归咎于助理、合同研究员或软件。

这份脚本存在,是因为制裁数据指向了它。第九巡回法院将两名律师停职六个月并各罚款$2,500,主要原因就是他们将AI错误重新定性为笔误,而非披露来源(Metropolitan News-Enterprise)。主动披露是你能做的最划算的一份文件。

特权与保密:决定成败的四项供应商条款

品牌无法保护特权,合同条款才能。2026年的电子证据开示裁决已开始取决于供应商协议中关于训练、保留和第三方访问的条款(National Law Review),因此在阅读功能列表之前先阅读这四条条款。我们目录中每一家法律AI供应商都能以书面形式回答这些问题;拒绝回答的供应商已经在告诉你一些重要信息。

不训练承诺,以及为什么「我们不训练」还不够

要求明确范围。「我们不用你的数据训练」通常只涵盖基础模型,而将滥用监控日志、人工审查队列和检索层微调排除在外。要求条款列明每一种下游用途,而不仅仅是模型权重。

删除权与保留期限

你需要的是按需删除、以天为单位的明确最长保留期,以及能够覆盖备份和衍生嵌入的删除操作。30天的信任与安全保留期很常见,通常可以接受。无限期保留就是坐在别人服务器上的一个证据开示目标。

零数据保留及其适用范围

ZDR是可用的最强条款,也是最被过度营销的条款。它通常适用于API调用,而非聊天界面、文档工作区或供应商自身对提示词的日志记录。请以书面形式确认哪些产品界面受到覆盖。如果你的团队将庭审记录粘贴到ZDR范围之外的网页界面,你付费争取的条款就形同虚设。

子处理方、司法管辖区与无人阅读的证据开示风险

子处理方名单是客户机密信息离开的渠道。询问哪些模型提供商、托管地区和支持供应商接触你的提示词,以及名单是否可以在不通知的情况下更改。加利福尼亚州律师协会将义务明确归于你本人:在输入客户信息之前,你必须了解工具如何处理这些信息;同意并不能弥补你从未审查过的供应商安排(State Bar of California)。在订购合同中获取答案,而非在销售邮件中。

按风险等级而非功能列表选择工具组合

在看任何演示之前,先将你考虑的每个任务归入三个类别。类别而非供应商,决定了你购买什么以及预算多少用于核查。

四条应做事项与两条禁止事项的清单,用于将AI法律工作分配到风险等级

第一级:委托并抽样核查

文件问答、摘要、庭审记录分析、初步特权和响应性审查。这些任务的基准差距足够大,合格的工具加上10%抽样检查,优于独立工作的助理律师。按合同条款购买(不训练、删除权、零数据保留、无第三方子处理方),而非按准确率声明购买,因为在这一等级,准确率问题已解决,特权问题尚未解决。

第二级:AI起草,人工对每条引用负责

法律研究、备忘录起草、任何含有引用的内容。专用研究工具在这里物有所值,而在提交文件前你仍需调出并阅读每条权威。你的核查流程才是你真正购买的产品。

第三级:无论准确率如何,都不适用

针对协商模板的标记修改、新颖问题分析,以及任何未经有具名人类从头到尾阅读就提交的内容。律师在标记修改上仍优于工具,为更差的AI表现付费实属不合算。

有一个数字应当让你产生紧迫感。2026年5月22日至6月9日期间,幻觉追踪器每天新增案例接近8个,而4月份为每天5至6个(haqq.ai)。曲线仍在上扬,这意味着你正在参照的制裁记录已经过时。

我们目录揭示的法律AI市场现状

专业细分市场比表面上的噪音要薄弱得多。与我们目录中13,174款AI应用相比,法律服务列表仅有124条,不足1%。大多数以你的业务为营销目标的工具,都是挂着法律落地页的通用产品,而这恰恰是上述四项供应商条款往往缺失的那个群体。

常见问题

律师在2026年能安全使用AI吗?

可以,前提是在有证据支持的任务上使用,并附有可记录的核查步骤。独立基准测试显示,AI在文件问答方面优于律师基准(Harvey 94.8% vs 70.1%),在标记修改方面则落后(65.0% vs 79.7%),因此安全使用是逐任务而非逐工具的判断(Vals Legal AI Report)。制裁记录印证了这一点:筛选Damien Charlotin数据库中有货币和职业处罚的案例,显示律师很少因为在AI工具上犯错而受到处罚,而是因为被发现后拒绝承认、一意孤行或归咎于他人而受到处罚(Charlotin FAQ)。对所有提交法院的内容进行引用核查,并为万一有所疏漏的那天准备好披露协议。

律师是否真的因使用AI而受到制裁,代价有多大?

是的,而且数字增长迅速。美国已知最大罚款为Couvrette v. Wisnovsky案(D. Or.)中的$110,204.38,其中$95,998.72由临时出庭律师Stephen Brigandi承担,$14,205.66由本地律师Tim Murphy承担,原因是三份简报中共有15处虚假引用和8处捏造引语(Greenberg Rothstein)。第六巡回法院在Whiting v. City of Athens案中对两名律师各罚款$15,000,这是仅2026年第一季度至少$145,000 AI相关制裁的一部分(ComplexDiscovery)。金钱不是处罚的上限:在Withers v. City of Aberdeen案(N.D. Miss.,2026年6月8日)中,法官Sharion Aycock取消了审判,将两名外州首席律师在该地区出庭资格暂停两年并移交州律师协会(JD Journal)。

Lexis+ AI和Westlaw等专业法律研究工具是否仍会产生幻觉?

会。斯坦福RegLab和HAI的预注册研究发现,Lexis+ AI幻觉率约为17%,Westlaw AI辅助研究约为33%,GPT-4为43%,准确率分别为65%和42%(Stanford RegLab)。同一组研究人员发现供应商关于「100%无幻觉的有链接法律引用」的声明存在夸大。检索接地降低了错误率但未消除它,因此每条引用在进入提交文件之前仍需调出并阅读。

将客户文件输入AI工具是否会放弃特权?

这取决于你的供应商合同内容,与工具的市场定位无关。决定这个问题的条款是:供应商是否用你的数据训练、你是否持有删除权,以及部署是否运行零数据保留。2026年的一系列裁决已使AI处理与特权在电子证据开示中走向碰撞,法院关注的是数据处理安排,而非「法律级别」标签(National Law Review, 2026年5月12日)。在上传任何一份特权文件之前,先阅读数据处理协议。

如果我发现已提交的简报中存在虚假引用,应该怎么做?

立即主动告知法院,并明确说明该引用来自AI工具。Charlotin对制裁数据的自身分析表明,严重处罚集中在那些被发现后拒绝承认、一意孤行或在被抓后归咎于员工和供应商的律师身上(Charlotin FAQ)。第九巡回法院在2026年2月将两名奥兰治县移民律师停职六个月并各罚款$2,500,主要原因就是他们将AI生成的不准确内容描述为笔误而非披露来源(Metropolitan News-Enterprise)。还需注意,法院已开始对未能标记对方虚假引用的律师进行处罚,因此这一义务双向适用(LawSites)。

AI在哪些法律任务上真正优于律师?

文件问答、摘要和庭审记录分析,优势显著。Vals AI测量显示Harvey在文件问答上得94.8%,律师基准71.0%;CoCounsel在摘要上得77.2%,律师为50.3%;Harvey在庭审记录分析上得77.8%,律师为53.7%(VLAIR)。法律研究此后也已超越律师,Counsel Stack得81%,Alexi得80%,在针对71%律师基准的210题盲评中(LawSites),GenAI审查在45,004份文件语料库上实现88%召回率和1%遗漏率,主动学习为64%和3%(Redgrave)。标记修改和EDGAR研究请留给律师:他们在前者上以79.7%对Harvey的65.0%胜出,在后者上以70.1%对Oliver的55.2%胜出(VLAIR)。

分组水平条形图,对比AI系统与律师基准在五项法律任务上的准确率,显示AI在三项任务上领先,在标记修改和EDGAR研究上落后

继续阅读

免费AI工具的真实代价免费增值陷阱、数据成本与何时该付费行业洞察硬性用量上限、默认用你的数据训练模型、水印限制和许可锁定——免费AI工具的真正局限,以及三个该付费的信号。2026年9月7日19 分钟阅读阅读文章AI工具栈审计削减订阅成本,同时保留全部能力行业洞察可重复执行的AI工具栈审计:清点实际付费项目,对照19种工具类型查找重叠,精准裁减冗余订阅,不损失任何能力2026年9月6日19 分钟阅读阅读文章哪些 AI 工具可以信任来处理你的数据?一套实用的隐私框架行业洞察一份可操作的 AI 隐私清单:训练数据退出选项、真实的数据保留期限、SOC 2 与营销话术的区别、欧盟数据驻留例外,以及分级信任模型。2026年9月5日19 分钟阅读阅读文章医疗健康领域的 AI—2026 年真正奏效的是什么行业洞察冷静审视 2026 年医疗健康领域的 AI——哪些已真正落地部署(临床记录助手、文献研究、行政自动化),哪些仍停留在炒作阶段。2026年8月24日8 分钟阅读阅读文章电商 AI— 2026 年卖家工具箱行业洞察2026 年的电商 AI,对照卖家的损益表来看——目录内容、产品图像、客服与广告——以及为什么「同质化」才是真正的风险。2026年8月14日10 分钟阅读阅读文章生产环境中的AI智能体实际运行团队总结的12条经验教程AI智能体遭遇真实工作时的故障:权限范围界定、失控循环、逐渐退化的审批门控、评估框架,以及背后的事故复盘。2026年9月5日22 分钟阅读阅读文章2026年本地AI与云端AI本地运行模型何时真正划算教程收支平衡点计算、DRAM价格飙升后的真实硬件成本、24GB显存能跑什么模型,以及大多数从业者最终采用的混合路由方案。2026年9月5日18 分钟阅读阅读文章AI 聊天机器人技术栈的实际成本是多少?2026年预算计算器指南教程通过专为您的席位数和解决量设计的交互式 AI 聊天机器人成本计算器,比较 Intercom Fin、Zendesk AI 和 ChatGPT Business 的定价。2026年9月3日14 分钟阅读阅读文章