一个看起来完全正确的答案
让智能体分析一起法律案件。它会检索法规,整理事实,列出理由,最后给出一个很像样的答案。
问题可能出在更早的一步。
它引用了错误的法源。算错了程序期限。或者误解了工具返回的内容。
推理越流畅,这个错误反而越容易被最终答案遮住。
法律大模型正在从单轮 AI对话 走向智能体。
系统不再只是生成一段文字。它会规划任务。它会调用检索工具。它还会读取材料,依据中间结果继续往下走。
人们把更多步骤交给模型。也就更难逐项确认,它到底看到了什么。为什么作出现在这个判断,同样难查。
一次幻觉,开始有了跨步骤的后果。
香港科技大学的研究团队把目光放在了这条执行链上。他们做出了一套智能体幻觉评测基准,简称 LexAgentHallu。
它把观察对象从最终答案扩展到完整轨迹,并且把错误定位到具体步骤。
出发点很直接。
当一个智能体说「依据已经找到」,或者说「规则适用于当前事实」时,评测就不能只看结论。结论对不对只是第一层。
它还要检查支撑结论的理由是不是真实,是不是准确,是不是前后一致。
这套基准针对的是法律这类高风险场景里的 AI工具。

论文地址:https://arxiv.org/abs/2609.09754
过去评测法律大模型,最常见的做法是给一道题,再检查最终答案对不对。
到了智能体场景,同一个错误还要继续往下追。它影响了哪些检索,哪些引用,哪些判断,都要看清楚。
把一条法规的名称写错,可能只留下一个文本错误。
把已经失效的规定当成现行法,后果更重。它可能改变后面的规则选择。事实适用和救济建议也会跟着变。
智能体的风险因此不只来自「编造」。
它也可能找到真实材料,却把材料用错。它调用了正确工具,却填写了错误参数。它看到了相关结果,却误读了结果所支持的范围。
一次幻觉,不再只是错误文本,而可能成为下一步法律判断的前提。
所以这套基准不把最终答案当成唯一评测对象。
它沿着执行轨迹逐步检查。系统如何规划。调用了什么工具。读到了什么结果。保留了哪些信息。又是怎样把事实与规则连接起来的。
幻觉究竟藏在哪里
研究团队建立了一套双层分类体系。
第一层关注法律内容本身。法源对不对,法律原则对不对,程序规则对不对,事实适用对不对,都算这一层。
第二层关注智能体自己的执行过程。规划与推理算一类。记忆算一类。工具调用和对观察结果的理解也算一类。
两层合计包含 7 个中层类别和 27 个细粒度子类。
这套分类的目的不是给错误换一组名称,而是让问题能够被定位。
法源伪造要核验引用。事实与规则错配要重新检查要件。工具参数错误要约束调用接口。记忆偏移则指向上下文管理。
基准的构建围绕「难例」和「可核验」两件事展开。
研究团队从多类法律任务里收集数据,先过滤掉容易样本。再由有法律训练背景的标注者核对答案、法源和推理轨迹,最后完成幻觉分类与专家复核。

最终,这套基准收录了 3414 个实例,覆盖 17 个法律类别和 6 类任务。
它不只回答「系统错了多少」。它还想说明错误发生在哪里,属于哪一类。以及这个错误有没有可能继续污染后面的步骤。
论文评测了 18 种智能体配置,闭源的、开源的都在内。
结果显示,高幻觉率并不是个别系统的边缘现象。
即使表现最好的那套配置,也仍有 89% 的执行轨迹至少出现过一次幻觉。所有系统在法律内容层面的幻觉频率,都不低于 87.5%。
这组结果并不等于说,所有法律回答都有同样风险。
它说明的是,在这套评测里,当前系统很难从头到尾保持一条干净的推理链。这条链既要干净,也要能被核验。
模型怎么选,工具怎么接,流程怎么编排,都会改变错误的分布。
有一类循环式的做法很划算。模型行动一次,再观察一次。它在整体幻觉和法律内容幻觉上都更有优势。
法律专用的工作流,更擅长压低过程性错误。
先规划再执行的方式,在这套实验里没有表现出稳定领先。
所以部署智能体的时候,不能把模型单独评估。工具也要单独评估。流程同样算在里面。
更强的基础模型,仍可能在不合适的检索流程里放大错误。
较小的模型,也可能通过更明确的工具协议和过程约束,拿到更稳定的表现。
这里有一处取舍值得记下。与其去追一个分数更高的模型,不如先把检索流程和工具协议理清楚。
答案对了,理由为什么仍然不可信
论文提出了一个很直观的指标,缩写 RAWR。
它只看最终答案正确的那些样本,再去检查这些样本的轨迹里是不是仍然藏着幻觉。
结果显示,在答案正确的前提下,平均仍有 68% 的轨迹包含至少一种法律内容幻觉。37% 的轨迹包含至少一种过程幻觉。

正确答案只能说明结论命中,不能证明推理链是干净的。
对法律咨询、合同审查和诉讼辅助这类应用来说,这一区别尤其关键。
用户需要的不只是一个看起来正确的句子,还需要一条能够追溯的理由链。
这条链要经得起核验,也要经得起反问。
如果系统只在输出端给出结论,引用和推理的质量却不暴露出来,错误就可能藏下去。它会在「答案正确」的表面下继续留存。
不同任务的幻觉频率并不均匀。
开放式任务最危险。链条越长风险越高。需要综合事实与规则的任务,同样容易暴露问题。

在任务类型上,判决分析的法律内容幻觉频率到了 1.00。
案例分析是 0.95。法律推理和法律咨询在高位。法律知识问答和判决预测也在高位。
过程性幻觉呈现出另一种排序。
判决分析到 0.83,判决预测是 0.71。
较短的输出并不必然安全。只要任务要求多步证据整合,规划和记忆就可能出问题。要判断期限,要适用规则,风险同样在。
真正决定风险的,不只是题目看起来有多难。
而是系统需要完成多长的一条映射链,从事实到规则,再到程序和结论。
任何一个环节发生偏移,后面的步骤都可能在错误前提上继续推进。
论文还分析了 27 个细粒度幻觉子类之间的共现关系。
结果显示,这些错误并不是随机散点,而会形成有结构的组合。

程序期限错误与救济路径错误的共现提升度达到 2.82。程序步骤错误与程序后果错误达到 2.59。
最强的跨组信号,出现在法源层级错误和法律立场混淆之间,提升度达到 7.07。
这意味着,很多看似分散的错误可能共享同一个上游原因。
法源层级一旦判断错误,后面的规则立场和事实适用就可能一起偏移。
程序时钟一旦算错,期限、步骤和救济路径也可能连续出问题。
对系统治理来说,高风险错误可以被当成早期信号。
一旦检测到法源层级异常,或者期限算错了,就该多查一遍。程序步骤跳了,同样该转人工复核。
而不是等到最终答案生成之后,再被动纠错。
从评测基准走向产品防线
这套基准的直接价值,是把「幻觉很多」拆成可以处理的故障类型。
把它落到产品里,智能体至少需要三道检查。
生成之前先明确边界。适用法域要确认,任务范围要确认,能回答到什么程度也要确认。
在管辖权、时效或者程序路径不清楚的时候,不应该直接给出确定判断。
执行过程里,验证依据。检索结果要核对,引用来源要核对,关键事实和工具返回值也要核对。
一个中间结果不能只因为「看起来合理」,就被带进下一步。
输出之前,检查一致性。
结论与理由应当相互支撑。法源的效力要再对一遍。程序的期限要再对一遍。构成要件和救济路径也不能漏。
最终答案正确,也不能替代这一步。
更进一步,评测对象应当从一个模型扩展成「模型加工具加工作流」的整体。
系统怎么检索,什么时候反思,这些都是可靠性的一部分。中间状态怎么保留,什么条件下停下,同样是。
论文也提醒我们谨慎外推。
这套基准主要基于中国法律体系,并且集中在单智能体场景。
迁移到普通法体系时,或者面对多法域检索和多智能体协作时,法源权威性要重新定义。先例适用和程序规则也一样。
这套基准给智能体增加了一种更接近真实部署的评测方式。
不仅看最后答了什么,还要追踪答案是怎么形成的。
我们把法律任务交给智能体,图的是它能稳定干活。检索要稳。整理事实要稳。适用规则也要稳。
而不是让用户在事后逐条排查一条看似顺畅的推理链。
一个引用,一项期限判断,一次工具调用,都需要在进入下一步之前经得起核对。
「答对了,理由却错了」不只是一个评测现象。
它提醒我们,智能体的可信度不能由最终答案单独证明。
真正可靠的系统,要让错误更早暴露,也要让错误更难沿着执行链继续传播。
放到 AI办公 或者法务系统里看,这件事的分量更清楚。
宁可先把执行链上的每一步都留痕,也别等到出事之后再回头翻日志。
论文共同第一作者是周钰锦、郑明轩和曹楚雪。三人都是香港科技大学跨学科学院人工智能在读博士生。研究方向涵盖法律人工智能、大模型安全对齐和智能体。相关成果发表在国际顶级会议上。韩斯睿是香港科技大学助理教授,主要从事人工智能与法律科技的交叉研究。郭毅可是国际知名的计算机科学家,也是中国工程院外籍院士。
