答对了,理由却错了:港科大给法律智能体的幻觉画了张地图

一个看起来完全正确的答案

让智能体分析一起法律案件。它会检索法规,整理事实,列出理由,最后给出一个很像样的答案。

问题可能出在更早的一步。

它引用了错误的法源。算错了程序期限。或者误解了工具返回的内容。

推理越流畅,这个错误反而越容易被最终答案遮住。

法律大模型正在从单轮 AI对话 走向智能体。

系统不再只是生成一段文字。它会规划任务。它会调用检索工具。它还会读取材料,依据中间结果继续往下走。

人们把更多步骤交给模型。也就更难逐项确认,它到底看到了什么。为什么作出现在这个判断,同样难查。

一次幻觉,开始有了跨步骤的后果。

香港科技大学的研究团队把目光放在了这条执行链上。他们做出了一套智能体幻觉评测基准,简称 LexAgentHallu。

它把观察对象从最终答案扩展到完整轨迹,并且把错误定位到具体步骤。

出发点很直接。

当一个智能体说「依据已经找到」,或者说「规则适用于当前事实」时,评测就不能只看结论。结论对不对只是第一层。

它还要检查支撑结论的理由是不是真实,是不是准确,是不是前后一致。

这套基准针对的是法律这类高风险场景里的 AI工具。

论文首页截图,标题为 LexAgentHallu 分层基准

论文地址:https://arxiv.org/abs/2609.09754

过去评测法律大模型,最常见的做法是给一道题,再检查最终答案对不对。

到了智能体场景,同一个错误还要继续往下追。它影响了哪些检索,哪些引用,哪些判断,都要看清楚。

把一条法规的名称写错,可能只留下一个文本错误。

把已经失效的规定当成现行法,后果更重。它可能改变后面的规则选择。事实适用和救济建议也会跟着变。

智能体的风险因此不只来自「编造」。

它也可能找到真实材料,却把材料用错。它调用了正确工具,却填写了错误参数。它看到了相关结果,却误读了结果所支持的范围。

一次幻觉,不再只是错误文本,而可能成为下一步法律判断的前提。

所以这套基准不把最终答案当成唯一评测对象。

它沿着执行轨迹逐步检查。系统如何规划。调用了什么工具。读到了什么结果。保留了哪些信息。又是怎样把事实与规则连接起来的。

幻觉究竟藏在哪里

研究团队建立了一套双层分类体系。

第一层关注法律内容本身。法源对不对,法律原则对不对,程序规则对不对,事实适用对不对,都算这一层。

第二层关注智能体自己的执行过程。规划与推理算一类。记忆算一类。工具调用和对观察结果的理解也算一类。

两层合计包含 7 个中层类别和 27 个细粒度子类。

这套分类的目的不是给错误换一组名称,而是让问题能够被定位。

法源伪造要核验引用。事实与规则错配要重新检查要件。工具参数错误要约束调用接口。记忆偏移则指向上下文管理。

基准的构建围绕「难例」和「可核验」两件事展开。

研究团队从多类法律任务里收集数据,先过滤掉容易样本。再由有法律训练背景的标注者核对答案、法源和推理轨迹,最后完成幻觉分类与专家复核。

基准的四阶段构建流程图

最终,这套基准收录了 3414 个实例,覆盖 17 个法律类别和 6 类任务。

它不只回答「系统错了多少」。它还想说明错误发生在哪里,属于哪一类。以及这个错误有没有可能继续污染后面的步骤。

论文评测了 18 种智能体配置,闭源的、开源的都在内。

结果显示,高幻觉率并不是个别系统的边缘现象。

即使表现最好的那套配置,也仍有 89% 的执行轨迹至少出现过一次幻觉。所有系统在法律内容层面的幻觉频率,都不低于 87.5%。

这组结果并不等于说,所有法律回答都有同样风险。

它说明的是,在这套评测里,当前系统很难从头到尾保持一条干净的推理链。这条链既要干净,也要能被核验。

模型怎么选,工具怎么接,流程怎么编排,都会改变错误的分布。

有一类循环式的做法很划算。模型行动一次,再观察一次。它在整体幻觉和法律内容幻觉上都更有优势。

法律专用的工作流,更擅长压低过程性错误。

先规划再执行的方式,在这套实验里没有表现出稳定领先。

所以部署智能体的时候,不能把模型单独评估。工具也要单独评估。流程同样算在里面。

更强的基础模型,仍可能在不合适的检索流程里放大错误。

较小的模型,也可能通过更明确的工具协议和过程约束,拿到更稳定的表现。

这里有一处取舍值得记下。与其去追一个分数更高的模型,不如先把检索流程和工具协议理清楚。

答案对了,理由为什么仍然不可信

论文提出了一个很直观的指标,缩写 RAWR。

它只看最终答案正确的那些样本,再去检查这些样本的轨迹里是不是仍然藏着幻觉。

结果显示,在答案正确的前提下,平均仍有 68% 的轨迹包含至少一种法律内容幻觉。37% 的轨迹包含至少一种过程幻觉。

答对但理由错的比例统计图

正确答案只能说明结论命中,不能证明推理链是干净的。

对法律咨询、合同审查和诉讼辅助这类应用来说,这一区别尤其关键。

用户需要的不只是一个看起来正确的句子,还需要一条能够追溯的理由链。

这条链要经得起核验,也要经得起反问。

如果系统只在输出端给出结论,引用和推理的质量却不暴露出来,错误就可能藏下去。它会在「答案正确」的表面下继续留存。

不同任务的幻觉频率并不均匀。

开放式任务最危险。链条越长风险越高。需要综合事实与规则的任务,同样容易暴露问题。

不同任务类型下的幻觉频率对比图

在任务类型上,判决分析的法律内容幻觉频率到了 1.00。

案例分析是 0.95。法律推理和法律咨询在高位。法律知识问答和判决预测也在高位。

过程性幻觉呈现出另一种排序。

判决分析到 0.83,判决预测是 0.71。

较短的输出并不必然安全。只要任务要求多步证据整合,规划和记忆就可能出问题。要判断期限,要适用规则,风险同样在。

真正决定风险的,不只是题目看起来有多难。

而是系统需要完成多长的一条映射链,从事实到规则,再到程序和结论。

任何一个环节发生偏移,后面的步骤都可能在错误前提上继续推进。

论文还分析了 27 个细粒度幻觉子类之间的共现关系。

结果显示,这些错误并不是随机散点,而会形成有结构的组合。

幻觉子类共现矩阵热力图

程序期限错误与救济路径错误的共现提升度达到 2.82。程序步骤错误与程序后果错误达到 2.59。

最强的跨组信号,出现在法源层级错误和法律立场混淆之间,提升度达到 7.07。

这意味着,很多看似分散的错误可能共享同一个上游原因。

法源层级一旦判断错误,后面的规则立场和事实适用就可能一起偏移。

程序时钟一旦算错,期限、步骤和救济路径也可能连续出问题。

对系统治理来说,高风险错误可以被当成早期信号。

一旦检测到法源层级异常,或者期限算错了,就该多查一遍。程序步骤跳了,同样该转人工复核。

而不是等到最终答案生成之后,再被动纠错。

从评测基准走向产品防线

这套基准的直接价值,是把「幻觉很多」拆成可以处理的故障类型。

把它落到产品里,智能体至少需要三道检查。

生成之前先明确边界。适用法域要确认,任务范围要确认,能回答到什么程度也要确认。

在管辖权、时效或者程序路径不清楚的时候,不应该直接给出确定判断。

执行过程里,验证依据。检索结果要核对,引用来源要核对,关键事实和工具返回值也要核对。

一个中间结果不能只因为「看起来合理」,就被带进下一步。

输出之前,检查一致性。

结论与理由应当相互支撑。法源的效力要再对一遍。程序的期限要再对一遍。构成要件和救济路径也不能漏。

最终答案正确,也不能替代这一步。

更进一步,评测对象应当从一个模型扩展成「模型加工具加工作流」的整体。

系统怎么检索,什么时候反思,这些都是可靠性的一部分。中间状态怎么保留,什么条件下停下,同样是。

论文也提醒我们谨慎外推。

这套基准主要基于中国法律体系,并且集中在单智能体场景。

迁移到普通法体系时,或者面对多法域检索和多智能体协作时,法源权威性要重新定义。先例适用和程序规则也一样。

这套基准给智能体增加了一种更接近真实部署的评测方式。

不仅看最后答了什么,还要追踪答案是怎么形成的。

我们把法律任务交给智能体,图的是它能稳定干活。检索要稳。整理事实要稳。适用规则也要稳。

而不是让用户在事后逐条排查一条看似顺畅的推理链。

一个引用,一项期限判断,一次工具调用,都需要在进入下一步之前经得起核对。

「答对了,理由却错了」不只是一个评测现象。

它提醒我们,智能体的可信度不能由最终答案单独证明。

真正可靠的系统,要让错误更早暴露,也要让错误更难沿着执行链继续传播。

放到 AI办公 或者法务系统里看,这件事的分量更清楚。

宁可先把执行链上的每一步都留痕,也别等到出事之后再回头翻日志。

论文共同第一作者是周钰锦、郑明轩和曹楚雪。三人都是香港科技大学跨学科学院人工智能在读博士生。研究方向涵盖法律人工智能、大模型安全对齐和智能体。相关成果发表在国际顶级会议上。韩斯睿是香港科技大学助理教授,主要从事人工智能与法律科技的交叉研究。郭毅可是国际知名的计算机科学家,也是中国工程院外籍院士。