国资监管智能化已成为新时代国企改革的重要命题,国务院国资委要求“加快提升国资监管智能化水平”,这一政策导向在管网集团的综合监督领域尤为迫切。在数字化转型背景下,开发大模型智能问答系统能够为管网系统的综合监督职能提供有力的数智技术支撑。从咨询服务角度,业务人员在开展业务过程中,往往不了解合规风险点、关键控制点,也不清楚如何合规开展业务以规避风险;在业务系统开发设计时,未能将风险管控手段嵌入系统,事前、事中未有效管控。借助大模型AI技术,监督系统能够通过智能问答等手段提升合规认知,自动获取在业务系统智能风险管控方面的有关建议。从监督履职角度,监督人员如果不能全面了解监督业务有关政策、文件、知识、流程、工作方法等,不了解业务有关上级要求、政策规定、领导讲话、工作要点、会议纪要等信息,将影响监督工作有效开展。大模型智能问答技术的快速帮助,能够大幅提升监督质量和效率。
但现有的智能问答大模型技术,在面对管网监督场景时仍面临以下挑战。
1.知识碎片化与更新滞后。监督与审计知识分散在合同、财务、招投标、项目管理等多个业务系统中,制度更新频繁,条款交叉复杂,人工检索难以保证完整性与时效性。
2.智能问答幻觉与结果不可验证。现有通用大模型虽然具备语言理解能力,但在缺乏领域知识支撑时容易生成事实错误或无法引用来源的内容,难以满足审计“可追溯、可验证”的刚性要求。
3.计算逻辑复杂与数值不可信。在预算执行率、资金拨付差异率、投资回报率等核心计算场景中,通用模型往往出现逻辑幻觉或估算式回答,削弱了审计结果的可信度。
针对上述问题,本文提出构建一套面向管网智能审计与监督融合场景的大模型智能问答系统,通过生成式人工智能技术实现知识自动聚合、语义理解与结果验证。
二、构建综合监督
大模型智能问答系统
综合监督大模型智能问答系统的基本流程如图1所示。这一模型将致力于提供更加精准、高效的智能化知识辅助,帮助用户迅速获取所需要的信息,从而显著提高工作效率和决策质量。具体而言,该系统的建设任务主要包括以下几个方面。
首先,要进行知识库的构建与检索增强工作。通过整合来自多个来源的监督数据,打造一个覆盖全面且内容丰富的领域知识库。同时,设计出一种高效而灵活的检索增强机制,以便更好地满足各种复杂多样的问答需求。这不仅要求系统能够快速准确地从海量信息中找到相关答案,还应具备一定的扩展性,以应对未来可能出现的新问题类型。
其次,在结果引用与语义匹配方面,需要进一步提高模型对提问者意图和上下文环境的理解程度,确保其能够依据实际情况生成高质量的回复。为此,需要运用自然语言处理技术,增强模型对文本深层含义的捕捉能力,并结合实际案例进行训练优化,使最终输出的答案既合乎逻辑,又贴合真实应用场景。
再次,针对监督领域中频繁出现的财务计算、统计比率等问题,系统需要学习如何在回答中生成计算指令而非直接“编造”结果,从而保证输出的数值结果具有可验证的准确性。
最后,还需明确不同使用场景下的智能问答功能需求。例如,支持语音输入或文字输入等多种交互方式,针对特定业务关注点如“最近发生了哪些故障?”“目前的风险等级如何?”等问题给予及时有效的回复。为了使信息呈现更加直观易懂,可将分析结果以图表、地图等形式进行可视化展示,以便非专业人士也能轻松理解其中蕴含的关键信息。
三、综合监督大模型
智能问答系统的关键技术
大模型用于监督智能问答场景的主要任务是与综合监督知识相关的问答。由于大模型在实际应用中存在幻觉问题,即使大模型具备了综合监督领域的知识和分析能力,也可能输出错误的答案。为满足综合监督领域对智能问答和文本生成的相关需求,本文引入了三项用于智能问答大模型的关键技术(如图2所示)。
1.面向综合监督领域智能问答的辅助知识库构建和大模型检索增强技术。将数据进行有效整合,构建综合监督领域知识库,并设计相适应的检索增强技术,使其能够应对不同咨询需求。
2.面向综合监督领域智能问答的结果引用技术。如何根据当前提问者的相关上下文及问题语义,引用最佳的回答,这是保证回答精准度需要进一步研究的关键技术。
3.面向计算类问题的结果可信性增强技术。在数值计算方面,大模型可能并未真正理解题目意图,而是生成一个看似正确的结果。因此,如何消除这部分的计算幻觉,是智能问答大模型研究的要点所在。
(一)基于向量数据库的检索增强生成
在执行智能问答时,现有的大模型技术往往面临幻觉问题。即使提示中包含相应知识性文本,模型也可能自己编造不符合相应知识的回答文本。在需要准确知识或者知识常常发生变动的场景下,通常使用检索增强生成(Retrieval-Augmented Generation,简称RAG)来引入相应的知识,如法律法规,工作指南等。为此,本文将RAG与大模型推理技术相结合,构建面向综合监督的向量数据库与关键词索引库,使得智能问答大模型在推理阶段能够适时地检索到恰当的支撑文本。基于向量知识库的检索增强生成设计框架如图3所示。整个流程包括面向文档的局部向量数据库构建、用户问题理解与分解、面向向量数据库的文本检索、基于检索文本的候选提示文本生成。
在综合监管业务中,各类规章制度、法律法规、工作手册等相关知识不断更新。因此,在智能问答大模型微调阶段,微调的内容可能存在不全面、未及时更新等问题。为解决这类知识更新问题,本项目采用向量知识库为智能问答大模型提供最新的数据和每个业务部门独有的内部知识库。向量数据库是一种专门用于存储、管理、查询、检索向量的数据库,它可以把复杂的非结构化数据通过向量化(Embedding)处理统一成多维空间里的坐标值。此外,由于每部法规或制度等文件块内容较为丰富,本文采用关键词抽取的方式从每个文本块中抽取一组关键词,并构建关键词—文档倒排索引结构。更进一步,将关键词和文本块分别向量化并存入向量数据库中。针对用户输入提问,提取关键词并对关键词和提问文本分别向量化为el,e2。基于向量el,e2与数据库中各向量之间相似度度量,从向量数据库中召回综合相似度最高的若干个文本作为候选提示文本。
(二)基于细粒度引用奖励的引用强化方法
管网智能审计涉及大量财务指标与逻辑计算,如资金差异比、投资回报率、预算执行率、合同履约进度等。然而,通用大语言模型在生成计算类结果时,往往出现“看似合理但错误”的计算幻觉,导致指标失真。例如,在回答“项目预算执行率是多少”时,模型可能直接“猜测”一个百分比,而非依据数据计算得出。这类错误在监督审计中将直接影响风险判断的准确性。在已构建的向量知识库中获取候选细粒度文本列表后,智能问答大模型需要将这些候选文本作为提示内容生成答案。为提高生成答案的质量,本文通过细粒度引用奖励算法来评估每个RAG结果的生成质量。
本文将从三个方面评价RAG结果的生成质量:回复准确率、引用召回率和引用准确率。针对每个方面分别训练奖励模型对回复进行打分,随后使用奖励模型进行拒绝采样和强化学习,以增强大模型的事实一致性。其中回复准确率通过回应中包含的关键信息片段的比例来衡量。每个问题都附带一个覆盖完整答案不同方面的短语或重要信息声明列表,称为关键信息列表。可使用精确字符串匹配(EM)或自然语言推理(Natural Language Inference,简称NLI)模型来推断列表中的每个项(子声明)是否被模型回应覆盖。对于列表中的每一项,如果它出现在回应中,则分配一个正向奖励;否则,分配一个负向奖励。然后,将所有列表项的奖励总和起来,得到整个回应的奖励。引用召回率定义为模型回应中可以通过相应引用段落支持的句子的百分比。使用NLI模型来确定每个句子是否由其引用段落得出。引用段落被视为前提,答案句子被视为假设。对于每个能由前提得出的句子,分配一个正向奖励;否则,分配一个负向奖励。因此,引用召回率在句子级别上计算。引用精确度指的是在回应中生成的引用能够支持句子的百分比。使用与引用召回率相同的NLI模型来推断每个引用段落是否对得出句子必要。对于每个“相关”的引用,分配一个正向奖励;否则,分配一个负向奖励。因此,引用精确度在引用级别上计算。通过三种不同粒度的奖励融合,可以训练大模型在生成答案时准确引用相应的知识,防止其在RAG过程中出现幻觉。
(三)基于自我提示的计算增强方法
为了让大模型更精准地计算,而非编造一个看似正确的结果。本项目通过大模型的自我提示,基于指令微调数据集构建计算器调用数据集,训练大模型在需要进行复杂计算时,调用计算器获得准确的答案。
该方法主要涉及以下几个步骤。生成计算器调用API Call:首先,针对综合监管数据中涉及复杂计算的部分,使用大模型的自我提示功能生成对应的计算器API调用指令。这一步骤通过分析综合监管任务中的计算需求,自动生成API调用的格式和参数,如表1所示,根据生成的API调用指令实际调用计算器,获得计算结果。其次,通过将这些结果与预期的准确结果进行比对,筛选出那些能够准确反映计算需求的API调用指令。最后,将这些验证通过的API调用指令加入大模型的训练数据集。这样,当未来大模型遇到类似的计算需求时,可以直接生成正确的API调用指令,通过外部计算器获得准确的计算结果。
四、综合监督大模型
智能问答系统的成效
综合监督大模型智能问答系统的构建与应用,显著提升了管网集团在监督业务中的智能化与自动化水平,具体成效体现在以下几个方面。
1.实现知识服务的智能化转型。
该系统通过构建覆盖巡视、审计、合同、招标、财务等多个业务领域的知识库,打破了信息孤岛,实现了知识的结构化存储与语义化检索。监督人员可通过自然语言问答方式快速获取法规政策、工作规范及案例指引,显著降低了信息查询和培训成本,推动监督知识服务从“人工解读”向“智能推送”转变。
2.显著提升监督业务处理效率与准确性。
借助RAG检索增强机制与细粒度引用奖励算法,模型能自动引用权威文本,生成准确、可追溯的回答。与传统人工检索相比,信息响应时间缩短,回答准确率提升,有效减少了监督执行中的信息偏差与判断失误。
3.增强智能问答的可信性与可解释性。
系统通过自我提示的计算增强方法,将复杂公式计算及财务指标分析外化为API调用,从而确保输出结果的可验证性。结合引用追踪与知识溯源机制,用户可查看模型回答的依据来源,实现了智能问答的“有据可查、可追可溯”。
综上,系统不仅优化了监督业务流程,也在制度学习、风险防控和决策支持等方面发挥了实质性作用,为国企监督体系提供了可持续的智能化支撑。
本文提出的面向综合监督领域的大模型智能问答系统,以生成式AI为核心驱动力,实现了综合监督知识的智能聚合、语义理解与动态响应,为国资监管体系的智能化转型提供了新的解决思路。该系统在知识管理、事实一致性、引用可信度及复杂计算处理等方面形成了一套可复用的技术体系,有效推动了监督业务从“数据驱动”向“知识驱动”的转变。
未来,随着多模态模型、图谱推理及自主学习等技术的进一步发展,本系统将继续向知识图谱联动、语音问答协同、风险智能预警等方向拓展,构建全链条、全周期、全要素的智能监督框架,为国家能源企业实现数字化、智能化监督治理提供坚实支撑和可持续发展路径。
文章摘自《中国内部审计》杂志2026年第1期
作者:张媛 王若琳 陈炳宇
单位:国家石油天然气管网集团有限公司 北京智网数科技术有限公司
编辑:孙哲
