中国的智能体治理框架:对 AI 安全意味着什么

2026 05 20

本文与 Yilin Huang 合作,为 Project Synesis 撰写。Project Synesis 是一个多语言检索平台,帮助读者查找各国 AI 治理的一手政策文件。

要点

背景

本文面向不熟悉中国政策的读者,试图从这套新的智能体治理框架中理解中国如何看待风险,以及这对 AI 安全领域的研究者、从业者和资助方意味着什么。

2026 年 5 月 8 日,中国三个政府部门联合发布了《智能体规范应用与创新发展实施意见》。1 文件共三十八条,涵盖 AI 智能体系统的开发、部署与治理。“实施意见”2属于指导性文件,传递监管预期,本身并不直接设立可强制执行的法律义务。因此,一项要求被写入文件,说明政府有意推动它,并不保证它一定会落地。企业究竟需要做什么才算合规,取决于后续具有约束力的法规和技术标准。

文件将智能体定义为“具备自主感知、记忆、决策、交互与执行能力的智能系统”。3 这个定义很可能有意保留了较宽的范围,以衔接全国信安标委(TC260)4智能体安全报告中的分类:报告区分了“软智能体”5与“硬智能体”6,前者包括基于大语言模型的聊天机器人和编程助手,后者包括自动驾驶汽车和工业机器人。7 两类系统都被纳入,意味着网信办这份文件所覆盖的监管范围,比西方智能体安全研究通常关注的范围更广;后者主要研究基于大语言模型的智能体风险。

文件将智能体视为经济运行的基础设施,认为它将“深刻改变人类生产生活方式和社会治理模式”,8并将安全监管定位为规模化应用的前提条件。文件约一半的条款用于推动十九类应用场景的探索和研究。9 除了医疗、教育、金融等常见领域,还有几项值得注意:

这些安排共同指向一个方向:在国务院“人工智能+”行动的引导下,将智能体嵌入中国国家治理和经济运行的各项关键职能。

对委托—代理关系的不同理解

这套安全框架的出发点,会直接影响它能防范什么风险。文件主要依靠权限划分来保障安全:用户应保有知情权,并对智能体可以采取哪些行动拥有最终决定权。11 在这一思路下,安全风险主要是智能体越权行事,而不是它形成了用户并不希望它追求的目标。对于尚不具备较强暗中谋划能力(scheming)的系统,这套框架可以发挥作用。但随着系统能力增强,暗中追求偏离人类意图的目标会成为更突出的问题,单靠权限划分也就越来越不够。这正是西方 AI 控制研究(AI control)所关注的一类风险。

与强调决策权限的思路一致,文件优先提出可验证、可追溯的机制,以便追查越权行为。12 但“可验证”和“可追溯”具体指什么,尚未展开。在西方 AI 安全讨论中,“可验证”往往意味着借助可解释性工具检查模型的内部机制;这里则更可能指对可观察到的输出保留日志和审计记录。文件是否也意在要求前一种更深入的验证,要看 TC260 后续制定的技术标准。

作为对照,欧盟《AI 实践准则》将失控风险界定为:由于模型与人类目标不一致、具有自主性或主动抵抗,人类无法修改或关闭模型。这个定义明确考虑了一种情形:能力较强的系统表面服从,实际目标却与人类不一致。西方 AI 安全研究通常不只把智能体当作工具,而是同时考察它有能力做什么,以及它是否倾向于这样做。表面服从、欺骗性对齐(deceptive alignment)等失效方式,可能绕过基于授权范围的管控。面对窃取并外传模型权重、蓄意破坏、故意表现得能力不足(sandbagging),以及自行获取资源等行为,仅有可追溯性未必足以应对。

三类风险(第八至第十条)

文件对失控、滥用和内生安全风险有实质性的认识。这些概念与西方 AI 安全领域的用语有所重合,但不能由此认为双方采用了相同的概念框架:具体政策机制之间仍有值得注意的差别。

总体上,文件更多地把失控视为外部安全威胁,而非系统自身产生了偏离人类意图的目标。因此,这套框架更擅长应对外部恶意干扰;对于西方安全研究认为会随系统能力提升而日益突出的目标偏离问题,它的应对能力较弱。另一个值得注意的缺口是:TC260《人工智能安全治理框架》2.0 版13中已有的化学、生物、放射性与核风险(CBRN),并未出现在这里列举的滥用风险中;开发机构内部部署系统所带来的风险也没有被提及。

更关键的是,第八条提出的智能体安全评估体系尚未明确具体设计,西方的能力评估方法有机会在这里发挥作用。 文件有两处涉及评估:第八条的智能体安全评估体系,以及第十二条提出的第三方评估服务,后者要对智能体的功能、性能、质量和合规性开展独立测试。第八条尚未规定评估内容、方法或责任机构,因此为西方能力评估方法影响中国实践留下了直接的空间。最终体系究竟会同时评估能力与行为倾向,还是只测试可观察行为是否合规,将决定它能否发现隐蔽的失效方式。

两套机制都面临既有实践和制度结构带来的障碍。目前,中国对生成式 AI 模型的第三方评估,主要检查模型是否会输出违规内容;评估智能体则需要更深入地接触系统的技术细节。此外,被评估方对自身系统的了解,总会超过外部评估者能够独立核实的范围。这种信息差容易促使企业围绕可测量的指标做优化,而不是实现这些指标背后的安全目标。

因此,这些机制能否产生实效,取决于评估者是否真正获得了检查系统的权限,以及评估是否覆盖能力和行为倾向,而不只是检查行为输出。第八条尚待设计的安全评估体系,仍是西方能力评估方法影响中国实践最直接的切入点。

监管力度取决于部署场景的风险高低(第十一条)

第十一条提出分级治理:划分依据是智能体被部署在什么场景,而不是模型是否达到某个能力门槛,例如训练算力、通用能力水平,或是否被认定具有系统性风险。在敏感领域,国家网信办与行业主管部门将共同确定允许使用智能体的场景,并采取备案、安全测试和缺陷产品召回等措施。低风险领域则主要依靠行业自律。

这意味着合规标准很可能因行业而异,参与规则制定的主体也远不止前沿模型开发者。能源、金融和公共安全等领域的主管部门,都将参与制定本领域的智能体部署规则;各部门的风险容忍度、既有利益相关方和政治运作方式并不相同。参与行业标准制定的头部企业,既能影响合规要求的内容,也更容易提前准备,在证明自身合规时取得优势。

这套框架究竟能发挥多大作用,还有两个关键问题。第一,谁来划定敏感领域,“测试”又具体包含什么?希望尽快获得部署许可的企业,很可能会推动细则加速出台,因为实验室需要先明确监管要求,才能推出产品。第二,一旦行业标准落地、智能体开始按这些标准运行,修改标准的成本就可能很高,尤其是在要求持续稳定运行的关键基础设施中。后续标准不得不兼顾已经部署的系统,因此,能够实质性改变实践的新增安全要求,其引入窗口会逐渐收窄。

行动建议


  1. 文件名称:《智能体规范应用与创新发展实施意见》。 ↩︎

  2. “实施意见”对应英文 implementation opinions。 ↩︎

  3. 此处为文件对智能体的原文定义。 ↩︎

  4. TC260 即全国信息安全标准化技术委员会,是中国制定网络安全和 AI 安全标准的主要机构。其技术标准为这类宏观政策提供具体、有约束力的合规依据。 ↩︎

  5. 软智能体(soft agents)。 ↩︎

  6. 硬智能体(hard agents)。 ↩︎

  7. TC260-TR-005-2026,第 1.2 节表 3 及附录 C。 ↩︎

  8. 此处为文件原文表述。 ↩︎

  9. 涵盖科研、工业生产、能源、交通、农业、金融、消费、教育、医疗、公共管理、司法、公共安全、城市治理和采购等领域。 ↩︎

  10. “舆论引导”为文件原文用语。 ↩︎

  11. 第六条“明确决策权限”。 ↩︎

  12. 第七条“加强行为管控”明确要求建立“规则内嵌、行为围栏”等技术,以及“可验证、可追溯机制”。 ↩︎

  13. TC260 于 2025 年 9 月发布的《人工智能安全治理框架》2.0 版是一份范围更广的风险分类文件,其中包含本文所讨论的《实施意见》未提及的灾难性风险和 CBRN 风险。 ↩︎