中国的智能体治理框架:对 AI 安全意味着什么
2026 05 20
本文与 Yilin Huang 合作,为 Project Synesis 撰写。Project Synesis 是一个多语言检索平台,帮助读者查找各国 AI 治理的一手政策文件。
要点
- 中国政府发布的《智能体规范应用与创新发展实施意见》首次在一份重要政府文件中,将智能体(AI agents)与模型区分开来,专门对智能体作出监管安排,先于美国和欧盟的同类举措。
- 这个信号值得西方 AI 安全研究者关注:中国已经开始搭建智能体治理所需的制度,包括安全评估体系和分行业的合规要求。接下来几个月的具体设计,将决定这些政策能否真正落实 AI 安全目标。现在仍是参与并影响设计的窗口期。
- 文件中的一些用语与西方 AI 安全研究中的概念相近,但其核心思路是划定决策权限,这可能遗漏隐蔽的失效方式。
- 智能体正在进入电网、金融系统、公共安全和司法程序等关键领域。这些敏感领域的规则将由国家网信办与行业主管部门共同制定。
- 中国提出的智能体身份登记和互联协议如果落地,将成为一套先行的基础设施,为全球提供先例。
- 总体而言,这份文件展现了推进监管的意愿,也勾勒出了合规框架,值得对后续发展持谨慎乐观态度。AI 安全领域的研究者和从业者可以预期,中国近期还会将监管扩展到更多 AI 领域。
- 随着未来几个月细则逐步明确,有三个问题尤其值得关注:
- 第十一条针对敏感领域提出的“测试”,具体测什么?是否包括 AI 安全测试?
- 第十二条的第三方评估,能否让评估者获得深入检查系统所需的技术访问权限?
- 全国信安标委(TC260)制定的、有约束力的智能体安全标准,最终会提出哪些要求?
- 关于如何据此采取行动,见行动建议。
- 我们将在未来几个月发布后续文章,梳理由这份文件衍生出的具体监管规定。
背景
本文面向不熟悉中国政策的读者,试图从这套新的智能体治理框架中理解中国如何看待风险,以及这对 AI 安全领域的研究者、从业者和资助方意味着什么。
2026 年 5 月 8 日,中国三个政府部门联合发布了《智能体规范应用与创新发展实施意见》。1 文件共三十八条,涵盖 AI 智能体系统的开发、部署与治理。“实施意见”2属于指导性文件,传递监管预期,本身并不直接设立可强制执行的法律义务。因此,一项要求被写入文件,说明政府有意推动它,并不保证它一定会落地。企业究竟需要做什么才算合规,取决于后续具有约束力的法规和技术标准。
文件将智能体定义为“具备自主感知、记忆、决策、交互与执行能力的智能系统”。3 这个定义很可能有意保留了较宽的范围,以衔接全国信安标委(TC260)4智能体安全报告中的分类:报告区分了“软智能体”5与“硬智能体”6,前者包括基于大语言模型的聊天机器人和编程助手,后者包括自动驾驶汽车和工业机器人。7 两类系统都被纳入,意味着网信办这份文件所覆盖的监管范围,比西方智能体安全研究通常关注的范围更广;后者主要研究基于大语言模型的智能体风险。
文件将智能体视为经济运行的基础设施,认为它将“深刻改变人类生产生活方式和社会治理模式”,8并将安全监管定位为规模化应用的前提条件。文件约一半的条款用于推动十九类应用场景的探索和研究。9 除了医疗、教育、金融等常见领域,还有几项值得注意:
- 电力调度与电网运维(第十八条)
- 公共安全监测、预警,以及用于抢险救灾和危险品处置的具身智能体(第三十一条)
- 包括舆论引导10和情绪调节在内的信息服务(第二十八条)
这些安排共同指向一个方向:在国务院“人工智能+”行动的引导下,将智能体嵌入中国国家治理和经济运行的各项关键职能。
对委托—代理关系的不同理解
这套安全框架的出发点,会直接影响它能防范什么风险。文件主要依靠权限划分来保障安全:用户应保有知情权,并对智能体可以采取哪些行动拥有最终决定权。11 在这一思路下,安全风险主要是智能体越权行事,而不是它形成了用户并不希望它追求的目标。对于尚不具备较强暗中谋划能力(scheming)的系统,这套框架可以发挥作用。但随着系统能力增强,暗中追求偏离人类意图的目标会成为更突出的问题,单靠权限划分也就越来越不够。这正是西方 AI 控制研究(AI control)所关注的一类风险。
与强调决策权限的思路一致,文件优先提出可验证、可追溯的机制,以便追查越权行为。12 但“可验证”和“可追溯”具体指什么,尚未展开。在西方 AI 安全讨论中,“可验证”往往意味着借助可解释性工具检查模型的内部机制;这里则更可能指对可观察到的输出保留日志和审计记录。文件是否也意在要求前一种更深入的验证,要看 TC260 后续制定的技术标准。
作为对照,欧盟《AI 实践准则》将失控风险界定为:由于模型与人类目标不一致、具有自主性或主动抵抗,人类无法修改或关闭模型。这个定义明确考虑了一种情形:能力较强的系统表面服从,实际目标却与人类不一致。西方 AI 安全研究通常不只把智能体当作工具,而是同时考察它有能力做什么,以及它是否倾向于这样做。表面服从、欺骗性对齐(deceptive alignment)等失效方式,可能绕过基于授权范围的管控。面对窃取并外传模型权重、蓄意破坏、故意表现得能力不足(sandbagging),以及自行获取资源等行为,仅有可追溯性未必足以应对。
三类风险(第八至第十条)
文件对失控、滥用和内生安全风险有实质性的认识。这些概念与西方 AI 安全领域的用语有所重合,但不能由此认为双方采用了相同的概念框架:具体政策机制之间仍有值得注意的差别。
- 第八条“提升内生安全能力”提到运行失控、数据投毒、算法篡改和系统漏洞。
- 第九条“加强供应链安全”要求加强模型接入、API 调用和工具扩展等环节的安全管理。
- 第十条“化解应用衍生风险”列出了需要防范的违法用途,包括自动化攻击、侵犯隐私、虚假信息生成与传播,以及网络诈骗。
总体上,文件更多地把失控视为外部安全威胁,而非系统自身产生了偏离人类意图的目标。因此,这套框架更擅长应对外部恶意干扰;对于西方安全研究认为会随系统能力提升而日益突出的目标偏离问题,它的应对能力较弱。另一个值得注意的缺口是:TC260《人工智能安全治理框架》2.0 版13中已有的化学、生物、放射性与核风险(CBRN),并未出现在这里列举的滥用风险中;开发机构内部部署系统所带来的风险也没有被提及。
更关键的是,第八条提出的智能体安全评估体系尚未明确具体设计,西方的能力评估方法有机会在这里发挥作用。 文件有两处涉及评估:第八条的智能体安全评估体系,以及第十二条提出的第三方评估服务,后者要对智能体的功能、性能、质量和合规性开展独立测试。第八条尚未规定评估内容、方法或责任机构,因此为西方能力评估方法影响中国实践留下了直接的空间。最终体系究竟会同时评估能力与行为倾向,还是只测试可观察行为是否合规,将决定它能否发现隐蔽的失效方式。
两套机制都面临既有实践和制度结构带来的障碍。目前,中国对生成式 AI 模型的第三方评估,主要检查模型是否会输出违规内容;评估智能体则需要更深入地接触系统的技术细节。此外,被评估方对自身系统的了解,总会超过外部评估者能够独立核实的范围。这种信息差容易促使企业围绕可测量的指标做优化,而不是实现这些指标背后的安全目标。
因此,这些机制能否产生实效,取决于评估者是否真正获得了检查系统的权限,以及评估是否覆盖能力和行为倾向,而不只是检查行为输出。第八条尚待设计的安全评估体系,仍是西方能力评估方法影响中国实践最直接的切入点。
监管力度取决于部署场景的风险高低(第十一条)
第十一条提出分级治理:划分依据是智能体被部署在什么场景,而不是模型是否达到某个能力门槛,例如训练算力、通用能力水平,或是否被认定具有系统性风险。在敏感领域,国家网信办与行业主管部门将共同确定允许使用智能体的场景,并采取备案、安全测试和缺陷产品召回等措施。低风险领域则主要依靠行业自律。
这意味着合规标准很可能因行业而异,参与规则制定的主体也远不止前沿模型开发者。能源、金融和公共安全等领域的主管部门,都将参与制定本领域的智能体部署规则;各部门的风险容忍度、既有利益相关方和政治运作方式并不相同。参与行业标准制定的头部企业,既能影响合规要求的内容,也更容易提前准备,在证明自身合规时取得优势。
这套框架究竟能发挥多大作用,还有两个关键问题。第一,谁来划定敏感领域,“测试”又具体包含什么?希望尽快获得部署许可的企业,很可能会推动细则加速出台,因为实验室需要先明确监管要求,才能推出产品。第二,一旦行业标准落地、智能体开始按这些标准运行,修改标准的成本就可能很高,尤其是在要求持续稳定运行的关键基础设施中。后续标准不得不兼顾已经部署的系统,因此,能够实质性改变实践的新增安全要求,其引入窗口会逐渐收窄。
行动建议
- AI 治理研究者应跟进 TC260 的标准制定过程,观察这份意见如何转化为具体要求。目前正在制定的智能体安全标准,将决定企业实际需要满足哪些合规条件。
- 关注第十一条中敏感领域测试要求的细化,这可能在几个月内完成。核心问题是:这些测试是否涵盖 AI 安全?Kyle Chan、Paul Triolo、Zilan Qian 和 Poe Zhao 都值得关注,他们对相关进展的报道较为及时,但观点各有不同,宜相互参照。若想获得更深入、分析脉络也更连贯的背景材料,可以参考 IAPS 的中国研究。
- AI 控制研究者应关注智能体进入关键领域的情况,具体可见第十八条和第二十九至第三十一条。这些领域中出现的早期风险信号,有助于判断治理机制在实践中是否有效。
- 第十二条的第三方评估机制和第八条的安全评估体系都还在设计中。具备能力评估经验的研究者和从业者,可以直接向 Concordia 和 Safe AI Forum 确认,它们目前是否在参与中国的评估方法研究;如果是,这两家机构就是合适的合作切入点。
- 中国提出的智能体互联协议,是全球智能体身份标准领域的先行基础设施。美国国家标准与技术研究院(NIST)直到 2026 年 2 月才启动同类项目,因此目前仍有参与和影响标准的空间。
- 资助方和推动 AI 安全领域建设的人,应小幅上调对中国监管意愿的判断。这份文件表明,继续投入面向中国的 AI 安全治理工作是有理由的。
文件名称:《智能体规范应用与创新发展实施意见》。 ↩︎
“实施意见”对应英文 implementation opinions。 ↩︎
此处为文件对智能体的原文定义。 ↩︎
TC260 即全国信息安全标准化技术委员会,是中国制定网络安全和 AI 安全标准的主要机构。其技术标准为这类宏观政策提供具体、有约束力的合规依据。 ↩︎
软智能体(soft agents)。 ↩︎
硬智能体(hard agents)。 ↩︎
TC260-TR-005-2026,第 1.2 节表 3 及附录 C。 ↩︎
此处为文件原文表述。 ↩︎
涵盖科研、工业生产、能源、交通、农业、金融、消费、教育、医疗、公共管理、司法、公共安全、城市治理和采购等领域。 ↩︎
“舆论引导”为文件原文用语。 ↩︎
第六条“明确决策权限”。 ↩︎
第七条“加强行为管控”明确要求建立“规则内嵌、行为围栏”等技术,以及“可验证、可追溯机制”。 ↩︎
TC260 于 2025 年 9 月发布的《人工智能安全治理框架》2.0 版是一份范围更广的风险分类文件,其中包含本文所讨论的《实施意见》未提及的灾难性风险和 CBRN 风险。 ↩︎