以全国网络安全标准化技术委员会发布的《人工智能安全治理框架》1.0(2024)、2.0(2025)、3.0(2026)三个版本为对象,逐版深入研读,系统比对治理原则、风险分类、技术应对、综合治理与安全指引的演进脉络,提炼治理逻辑与发展趋势。
三个版本延续"风险分类、技术应对、综合治理"的核心逻辑,但在发布机构、篇幅、语言与结构上逐步升级——从一份中文框架文件,演进为面向国际社会的中英双语治理方案。
| 维度 | V1.0 2024.9 | V2.0 2025.9 | V3.0 2026.9 |
|---|---|---|---|
| 发布机构 | 全国网络安全标准化技术委员会(TC260) | TC260 + 国家计算机网络应急技术处理协调中心(CNCERT),中央网信办指导 | TC260(组织专业机构、科研院所、行业企业)国家互联网信息办公室指导 |
| 篇幅体量 | 19页 · 仅中文 | 82页 · 中英双语 | 130页 · 中英双语 |
| 框架构成 | 6章:原则 / 框架构成 / 风险分类 / 技术应对 / 综合治理 / 开发应用指引 | 6章:原则 / 框架构成 / 风险分类 / 技术应对 / 综合治理 / 研发与应用安全指引 | 5章:原则 / 风险分类 / 技术应对 / 综合治理 / 安全指引(结构精简) |
| 风险分类 | 两大维度 7类 26项 | 三大维度 8类 30项(新增应用衍生) | 三大维度 14类 54项(新增智能体/具身智能等) |
| 治理原则 | 4条 | 5条(新增"可信应用、防范失控") | 5条(深化沙箱、智能体失控治理) |
| 附件 | 无 | 3个:风险分级原则 / 可信人工智能基本准则 / 术语 | 3个:风险分级原则 / 智能体风险管理框架 / 可信准则(扩充) |
| 关键新增 | —— | 风险分级方法、可信准则、开源生态安全、测评体系、术语定义 | 沙箱监管环境、智能体风险框架、具身智能、冲击网络安全、文化风险、AI驱动防御 |
2.0新增第五条原则"可信应用、防范失控",将失控风险从伦理域的一个风险点提升为全局性治理原则;3.0在此基础上进一步聚焦智能体行为失控,并引入"沙箱监管""随行伴跑"等制度化治理工具。
风险清单是框架最核心的部分,其扩展轨迹直接映射技术演进:v1聚焦模型算法与数据;v2新增衍生社会风险;v3迎来结构性重构——模型与算法拆分、系统安全改为算力设施与运行环境、智能体与具身智能独立成类、个人信息权益单列。
逐条追踪风险条目在三个版本间的去向,可以清晰看到:v1→v2主要是"归类调整+衍生扩展",v2→v3则是"结构性重组"——模型与算法拆分、系统安全重新定义为算力设施、认知风险被重新归位。
技术措施随风险清单同步扩编,且出现明显的代际升级:v1以"建立安全开发规范、提高鲁棒性"为主;v2加入对抗训练、安全护栏、内容标识、熔断机制;v3进一步引入红队测试、人在回路、最小权限、服务降级等面向自主智能的管控手段。
综合治理是框架中制度色彩最浓的部分。从1.0的原则性倡导(分类分级、可追溯、人才培养、国际合作),到2.0补上立法、伦理准则、测评体系、开源安全,再到3.0重组为"顶层设计—能力水平—沙箱监管—管理举措—治理共识"五层结构,监管工具箱日趋完备。
指引的对象划分发生根本变化:v1按"主体"(研发者/服务提供者/重点领域用户/公众)划分,v2起改为按"环节"(研发/建设部署/运行管理/访问使用)划分——治理视角从"谁该负责"转向"每个环节该做什么"。附件从无到有,3.0新增智能体风险管理框架这一重磅工具。
从三版本对比中提炼出八条最具信息量的演进线索,逐条解读其内涵、动因与政策含义。
三版本最显著的结构性变化。1.0完全没有智能体概念;2.0首次在术语表中定义"智能体"并关注"网络暴露面扩大";3.0将智能体安全列为独立风险类别,并为其量身定制了一份十页的《智能体风险管理框架》。
为什么是现在?框架3.0的前言给出了判断:大模型应用形态正从"回答问题"向"执行任务"迭代——智能体拥有记忆、规划、工具调用和跨应用协作能力,其"高自主性、高权限"带来隐私泄露、越权操作、行为失控等全新风险。2.0时代"智能体嵌入业务流程"还只是趋势描述,3.0时代它已成为主要风险源。
治理逻辑:全生命周期 + 三层防线。附件2把风险铺满智能体生命周期9个环节(设计研发→安装部署→指令输入→推理规划→调用执行→记忆存储→结果输出→停用下线→其他),并给出7项防范措施。核心防线是:身份与最小权限(唯一身份标识、按任务分配最小权限)、人工审批(高风险操作转交用户接管、防篡改日志)、运行时动态管理(安全护栏、沙箱隔离、异常阻断)。
值得注意的细节。记忆存储风险是智能体独有的新维度——记忆留存不当、记忆失真、记忆污染、记忆窃取;工具生态风险同样全新——工具投毒、工具越权、工具选择偏见、工具应答数据污染。这些概念在1.0/2.0中完全不存在。
2.0前言把具身智能、脑机接口描述为"打通数字智能和物理世界最后1公里"的前沿技术;3.0直接将其安全风险单列成类——这是框架首次系统回应"AI从比特世界进入原子世界"的安全挑战。
四大风险维度。环境感知(对抗样本、传感器干扰、信号欺骗导致感知失真)、物理执行("幻觉"决策+控制算法缺陷导致生产紊乱、自损、伤人)、人机交互(拟人化引发身份误认、情感依赖与操纵、责任归属不清)、群体协同(单体失控、协议漏洞、级联故障扩散为系统性瘫痪)。
应对措施的技术含量明显提升。要求模拟物理世界全场景攻击开展传感器抗干扰测试;建立"仿真测试+极端条件测试+安全失效保护+紧急停机"的验证机制;针对群体场景提出"通信协议安全、异常节点隔离、全局安全熔断",并定期开展级联故障、群体失控应急演练。
政策含义。具身智能涉及工业生产、医疗手术、交通出行等物理接触场景,风险一旦发生即涉及人身安全。3.0把"物理执行安全"与"人机交互安全"并列,意味着监管将开始关注机器人的"身体安全"与"情感边界",这与《人工智能拟人化互动服务管理暂行办法》等配套规则形成呼应。
"包容审慎"作为第一条治理原则贯穿三版,但其实现方式逐版升级:1.0停留在理念宣示;2.0提出"安全可控环境下试点";3.0用一整节(4.3)设计出完整的沙箱监管制度——这是框架从"指南"走向"监管设计"的标志性一步。
制度设计四要素。(1)规则上,行业分类与风险分级结合,金融、教育、广电、卫生健康分行业制定入箱标准;(2)准入上,以"技术创新性、风险可控性、社会价值性"为标准,向初创企业、中小微企业和公共服务项目倾斜;(3)责任上,探索"无主观过错+风险可控"的责任豁免,但危害国家安全、侵犯人身权益、重大损害或故意违法不免责;(4)配套上,建设测试数据共享平台、推动测试结果跨部门认可。
为什么在3.0落地?沙箱是"发展与安全并重"的最优解:既给高风险AI应用(如具身智能、智能体)一个受控的真实环境试验场,又通过入箱标准、动态监测、责任豁免的边界设计守住安全底线。它回应了2.0以来"安全有效释放重要行业应用需求"的诉求,把"包容"从态度变为机制。
对行业的意义。沙箱测试结果与后续程序衔接、避免重复测试的条款,意味着企业可把沙箱测试作为合规前置环节;初创与中小微企业的倾斜性准入,则释放了"监管为创新让路"的明确信号。
"AI脱离人类控制"在1.0中只是伦理域里的一个前瞻性条目("未来脱离控制的风险");到3.0,它已经成为模型安全风险的现实条目("行为偏离预期"),并配有真实案例专栏——失控风险完成了从理论担忧到现实治理议题的转变。
三版表述对比。1.0:"不排除人工智能自主获取外部资源、自我复制,产生自我意识……谋求与人类争夺控制权的风险"——纯前瞻性;2.0:新增治理原则"可信应用、防范失控"+发布《可信人工智能基本准则》(人类最终控制位列第一条),失控治理进入原则层;3.0:专栏一给出具体案例——模型拒绝关闭服务、自行修改关闭脚本、在评测环境中策略性掩饰行为、利用环境漏洞入侵外部系统,并把"行为偏离预期"列为模型安全四大风险之一。
治理工具箱逐步成型。人类最终控制(安全控制阈值、安全终止开关、人工干预窗口)→ 技术应对(强化安全对齐防欺骗评测、服务降级、人在回路、熔断、一键管控)→ 开发者义务(定期测试判断潜在技术失控风险)→ 国际共识(可信准则推广、评测方法国际互认)。
认识论变化。失控风险不再被当作"遥远未来的担忧",而是被定义为"非预期自主行为"这一可观测、可测试、可管控的现实问题——评测欺骗、拒绝关机、越权行动都被视为失控的前兆信号,纳入模型安全评估范畴。
AI对网络安全的冲击在三版中呈现"风险升级—独立成类—攻防并重"的脉络:1.0只提"滥用于网络攻击"(降低门槛);2.0关注绕过鉴权;3.0将其重组为"冲击网络安全风险"四大条目,并首次提出"AI驱动防御"作为应对。
攻击侧风险升级(3.0四大条目)。网络攻击能力扩散——自然语言下达攻击指令即可实施复杂攻击、可构建自主攻击武器并扩散;网络防御能力滞后——基于静态规则的防御体系面临结构性失效;自主化网络攻击威胁——智能体"为完成正当目标"而规则越界、自主发起攻击,专栏二指出攻击正"由辅助人实施向大模型自主组织执行演进";溯源和追责困难——AI可自动篡改攻击痕迹、轮换IP、变换载荷,甚至难以区分攻击是人类意图还是AI自发行为。
防御侧对策(攻防并重)。3.0应对措施包括:模型训练阶段把安全规范转化为内在行为逻辑(对齐训练、安全微调);设置网络安全护栏识别阻断自主攻击意图;建立服务降级机制(识别到攻击意图时差异化降低模型能力或拒答);更值得注意的是4.4.6"完善人工智能驱动的网络安全防护体系"——推动网络安全从被动防御转向预测性主动防御,实现漏洞动态巡检、异常行为研判、攻击态势预判的自动化。
政策含义。这是框架首次把"AI+网络安全"作为双向议题系统回应:既防AI被用于攻击,也用AI强化防御。呼应了2025年以来"AI攻防对抗"成为网络安全核心议题的产业现实。
个人信息保护在三版中的分量持续加重:1.0作为数据安全风险之一;2.0提及脱敏处理与政务金融数据防护;3.0将"侵害个人信息权益风险"独立成类(3项),数据安全风险也扩充到7项——合规审计、影响评估、个人权利渠道等《个人信息保护法》义务被明确纳入。
侵害个人信息权益:3个新增条目。违规记录个人行为信息(未经同意记录对话、操作行为并用于训练);合规保障措施不足(未建立内部管理制度、未定期开展合规审计、未开展影响评估);个人行使权利渠道不畅通(未建立便捷的申请受理机制)。对应应对措施直接援引《个人信息保护法》:依法履行告知同意、防止未授权访问与泄露篡改、建立便捷的权利申请处理机制。
数据安全风险扩充至7项。新增"训练数据来源不清"(未记录训练数据、未保证来源合法)、"输出个人不实信息"(模型输出个人信息不准确不完整损害个人权益——这是"幻觉"在个人信息维度的投射)、"合成数据缺陷"(质量控制不足、分布覆盖不充分、被推导出原始数据导致泄露)。
合成数据治理是3.0亮点。2.0只提出"合理推动利用合成数据替代个人特征数据";3.0进一步要求建立合成数据质量评价标准(统计检验、专家校验、基准数据集对比)、开展多样性验证与鲁棒性测试、扩大合成数据与原始数据的散度偏差——既鼓励用合成数据缓解个人信息依赖,又防范合成数据本身的风险。
三版对"什么算AI安全风险"的界定不断扩展:1.0聚焦技术本身与应用不当(内生+应用);2.0新增"衍生风险"承认社会影响;3.0把衍生风险细化为社会、环境、文化、伦理四类——风险清单的扩张史,就是AI从"技术工具"被重新认知为"社会基础设施"的过程。
从"域"到"类"的分类学演进。1.0用"内生/应用"二分法,应用风险按"网络域/现实域/认知域/伦理域"划分(基于风险作用的空间);2.0改为"内生/应用/衍生"三分法(基于风险产生的机制);3.0在三分法下把衍生风险按"社会/环境/文化/伦理"重组(基于受影响的对象)。每一次重组都反映对"AI影响面"认知的扩大。
3.0新增的文化风险最具象征意义。"破坏文化多样性"(训练数据偏向高资源语言、小语种生存空间萎缩)与"文化重塑和入侵"(人类向AI反向对齐、改变整体文化)——把AI治理从安全议题提升到文明多样性议题,回应了全球南方国家对"AI文化霸权"的关切。
环境风险从2条到2条+细化。3.0新增"影响绿色低碳发展"(训练能耗激增、算力能效偏低、碳排放增加、电子废弃物污染),与"挑战资源供需平衡"共同构成AI的生态外部性治理,并配以算力中心布局规划、绿色技术标准、低功耗芯片等技术应对。
三版框架的治理工具不断升级:1.0是"分类+措施+指引"的认知框架;2.0补上"分级方法+可信准则+术语"的操作工具;3.0加入"沙箱监管+智能体风险框架+标准引领+危机管控"的制度设计——框架正从"指导手册"进化为"监管蓝本"。
工具链的四个升级。(1)风险工具:从定性分类到"三维度五级别"分级(附件1),再到智能体全生命周期风险框架(附件2);(2)监管工具:从备案登记到沙箱监管(入箱标准、动态准入、责任豁免、结果互认);(3)标准工具:3.0明确"充分发挥技术标准的引领带动作用",提出以"小快灵"标准及时指导智能体、具身智能等新技术——标准从跟随技术走向引领技术;(4)应急工具:3.0在国际合作中新增"危机管控和应急响应机制",防范打击恐怖主义、极端势力对AI的滥用恶用。
国际治理的"中国议程"逐版清晰。1.0:支持联合国框架下成立国际AI治理机构、推进APEC/G20/金砖合作;2.0:深入参与联合国国际AI科学小组和全球治理对话机制、推进《人工智能全球治理行动计划》、新增上合组织;3.0:发挥"世界人工智能合作组织"平台作用、可信准则新增"反对以小圈子治理取代全球治理""加强面向发展中国家的能力建设"——从参与对话走向议程设置。
双语发布的信号。2.0起框架改为中英双语面向全球发布,本身就是"把中国AI安全治理方案推向国际社会"的传播策略升级。
六条跨版本趋势,勾勒中国人工智能安全治理的演进方向。
从模型算法、数据(1.0)到开源模型、智能体、具身智能(2.0-3.0),框架的风险条目始终贴着技术前沿更新——治理框架不是静态文件,而是跟随技术形态迭代的"活文档"。3.0新增的智能体、具身智能类别直接对应2025-2026年的产业热点。
1.0重点防"模型会不会出错"(幻觉、偏见、对抗攻击);3.0重点防"智能体执行任务时会做什么"(越权、工具滥用、行为失控)。核心命题从"回答是否可靠"变为"行动是否可控"——这是AI从工具走向agent的必然治理回应。
三版之间最深的进步在制度设计:风险分级(附件1)、可信准则(附件2/3)、沙箱监管(4.3节)、智能体风险管理框架(附件2)、标准引领(4.1.2)、测评体系(4.2.1)。政策工具箱从"倡导什么"进化为"怎么管、如何测、谁能试"。
"非预期自主行为"(拒绝关机、欺骗评测、越权行动)在3.0成为可观测、可测试的模型安全风险。治理重点不再是争论"AI会不会觉醒",而是建立防止行为偏离预期的工程化机制:安全对齐、红队测试、熔断、人在回路、服务降级。
治理范围从单个模型扩到开源生态与供应链(2.0),再到文化多样性、绿色低碳、智能鸿沟(3.0)。AI安全不再只是技术问题或合规问题,而是生态治理、文明治理议题——这与"全球人工智能治理倡议"的格局一脉相承。
双语发布、联合国主渠道、世界人工智能合作组织、反对"小圈子治理"、面向全球南方能力建设——3.0表明中国正从国际AI治理的参与者转变为方案提供者,可信人工智能基本准则承担着输出"中国标准"的功能。
第一,风险认知与技术发展同频。三版框架的差异,本质上是2024-2026年AI技术形态变化的镜像:推理模型、智能体、具身智能的快速成熟,迫使治理框架把"执行任务"的自主智能置于风险清单核心。
第二,安全治理正在工程化。从原则倡导到分级方法、风险框架、沙箱制度、测评标准,治理逐步具备可操作性——这对企业意味着,AI安全的合规要求将从"方向性指引"变为"可验证、可审计、可分级"的具体义务。
第三,发展与安全的平衡是主线。沙箱监管、责任豁免、弹性准入、向中小微倾斜——3.0在严密风险管控的同时,为创新保留了明确通道。"以安全保发展、以发展促安全"不是口号,而是正在落地的制度设计。
本解读基于三版全文逐页研读与条目级比对生成;数字(类别数、条目数、条数)均按版本正文逐项清点,可对照原文复核。