AI Agent 安全不能只靠 Prompt 了:上海 AI Lab 探索 Agent 安全进化新范式
1 小时前

大模型Agent在接入多系统后,仅依赖最终回复的安全评估方式存在覆盖面不足的问题,因为风险可能出现在执行过程中的任何一个环节,且安全修复面临诸多挑战。为此,上海人工智能实验室联合多所高校推出了SHE与SafeEvolve两项创新工作,引领Agent安全向三步演进。SHE将安全框架拆解为四类组件,从完整执行轨迹中诊断风险,并针对性地更新组件。实验表明,SHE能有效降低攻击成功率,提升任务可用性,且其安全边界具有可迁移性。SafeEvolve则更进一步,将安全框架的经验转化为Policy模型的决策能力,通过提炼Safety Prompt和构建分层SkillBank,分两阶段训练模型。实验结果显示,SafeEvolve能显著降低攻击成功率,提升任务效用。这两项工作实现了从静态安全配置到轨迹驱动的持续更新、从整体式规则到组件级责任划分、从单独更新安全框架到安全框架与Policy模型协同演化的转变,使安全成为一种可根据执行经验持续修订的系统能力。

简体中文 English