今年以来,OpenClaw等智能体产品爆火,标志着AI Agent从演示阶段真正走进生产环境。与只会生成内容的聊天机器人不同,Agent拥有了身份、思考和行动三样东西:它能调用工具、访问企业内部系统,甚至通过MCP协议接入内网获取能力。腾讯专家工程师、AI Agent安全负责人张栋在AICon直播交流中指出,安全的本质因此发生换轨——从防“内容对不对”,变成防“行为可不可控”,这是质的改变,不是量的增加。
攻击面也随之急剧放大。传统AI应用像一台自动售货机,输入输出固定,攻击面相对可控;而Agent像一名拿到公司工牌的新员工,会自己判断、自己找工具、自己在环境里操作。提示词注入也从“让模型说错话”升级为“让模型做错事”:有真实案例中,员工用Agent周期性总结邮件,黑客在邮件里藏了一行指令,让Agent忽略原任务、把公司财报和老板薪水单发出去,Agent就此被“夺舍”。任何一段自然语言,都可能让Agent去删库、转发数据甚至转账。
面对Agent日益增大的权限,很多企业把“人在回路”当作万能解药:凡是Agent的关键动作,都要弹窗让人确认。但现实是,有的Agent一天要弹两百次确认,人反而成了效率瓶颈。有专家坦言,自己用AI编程时嫌麻烦直接选“全部允许”,根本控制不了它在干什么——即便有确认环节,也是一个虚拟的回路。
百度智能云安全架构师林道正分享了一个更隐蔽的风险:Agent上下文被压缩后,前面的约束全部丢失,只剩下示例内容。曾有一个技能文件用真实上传地址做示例,上下文压缩后Agent竟把数据直接发到了那个示例网址——若攻击者把恶意地址伪装成示例,后果不堪设想。腾讯张栋因此提出一个反共识的判断:人在回路正在成为Agent安全里最大的“安慰剂”。弹窗越多,它越退化成“闭着眼睛点确认”,给了团队“我们很安全”的错觉,却没给真正的安全。
正确的做法,不是让人确认更多,而是只把最关键的决策留给人:改数据、对外发送、涉及花钱的高风险动作必须人工把关;其余操作交给可追溯、可拦截的自动策略。把人,只用在刀刃上。
安全方法论并不会因AI而改变,依然是三板斧:可视、可管、可追溯。第一步先看得见:上线第一个Agent前,先做资产盘点,理清它有哪些身份、能调哪些工具、能碰哪些数据、有几条对外通道,看不见风险面,防护优先级就是空话。
第二步收得住:权限一律从最小开始,能只读就别给写,能临时凭证就别给长期;工具要放进沙箱隔离,在工具前加一层网关做输入输出检查,必要时叠加防泄漏能力;同时准备一条保底策略——即使全部防御失效,也不能让Agent变成黑客为所欲为的地方。Cloudflare专家建议采用渐进式管理:先把最在意的点收敛到最低权限,上线后用日志和周期性复盘决定是否逐步放权,而不是一开始就追求一步到位。风险分级也很关键:低风险的查询、总结可以大胆放开,高风险动作必须强管控,且要让影响可回滚——有备份,出错也能恢复。
第三步留得下痕:输入、调用、产出全链路打日志。Agent的威胁不只来自外部,也来自内部,可审计本身就是最好的威慑,出了事能追到具体的人、具体的动作。责任上,业务团队是第一责任人,谁主推的业务谁负责,安全团队定规则和红线,最怕的是“人人有份、人人不管”的责任真空。
青海政企单位正陆续试点AI公文写作、智能问答、办公助手等应用,部分已具备Agent雏形。结合上述实践,建议把握四点:其一,先盘点再放开。上线前把Agent的身份、工具和数据权限清单化,坚持最小权限,能只读不写、能临时凭证不长设,防止发出去一把万能钥匙。其二,审批机制要设计而非堆砌。关键操作留人审,常规操作靠自动策略拦截与留痕,避免审批弹窗泛滥后流于形式。其三,全链路审计留痕,与等保2.0的访问控制、安全审计要求衔接,一旦出现问题可追溯到具体操作者。其四,选择已备案模型不等于万事大吉,本地部署开源模型也不天然更安全——内网边界、零信任和运行时监测,才是守住底线的关键。
© 2026 西宁惠康电子有限公司 | 青海·西宁