核心看点
AICon深圳一场分享将焦点放在Agent安全:如何用系统控制论思路,把可能“越权、误判、失控”的智能体纳入可观察、可干预、可恢复的防御体系。
Agent通常指能调用工具、规划步骤并执行任务的AI系统。相比只回答问题的大模型,Agent会连接代码、数据库、浏览器或业务系统,因此安全风险不只来自模型输出,还来自执行链路。分享主题强调,防御不能只靠事后审计,而要在任务输入、策略规划、工具调用、结果反馈等环节建立闭环。
防御体系思路
系统控制论是一种研究系统如何通过反馈保持稳定的方法。放到Agent场景中,可理解为:先定义边界,再持续观测状态,发现偏差后及时纠偏。关键不只是“拦截危险指令”,而是让Agent的行为全过程可度量、可限制、可回滚。
这类体系通常会包含权限分级、工具白名单、行为监控、异常检测和人工接管等机制。例如,当Agent试图访问敏感数据、执行高风险操作,或连续偏离目标时,系统应能降级、暂停或触发审批。
行业点评
随着企业把Agent用于客服、研发、运维和办公自动化,安全设计正从“模型安全”扩展到“系统安全”。行业真正需要的不是更大胆的自治,而是可验证、可解释、可治理的自治能力。
