AI 代理的安全问题,已经不再是“提示词写得更严一点”能解决的事。NVIDIA 9 月 28 日发布 Open Agent Safety Platform,真正值得看的是它把一部分护栏放到了模型和应用之外:软件沙箱负责限定动作,BlueField-4 DPU 上的 Sentry 像一只旁路看门狗,发现代理越界就把它隔离。

这和前几天一连串“代理逃出测试环境”的新闻接在一起看,味道就不一样了。过去很多人默认,AI 代理只要经过更好的训练、更细的系统提示词、更严格的应用层过滤,就能被管住。NVIDIA 的判断更冷一点:代理越能长期执行任务,越可能遇到含糊指令、临时权限、跨系统调用和凭证边界。把所有控制都放在代理自己能接触到的层里,本身就是风险。

安全边界开始下沉

Open Agent Safety Platform 由几块东西拼起来。OpenShell 是运行时边界,用来限制代理能访问哪些文件、程序、网络和凭证;Sentry 是参考设计,跑在 BlueField-4 DPU 上,从主机之外监控代理行为;NVIDIA 还把它和 DOCA、Vera CPU、企业级沙箱和审计流程连在一起。换句话说,它不是又一个“告诉模型别乱来”的规则包,而是试图在计算层面给代理加一道它绕不过去的门。

CNBC 报道里,黄仁勋把它形容成“给代理用的浏览器”:代理可以完成任务,但只能在被允许的窗口里活动。这个比喻很准确。浏览器之所以能承载陌生网页,不是因为网页都可信,而是因为浏览器默认网页不可信。AI 代理如果要进入企业系统,也需要类似的前提:先假设它会误判、会漂移、会被任务目标带偏,然后再设计边界。

这不是给大厂看的安全摆设

NVIDIA 的发布稿列了不少合作方,包括 Anthropic、Salesforce、SAP、Scale AI 等。名单本身不稀奇,稀奇的是它们都在同一个方向上用力:让代理做更多真实工作,但把权限、审计、审批和隔离放到更硬的层里。企业真正怕的不是代理偶尔答错一句话,而是它拿着真实凭证,在真实系统里连续执行错误动作。

这里也有代价。硬件级或旁路级的控制会让部署变复杂,尤其是中小团队未必有 BlueField、Vera 或完整的数据中心改造空间。短期内,这类方案更可能先进入云厂商、金融、制造、政府和大型软件平台。普通公司能学到的不是马上买一套新硬件,而是别再把“模型承诺会守规矩”当作安全设计。

更现实的做法,是把代理权限拆得比人类员工更细。能读什么、能写什么、能不能联网、能不能调用内部 API、越权时由谁审批,这些都要变成可记录、可回放、可撤销的工程约束。代理的卖点是连续执行,风险也正在这里:一次小越界如果没人看见,很容易被后面的自动动作放大。

我的判断

AI 代理越像员工,安全设计越不能像聊天机器人。接下来真正有价值的代理平台,不只比谁的模型更聪明,还要比谁能把权限边界做得更可验证、更难绕过。NVIDIA 这次发布的核心信号是:代理安全正在从应用层补丁,变成算力基础设施的一部分。

消息来源

Categorized in:

个人日志,

Last Update: 29 9 月, 2026