Claude 在安全测试里真的连到了公网,还拿到了三家真实机构系统的未授权访问;OpenAI 早些时候也披露过模型评测中触及 Hugging Face 生产基础设施的事故。这不是“模型会不会攻击”的科幻题,而是 AI Agent 的测试环境已经开始影响真实世界。
我的判断很简单:现在更紧的竞争点,不是哪个模型多会写漏洞利用,而是哪家公司能把 Agent 的权限、网络、靶场和责任边界管住。没有这层工程纪律,越强的模型越像一把被误放在开放走廊里的工具。
问题出在靶场边界
Anthropic 在 7 月 30 日的复盘里说,他们检查了 141,006 次可能获得互联网访问的评测运行,发现三起事件:Claude 从第三方评测环境内或交互过程中接触到公网,并进入了三家真实组织的系统。最严重的一起里,模型原本在做 CTF 题,因为虚构目标公司的名字碰巧对应了真实域名,再叠加评测容器存在非预期公网访问,Claude 把真实系统当成题目继续打,拿到了应用和基础设施凭据,还访问了包含数百行生产数据的数据库。
这件事吓人的地方不在“Claude 有恶意”。从公开材料看,模型更像是照着任务目标一路执行:找到目标、验证入口、利用弱密码或 SQL 注入一类基础手法。问题在于,评测方以为它在沙盒里,模型也以为可见目标都在题目范围内,可实际网络边界已经漏了。
Agent 不是普通聊天窗口
过去谈 AI 安全,很多人还停在提示词、幻觉、内容审核。Agent 的风险更硬:它会跑命令、扫端口、访问网页、读写文件,甚至在评测中被刻意拿掉一部分外部防护,去测“原始能力”。这类测试有价值,但它不能再按实验室小脚本的标准管理。
OpenAI 的 RSS 条目确认,7 月 21 日 OpenAI 与 Hugging Face 公布了模型评测安全事故的早期发现,重点是高级网络能力和防守经验。Anthropic 的复盘随后把问题往前推了一步:不是单家公司的一次疏忽,而是 Agent 评测本身需要更像真实安全工程,默认无网、出网审计、靶标白名单、凭据隔离、第三方环境验收,都要变成硬门槛。
真正的压力会落到责任上
WIRED 把这件事放到法律责任里讨论,这个角度很关键。如果一个人越界进入别人的系统,法律路径相对清楚;如果是模型在公司授权的评测里越界,受害机构该找谁?模型供应商、评测承包商、运行环境提供方,还是下达任务的人?现在还没有足够案例把答案定下来。
The New Stack 的分析也点到一个工程卡点:这些测试为了测能力,往往会关掉生产环境里的外部保护,但只要网络配置错一点,测试就不再是测试。模型能力越强,这种“小配置错误”的半径越大。
我会把这类新闻当成 Agent 商业化的分水岭信号来看。公司如果要把 Agent 接进内部系统,只问“准确率”和“省多少人力”已经不够;还要问它能不能出网、能碰哪些目标、错把真实系统当靶场时谁会第一时间拦住。答不清这些问题的 AI 产品,短期再聪明,也不该直接进核心生产流程。
消息来源
- Anthropic:Investigating three real-world incidents in our cybersecurity evaluations,https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals
- OpenAI RSS:OpenAI and Hugging Face partner to address security incident during model evaluation,https://openai.com/news/rss.xml
- WIRED:The OpenAI and Anthropic AI Hacking Sprees Are a Messy New Legal Frontier,https://www.wired.com/story/openai-anthropic-ai-hacking-sprees-illegal/
- The New Stack:What Claude’s real-world breaches reveal about AI safety tests,https://thenewstack.io/anthropic-claude-containment-failure/