美国军机已经起飞,武装人员也在准备登上一艘中国船。后来才发现,推动这次行动的情报报告是错的,而且错误来自一个被拿来整理情报的 AI 聊天工具。
这条新闻真正刺眼的地方,不是“AI 又幻觉了”。普通聊天里幻觉一次,最多让人多查一遍资料;军事链条里幻觉一次,可能把一个错误包装成足够正式、足够紧急、足够像真的命令依据。
问题不在模型会犯错,而在错误被写得太像情报
CNN 报道说,这份报告出现在今年春天伊朗战争期间,内容称一艘位于中东的中国船只正在运输与核武器项目有关的部件。美国军方据此准备拦截,部分飞机已经在空中,登船人员也在准备行动。临近执行前,官员继续核查,才发现报告由美国特种作战司令部一名分析员借助 AI 工具生成,聊天机器人误判了船上的货物。
这里的危险不只是“答案错了”。更麻烦的是,分析员又用工具把错误整理成一份像样的正式摘要,随后进入指挥渠道。AI 的文字能力把怀疑、猜测和误判磨平了,让一条本该被追问来源的判断,获得了文件格式带来的权威感。
军事 AI 的诱惑正好踩中组织弱点
军方和情报机构当然有理由使用 AI。原始情报太多,目标筛选太快,战场节奏也越来越不等人。TechCrunch 和 Ars Technica 都提到,五角大楼正在加速把 AI 放进决策流程,希望缩短所谓的 kill chain,让指挥官更快反应。
但速度不是免费午餐。AI 最擅长的,正是把零散材料合成一段顺滑文本。组织越依赖摘要,越容易把“写得顺”误认为“查得实”。一旦上级看到的是已经格式化、已经像结论的报告,而不是原始证据和不确定性标记,人就很难知道该在哪一层踩刹车。
真正该花钱的地方,是让系统会停下来
我的判断是,军事和高风险行业以后评估 AI,不该只问模型准不准,也不该只问它能省多少人力。更现实的问题是:它能不能把不确定性留在台面上?能不能强制标出哪些结论来自模型推断,哪些来自可核验资料?能不能在行动前要求第二条独立证据,而不是让一段漂亮摘要直接往上流?
这套机制听起来不如新模型发布刺激,却更值钱。AI 进入普通办公流程,犯错可以返工;进入军事、医疗、金融风控这些场景,返工有时已经太晚。技术供应商喜欢卖“更快的决策”,但真正能降低风险的产品,应该敢于让流程慢一拍。
这类事故还会把责任分散掉。模型说错、分析员没查、系统默认放行、上级相信摘要,每一环都可以说自己只做了一小步;可在行动现场,这些小步会合成一个很硬的结果。所以防线不能只靠“使用者要谨慎”这种软提醒,必须落到权限、日志、复核和证据链上。
这次事件没有升级成冲突,是因为临门一脚前还有人继续追问。以后判断一个高风险 AI 系统能不能用,我会先看它有没有把追问做成硬规则,而不是看它能把报告写得多漂亮。
消息来源
- CNN:Exclusive: US military had close call after using AI for false intelligence report, sources say
- TechCrunch:AI hallucination nearly triggers US military operation
- Ars Technica:AI hallucination of Chinese nuclear components almost led to US military attack
- gCaptain:AI Error Nearly Triggered U.S. Intercept of Chinese Ship, CNN Reports