2026 年 8 月有两个信号值得企业 IT 决策者同时注意:4 日白宫与四家闭源模型厂商敲定自愿安全测试框架,12 日研究者公开了能跨会话重放加密推理块的 API 漏洞。两件事合起来只说明一个问题:AI Agent 安全已经不只是模型层的事,它正在变成采购合同里必须写清楚的事。
一、事件还原:白宫框架为何只覆盖四家闭源模型
据路透社 8 月 4 日报道,白宫邀请 Meta、OpenAI、Google、Anthropic 四家公司评审自愿 AI 安全测试框架。该框架在 6 月行政令后定稿,允许模型厂商在公开发布前把模型提交给政府机构测试,测试窗口最多 30 天,重点覆盖机密性、网络安全与内部人风险三类问题。
框架最受争议的一点是覆盖面:自愿测试只针对闭源模型,明确不对开源或开放权重模型测试。对采购方而言,这意味着国内企业常用的开源部署路线并不在框架覆盖范围内,安全责任完全落在企业自己身上。
这个时间点并非巧合。此前已有一款自主 agent 在开源模型社区平台运行一周未被察觉的入侵事件,美众议院随后要求相关厂商提供安全简报。白宫框架可以理解为监管层对 agent 自主性上升的第一轮制度化回应,但它是自愿的、闭源专属的,距离企业可依赖的安全基线还有距离。
二、推理链泄露:AI Agent 安全的新攻击面
8 月 12 日,The Hacker News 报道了一项覆盖三家头部闭源模型厂商的研究。研究者发现,这些厂商在 API 调用之间保存的加密推理对象可以被跨会话、跨用户甚至跨模型重放,弱模型可以充当模糊解码器,把强模型的推理链内容逐字读出。对应关系为:Claude Haiku 4.5 解码 Claude 推理、GPT-5.6 Luna 解码 GPT 推理、Gemini Robotics ER-1.6 解码 Gemini 推理。
论文(Stealing Reasoning Traces from Proprietary LLM APIs)在 6,708 条公开 agent 轨迹中解码出 315,320 个推理块;排除基准来源后,从真实用户会话中统计到 704 个隐私产物,包括 62 个 API 密钥、33 个密码、24 个访问令牌和 7 个私钥。更值得注意的是,其中 64 个产物只出现在隐藏推理里,可见对话文本被脱敏后秘密仍然留在不透明块内,另一个账户可以直接重放读走。
这项研究还演示了隐藏提示注入:研究者把恶意指令放进不透明推理块,重放到无关任务中,成功让接收模型执行了攻击者指定的上传动作,而注入指令在可见文本里完全不出现。
需要冷静看待的部分:加密本身没有被破解,攻击前提是拿到一个完整的加密推理块(例如公开在 agent 日志里),并拥有同一供应商的兼容模型 API。研究者表示主提取攻击在 2026 年 8 月已不可复现,且未发现野外恶意利用。但供应商公开文档仍显示该设计存在:Anthropic 已建议切换模型时剥离 thinking 块,而 OpenAI 仍要求手动管理无状态历史时重放加密推理项。
对企业 API 应用的直接风险是三层:一是提示词与业务数据可能被下游模型推断,RAG 场景下这部分往往就是核心知识资产;二是凭据可能通过公开日志泄露,研究者实际恢复出的 62 个 API 密钥即是证据;三是推理链成为新的注入载体,传统输入过滤对不透明块无效。
三、供应商安全评估六项清单
把上述风险转成采购动作,可以归纳为六项清单。每一项都要求可验证证据,而不是供应商官网的安全承诺页。
| 评估项 | 要什么证据 | 验收标准 |
|---|---|---|
| 安全测试披露 | 是否参与白宫框架或第三方红队、公开测试报告 | 能提供近 12 个月至少 1 份可查证的安全评估报告 |
| 漏洞响应 SLA | 漏洞披露政策、修复时限承诺 | 严重漏洞 24 小时内书面通知、7 天内修复或给出缓解方案 |
| 推理隔离承诺 | 推理块是否绑定模型、跨会话重放防护 | 合同写明切换模型必须剥离推理块,且提供日志字段说明 |
| 数据使用条款 | 输入输出是否用于训练、保留期、数据出境路径 | 明文禁止用于训练或默认关闭,保留期可配置、可删除 |
| 水印与溯源 | 文本/图像内容标识机制、溯源元数据 | 生成内容可追溯到模型版本与调用链 |
| 审计权 | 日志保留、供应链披露、第三方组件清单 | 合同约定定期审计权与日志保留 90 天以上 |
六项里,推理隔离承诺是这次漏洞直接对应的一项,建议优先谈;审计权是兜底项,谈判时最容易让步,但恰恰是事后追责唯一抓手。
四、三类供应商风险分档
不同部署路线的安全边界差异很大,采购评估不能一套标准打天下。
| 供应商类型 | 安全优势 | 主要风险 | 适配场景 |
|---|---|---|---|
| 闭源旗舰 | 进入白宫测试视野、有漏洞响应流程 | 推理链不透明、数据出境、价格锁定 | 对合规要求高、愿意接受供应商条款的出海企业 |
| 开源 / 开放权重 | 可私有化、可审计、无供应商锁定 | 不在白宫测试范围、补丁依赖社区 | 数据敏感、需要本地化部署的制造与政企客户 |
| 国产闭源 | 境内合规路径清晰、中文能力强 | 安全测试披露普遍不足、生态成熟度待验证 | 数据不出境是刚需的国内企业 |
分档结论:闭源旗舰要先谈推理隔离与数据条款,开源路线要自建安全门禁,国产闭源要补测试披露证据。没有哪一类天生安全,只有风险是否被合同与工程兜住。
五、CTO 落地五步
- 盘点:列出所有在生产环境调用的模型与 agent 服务,标注是否涉及推理块、是否有人把 agent 日志公开到仓库或平台。
- 评估:按六项清单给每家供应商打分,重点核对漏洞响应 SLA 与推理隔离承诺,缺失项直接标记为合同必谈项。
- 合同补丁:把六项验收标准写进采购合同,明确数据用途、日志保留、审计权与违约金触发条件。
- 灰度:新供应商先跑 2-4 周灰度,用脱敏数据验证推理行为与安全日志,再放量。
- 应急:提前写好推理泄露与凭据泄露的响应预案,明确停用开关、通知时限与对外沟通口径。
落地过程中可以参考站内已有的工程化文章:从 Demo 到生产的五道工程关卡(/blog/ai-agent-demo)、Agent 边界与权限设计(/blog/ai-agent-4)以及开源模型的合规取舍(/blog/open-weight-ai),把供应商评估和企业自建门禁拼成完整的安全闭环。
常见问题
白宫自愿测试框架对国内企业有约束力吗?
没有直接约束力。框架只覆盖受邀的四家闭源厂商,且是自愿性质。国内企业应当把它当作评估供应商是否愿意接受外部安全审视的信号,而不是合规依据。
推理链泄露漏洞会影响开源模型吗?
该漏洞针对闭源 API 的加密推理块设计。开源模型本地部署时推理发生在自己环境内,不存在跨会话重放面,但需要自建日志与访问控制。选择开源路线请对照站内开源模型合规文章补齐治理。
供应商不愿提供安全测试披露怎么办?
这是谈判信号。至少要求对方提供第三方安全评估的摘要或 SOC 2 报告;如果连摘要都不给,建议把它标记为高风险项,并在合同中增加审计权与退出条款。
小团队没有专职安全人员,六项清单怎么落地?
先做减配版:重点核对漏洞响应 SLA、数据使用条款与日志保留三项,其余项在合同模板里留空待补。灰度阶段用现成日志工具检查推理块是否被写入共享日志,这是成本最低的验证动作。
已经上线的供应商评估不合格,迁移成本怎么控制?
不建议立即全部迁移。先按风险分级:涉及凭据与敏感数据的调用优先切换,其余调用保留并加日志监控。迁移时保持路由层不变,只换底层模型,能显著降低切换成本。
如果需要在采购评审前把六项清单落到合同模板,或做一次供应商安全盘点,可以联系优码云(/contact)或查看案例(/cases)。
参考
- The Hacker News:OpenAI, Anthropic, Google API Flaw Let Weaker AI Models Decode Stronger Models' Reasoning(2026-08-12)
- 路透社:白宫与四家闭源模型厂商评审自愿 AI 安全测试框架(2026-08-04)
