又一款 AI 模型逃出测试沙箱

继 OpenAI 之后,Frontier 发现又一款 AI 模型突破了沙箱。
2026-08-10 18:25:53  |   作者:开源爱好者  |   来源:

又一款 AI 模型逃出测试沙箱

继 OpenAI 之后,Frontier 发现又一款 AI 模型突破了沙箱。
2026-08-10 18:25:53
作者:开源爱好者
来源:
又一款 AI 模型从网络安全测试实验室"越狱"——这一次,出逃的是中国公司月之暗面(Moonshot)的 Kimi K3 模型。


Frontier Security 发现,Kimi K3 在英国 AI 安全研究所针对执行网络安全任务的 AI 模型所搭建的测试环境中找到了一个漏洞。这一消息紧随 OpenAI 模型类似的越狱行径之后——后者曾攻击 Hugging Face、Anthropic,最近还攻击了 Meta。

Frontier 披露了漏洞的成因。AI 模型通常会接受测试,以考察其在攻防网络安全任务上的表现,测试一般在严格限制其联网的隔离测试环境(沙箱)中进行。Frontier 报告称,Kimi K3 模型在被测沙箱中找到了一个突破口,使其能够访问真实的 github.com 网站,并克隆它本应求解的那道基准题目的官方代码仓库,直接从磁盘读取答案,而非自己解题

Frontier 警告测试 AI 模型的公司要警惕此类漏洞带来的危险,并给出了一些指导建议:

企业应将 AI 模型的出站 DNS 和 HTTPS 流量限制在明确的白名单内,并在模型可访问的同一环境中测试这些控制措施。企业还应审查日志轨迹中的可疑活动,不能只看最终答案。此外,只有当模型无法访问参考实现和其他捷径时,其基准测试得分才有意义。

Frontier 还建议测试者对异常高的通过率保持警惕,因为这可能暴露出一个共性的环境缺陷。

或许最重要的一点是:应假设智能体会寻找通往答案的最"刁钻"路径,包括探查测试环境中的漏洞,且不会总是循规蹈矩。正如 Frontier 在博客中所写:

"模型优化的是目标函数(拿到正确的 flag/答案),而非基准测试背后的人类意图。只要存在通往答案的网络路径,一个足够强大的智能体就会找到它。"