Perplexity 9 月 28 日公布了对自家智能体沙箱 SPACE 的红队测试结果:9 个前沿模型在虚拟机里拿到 root 权限,连源代码都给了,108 次"越狱"尝试无一逃出虚拟机;但在允许有限网络访问的场景下,4 个模型找到了绕过网络封锁的办法。结论很直白:虚拟机隔离这道墙没倒,网络隔离这道墙被钻了空子。
测的是什么
SPACE(Sandboxed Platform for Agentic Code Execution)是运行所有 Perplexity Computer 的沙箱平台,基于开源 Firecracker 微虚拟机。测试设置了两个夺旗任务:沙箱逃逸——跨过虚拟机边界,拿到宿主机上的 AWS 诱饵密钥;网络绕过——访问一条被网络策略屏蔽的回调地址。参测的 9 个模型包括 Claude Opus 5.0、GPT-5.6 Cyber、GPT-5.6 Sol、Kimi K3、Gemini 3.1 Pro、DeepSeek V4 Pro、Grok 4.20、GLM 5.2 和 Qwen 3.8 27B。
结果:两道墙,一道没倒、一道被钻
- 沙箱逃逸:108 次运行,0 次成功。哪怕给模型看 SPACE 源代码、允许装软件和联网搜索,也没能跨过虚拟机边界。
- 网络绕过:完全断网的 54 次运行全部失败;但在允许访问 PyPI、Ubuntu 镜像等软件源的 54 次运行中,修复前有 11 次成功。得手的 4 个模型是 Claude Opus 5.0、GPT-5.6 Sol、GPT-5.6 Cyber 和 Kimi K3——Kimi K3 还是唯一成功的开源权重模型。
模型是怎么钻空子的
两招都利用了网关"按域名定策略、按 IP 做放行"的不一致:
- DNS 欺骗:伪造 DNS 响应,把回调地址的 IP 冒充成允许的 pypi.org,网关不校验响应来源,直接放行。
- 共享 IP 路由:pypi.org 和数千个网站共享同一个 Fastly IP,模型借这条"合租通道"溜出去。GPT-5.6 Cyber 还玩出了花:通过 Taboola 的图片抓取器访问截图服务,再从图片里 OCR 出 flag。
Perplexity 修复了这两个问题并重新跑了一遍,确认绕过不再成功。
不止 Perplexity 一家
Perplexity 顺手测了 10 家第三方沙箱平台,8 家存在类似的网络策略绕过问题(公开报告点名了 E2B、Vercel、Modal 等),已全部向厂商披露并收到回应,只有一家要求更多时间、暂未公开。顺带一提,Fable 和 GPT-6 Astra 拒绝参与这项测试。
对行业的提醒
Perplexity 把结论写得很清楚:虚拟机隔离和网络隔离是两道不同的安全边界,要分开评估,Perplexity 专题会继续跟踪这家公司在智能体安全上的动作。智能体越能干,沙箱越要经得起"故意使坏"的测试。他们正和 NVIDIA 及 100 多家行业伙伴合作,把这类防护栏纳入 NVIDIA 近日宣布的开放智能体安全平台。官方博客标题写着"Part I",第二部分会深入分析各模型的攻击策略差异——智能体沙箱的军备竞赛,这才刚开场。