构建不可能超越其信任边界的安全代理
“模型是无法驯服的黑客”的头条新闻充斥你的信息流,主要争论在于意图。意图是最无趣的部分。重要的是你即将将同类模型直接访问你的基础设施,而在自动化你的安全时,让它们最终决定自己的行为是疯狂的。在它们停止犯错之前,你无法承受让你的代理幻想着删除你的数据或更改你的云基础设施配置。其中一种解决办法是将你基础设施的关键部分镜像到数据湖中,让代理在那里操作,而不直接触及你的实时基础设施。这就是所有SaaS安全产品的操作方式:Palo Alto Networks、CrowdStrike、Wiz和AI本土挑战者。这是一条有效的路径,但代价不菲:成本、部分数据、同步延迟,最重要的是,你注定要在数据主权丧失和巨大的运营开销之间做出选择。经典的防御者与攻击者的不对称是现实存在的,而当攻击者可以利用前沿模型和编码代理来发现和自动利用任何潜在漏洞时,这个问题愈发严重。仅仅依靠资源已经无法弥补这个差距:你需要一个拥有直接访问你基础设施权限的主权代理。我们从一些大型企业的合作伙伴那里听到了相同的模式,他们被给予了对前沿实验室顶级模型的有限早期访问。最后,他们可以访问一个比攻击者拥有的更强大的推理模型,但由于他们没有一个可以信任的代理来处理如此敏感的访问权限,他们选择在提示中复制粘贴代码库——代价高昂,没有周围运行时的代码,没有同步以及被孤立的专门任务团队的额外开销。你应该给你的代理最小权限的只读访问权限。但这还不够:大型组织中服务器端身份和访问管理往往会漂移。如果你给代理机会,它们会找到创造性的方法来改变自己的边界。我们在构建我们的基础设施安全深度研究代理Cynative时所采取的解决方法是双面架构:沙盒和动作网关。沙盒运行模型创作的代码,而无权访问外部世界——没有网络、没有文件系统、没有主机API,只有我们明确注册的工具。动作网关在任何凭证被附加之前,都会基于只读策略授权每个连接器调用,并且在失败时关闭。代理在构建上是只读的,而不是通过一个可以巧妙绕过的选择过滤器。从而,该主权代理具有编码代理的灵活性,可以在其所需的实时数据上短暂推理,同时任何情况下都无法更改实时基础设施或泄露数据。这个原则贯穿其余部分——云提供商自己保持只读的会话、在数据到达模型之前被编辑的机密、关闭失败的审计日志——但每一个都是一个独立的帖子。模型仍然能够看到你指向的所有内容。因此,Cynative作为一个单一的二进制文件在你的环境中运行,针对你选择的任何模型端点——包括云提供商已经为你运行的端点。将其指向这些端点,基础设施、模型和代理都位于同一账户内:你从自己的基础设施内运行基础设施安全。如果你正在构建自己的安全代理,当两个条件成立时,边界才成立:推理环境无法接触到你没有明确给予它的任何内容,而允许的集合是在设计时决定的,在运行时没有将其扩展到其他内容的路径。处理不当,边界会成为模型在决定任务需要时可以自由重新解释的建议。处理得当,你可以将其指向生产,并安心入睡。我们将其构建为一个开源项目,以便你可以自由使用它,进行基础设施深度研究或作为框架构建自己的安全代理,利用这一架构并实现你的工作流程和逻辑。代码和文档可在此获取:github.com/cynative/cynative
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡