英伟达推出全新安全平台,防止自主AI代理越界
英伟达(Nvidia)近日发布了一个全新的安全平台,旨在阻止自主AI代理在开发者设定的界限之外行动。该平台结合了软件控制与独立的硬件监控层,能够在AI代理试图超出其许可环境时,在毫秒级时间内将其隔离。
随着AI代理逐渐获得对文件、工具、API以及外部服务的访问权限,它们能够以较少的人类直接监督执行日益复杂的任务。这一趋势引发了更广泛的担忧:自主AI系统最终是否会脱离有意义的人类控制?
在模型之外增加安全层
该平台利用OpenShell——一种开源运行时环境,为AI代理建立可执行的边界,并确定其可以访问的资源。英伟达将此软件层与Sentry配合使用,后者是一种运行在其BlueField-4数据处理单元上的独立看门狗程序。
由于Sentry独立于AI模型本身运行,代理无法仅通过自身的推理来覆盖安全机制。一旦检测到可疑行为,系统可以在毫秒级时间内将代理隔离。
英伟达表示,随着代理能力的增强,仅依靠模型级别的安全措施可能已不足够。
系统工作原理
| 层级 | 功能 |
|---|---|
| OpenShell | 设置访问规则和软件边界 |
| AI代理 | 在批准的范围内执行任务 |
| Sentry | 独立监控行为 |
| 不安全操作 | 代理可在毫秒级时间内被隔离 |
AI代理的控制难度日益增加
AI代理正迅速超越传统的聊天机器人范畴。它们能够编写和执行代码,与软件交互,并在有限监督下执行一系列长序列操作。部分代理已经可以直接与金融平台互动,包括允许AI代理交易加密货币和访问投资账户的系统。
这带来了新的安全问题:一个代理可能在技术上遵循其既定目标,同时却采取了开发者未曾预料的行动。
英伟达首席执行官黄仁勋表示,AI安全越来越需要一种“全栈”方法,意味着保护措施必须延伸至模型之外,进入支撑其运行的基础设施中。
目前已有超过100家组织参与该倡议。参与者包括Anthropic、Microsoft、CrowdStrike、Hugging Face、Cisco、摩根大通、Palantir、Salesforce和SAP等。
更广泛的意义在于,英伟达正在从单纯的AI芯片供应商,扩展为安全基础设施的一部分,致力于确保自主代理处于可控状态。