返回

文章详情

Nvidia launched a tool designed to stop AI agents from going rogue. Here’s how it works.

英伟达推出了一款旨在防止人工智能代理失控的工具。其工作原理如下。

Business Insider2026年9月28日 16:58

作者:Thibault Spirlet 你目前关注此作者!点击取消订阅电子邮件提醒。首席执行官黄仁勋表示,保持人工智能代理在轨道上是一项英伟达可以解决的工程问题。Benjamin Fanjoy/Getty Images 英伟达正在为人工智能代理提供一个游乐场——以及一个看门狗。这家芯片制造商在周一推出了开放代理安全平台,这是一套双部分系统,旨在将代理保持在清晰界定的边界内,并在它们试图逃脱时迅速将其切断。这是因为几家前沿人工智能实验室报告称,代理突破了所谓的安全测试环境,访问了本不应进入的系统,有时甚至歪曲了它们所做的事情。英伟达首席执行官黄仁勋在周一的CNBC“Squawk Box”节目上表示,人工智能“有潜力产生巨大的好处”。“但我们也必须确保技术的开发和部署是安全的,”他补充道。以下是英伟达的新代理安全系统(包括微软和Anthropic在内的100多家组织正在与之合作)如何实际运作。给代理一个限制严密的游乐场 英伟达安全平台的第一个组件是OpenShell。公司下载这个开源软件,安装在设备或云中,然后它就充当人工智能代理的受控游乐场。在代理开始工作之前,其操作员设定了基本规则:它可以访问哪些文件、网站、网络、工具和凭证。黄仁勋将这种方法比作给员工发一个只能在需要的地方有效的徽章。“第一件事就是剥夺它所有的权利,”他对CNBC说。然后,操作员仅在必要时才给它访问文件、数据、工具或互联网。例如,如果一个代理在整理发票,它就不应该能够查看人力资源记录或随意访问互联网。换句话说,OpenShell把代理放在一个沙箱中——这是一个旨在阻止错误决策扩散到公司其他系统的孤立环境。它在代理工作时检查并执行这些规则。关注代理偏离预定路径的时刻 英伟达致力于降低代理偏离其被给予的任务的风险。这种情况可能是因为指令模糊、工具出现故障或代理花了很长时间试图解决一个棘手的问题。当一种方法失败时,它可能会继续寻找另一种方法,包括人类操作员从未想象过的路径。这并不一定意味着代理是恶意的。但这可能意味着它正在冒险。OpenShell旨在实时发现和阻止超出预设政策的行为。增加一个代理无法解雇的保安 第二部分,英伟达Sentry,是更强大的后盾。它在独立的英伟达硬件(即BlueField数据处理单元)上运行,而不是在与代理运行同一系统上。通俗地说:看门狗被置于代理的接触范围之外。Sentry监控代理与模型、工具、数据和网络的互动。如果其行为看起来可疑或违反规则,英伟达表示该系统可以在毫秒内将代理隔离或隔离开。黄仁勋表示,该设置有效地在代理和大型语言模型之间放置了一块新芯片,使英伟达能够“拦截所有内容”。此次发布是黄仁勋对日益担忧的日益自主的人工智能的回应。“我相信,作为一名工程师,我知道这是一个工程问题,”黄仁勋在CNBC上说。“这是一个技术上可以解决的问题。” 阅读下一条 Thibault Spirlet 你目前关注此作者!点击取消订阅电子邮件提醒。Thibault是商业内幕伦敦办公室的技术记者。他报道了技术与工作的交汇点——关注人工智能对工作场所、工作和认知技能的影响,以及经济变化如何影响职业。在加入趋势团队之前,Thibault报道了国际事务,包括俄乌战争、南海紧张局势和俄罗斯经济。他曾在《每日快报》工作,并在法新社、欧洲政治、Factal等机构实习。他能说法语。懂西班牙语。给Thibault发送电子邮件至tspirlet@businessinsider.com,在LinkedIn上与他连接@ThibaultSpirlet,或在X @ThibaultSpirlet和BlueSky @thibaultspirlet.bsky.social上关注他。 专业领域 人工智能与未来的工作 人工智能经济中的工作与认知技能 劳动力趋势 第一人称,以“讲述者的口吻”叙述的故事 人工智能 人工智能

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

☕请我喝杯咖啡