构建自主人工智能的企业环境
对于企业来说,自主人工智能的承诺远不止于更好的聊天机器人。它是能够跨越人员、业务工作流程、数据和系统执行业务任务的软体代理。运行代理的最佳平台具备适当的CPU容量、可靠的数据访问、政策感知的工具使用、可观察性、内存管理以及可预测地规划和扩展代理的能力。为了更好地理解这些依赖关系,英特尔进行了数千个自主人工智能工作负载实验。我们的初步发现为企业领导者创造并支持五个实用的经验教训:自主人工智能是一个更大的系统问题,而不仅仅是推断问题。现有的大多数自主人工智能利用受限,未能衡量整体系统性能。计划容量是通过每个虚拟CPU(vCPU)的代理密度来完成的,而不是代理数量。监控代理任务延迟,而不仅仅是平均CPU利用率。默认情况下,代理托管的系统应该采用扩展而非扩充策略。对于需要更重的每个代理计算或架构约束的工作负载,保留扩充。超越推断:代理作为工作流程自动化。自主人工智能不仅仅是大型语言模型推断。它的企业价值依赖于完整的系统、任务编排、数据访问、工具执行、延迟管理、治理和可扩展基础设施。代理是一个以目标为导向的自动企业工作流程过程:它规划多步骤任务,调用工具,读取结果,并在出现故障时重试。因此,企业代理不仅仅是一个推断问题;它们是一个系统问题。定义什么是好的大多数自主人工智能指标专注于评估使用的LLM。平台团队还需要知道任务所需的时间、一个代理群体可以支持多少代理、用户在执行过程结束时的体验以及随着更多代理同时工作,成本如何变化。一个更有用的企业视角关注六个指标:任务成功率、每个任务成本、每个任务所需时间、任务吞吐量、代理密度(每个vCPU的代理数)、延迟。这些共同回答企业人工智能运营商所关心的问题:系统的表现是否如预期?系统可以支持多少代理?如何扩展以支持更多代理?建立坚实基础。为了深入洞察自主人工智能工作负载性能,英特尔扩展了Terminal-Bench,这是一个开源基准测试工具,用于评估具有分析、遥测和回放能力的人工智能代理。这个扩展使得能够理解代理们在LLM推断之外消耗时间的地方。基准扩展使用确定性的记录回放LLM响应,来将代理性能与LLM变异性分开。LLM响应被记录一次,并在每次运行中一致回放,从而减少运行间的方差,并为比较提供更可靠的基础。Terminal-Bench使用的任务组合是有意进行广泛的,包括编译、测试、数据库操作、布尔逻辑、解释、光线追踪、压缩、线性代数、视频转码和机器学习训练。这种多样性使得研究结果与真实企业环境更加相关。自主人工智能的三个维度。部署自主人工智能应分为三个阶段:以代理密度而非代理数量进行规划:第一个规模规则是根据可用计算标准化代理数量。代理密度(每个vCPU的代理数)是饱和的主要信号。例如,如果密度相同,那么在8-vCPU系统上有10个代理和在16-vCPU系统上有20个代理的行为是相似的。这为架构师提供了一种可移植的方法用于比较不同实例大小和处理器代际之间的容量。适当的密度也取决于业务目标。交互式助手和面向用户的助手应该偏爱较低的密度,因为响应时间很重要。像IT工作流程这样的批处理工作负载通常可以在更高密度下运行。这为团队围绕服务水平目标和总体拥有成本调整代理群体提供了实用的方式。自主人工智能需要新的可观察性:平均计算(CPU)利用率对于代理工作负载来说是一个较弱的主要性能监测信号。代理通常在等待模型响应和进行短暂的计算密集型工作之间交替。因此,由于这种“爆发性”模式,尽管平均利用率看起来可以接受,但这些爆发可能导致排队并减慢用户体验。任务延迟(P95)是更好的领先指标。它显示了工作流程何时开始等待,甚至在平均任务持续时间显著恶化之前。一个实用的操作模型是首先在P95延迟方面发出警报,然后通过查看持续的任务持续时间来确认问题。默认扩展:扩展带来更多系统,增加总代理容量,而扩展则增加单个系统的核心或内存,以支持具有更大计算量的代理。我们的测试数据表明,扩展通常是更好的默认选项。这与代理通常是半独立的事实相一致。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡