忘掉聊天机器人训练。人工智能下一个数据获取的重点是学习人类如何工作。
Tamay Besiroglu 是旧金山初创公司 Mechanize 的联合创始人及首席执行官,该公司旨在自动化所有工作。感谢 Tamay Besiroglu。人工智能的竞赛正在从教聊天机器人回答问题转向教代理人如何完成整个工作。经过多年的训练模型在互联网文本上和支付承包商评估聊天机器人回答的好坏,科技公司越来越关注一种新的方向:创建逼真的数字工作场所,让 AI 可以练习编码、使用商业软件、做决策和完成持续多时的任务,就像人类员工一样。这些数字训练领域被称为强化学习环境,简称 RL 环境。两个最近的发展显示了这种趋势在行业中的普及。商业内幕上周独家报道,谷歌正在谈判投资超过 15 亿美元于 Mechanize,这是一家构建虚拟工作环境以训练 AI 代理人的初创公司。这个潜在的交易将把 Mechanize 的人才引入谷歌,同时科技巨头也将获得一些其技术的许可,团队将负责模型评估和开发。同时,Meta 一直试图收集员工的击键、鼠标移动、点击和其他屏幕活动,表示其目标是帮助 AI 学习人们如何实际使用电脑——从键盘快捷键到使用工作软件的导航。综合来看,这些举措指向了前沿人工智能系统开发方式的更广泛转变。第一代大型语言模型是基于两个主要的数据基础构建的:大量从书籍和互联网抓取的文本,随后是来自承包商的人工反馈,他们评判聊天机器人回答是好还是坏。这种方法创造了非常强大的对话 AI。但是,它在产生能独立完成复杂的、多步骤的工作上遇到了困难,尤其是需要几个小时或几天的任务。越来越多的行业回应是 RL 环境,这是允许 AI 代理通过实际操作学习的逼真模拟,而不仅仅是预测下一个单词。Scale 的转变,Scale AI 是最大的训练数据供应商之一,表示顶级 AI 公司正在逐渐远离仅依靠静态数据集和人类偏好反馈,而是朝着模拟环境转变,让代理人安全地通过试错学习。“模型训练的方式正在演变,”Scale AI 的代理人 & RL 环境产品负责人 Chetan Rane 在最近的一篇博客中写道。“前沿模型越来越需要在逼真的模拟环境中通过试错学习,而不是单纯依赖静态数据集或人类偏好反馈。”他指出,近一半的新 AI 训练项目现在涉及 RL 环境,这些环境模拟逼真的编码、计算机使用和企业工作流程。与其询问聊天机器人是否给出了正确答案,这些环境允许 AI 尝试整个工作流程,犯错误、恢复并根据是否成功完成任务进行改进。“全面自动化”Mechanize 认为这将成为人工智能发展的重要部分。这家初创公司去年由 AI 研究员 Tamay Besiroglu 创立,目标异常雄心勃勃:“全面自动化经济。”当时,他因这样一个大胆的使命而遭到批评。“我们将通过创建模拟环境和评估来实现这一目标,捕捉人们在工作中所做的一切,”Besiroglu 和他的合伙人在宣布 Mechanize 的博客中写道。“这里的市场潜力是荒谬的大:美国工人每年大约获得 18 万亿美元的薪酬。在全球范围内,这个数字超过三倍,约为每年 60 万亿美元。”奖励信号,该初创公司表示,今天的人工智能系统在长时间工作方面仍然不可靠,因为它们缺乏可以学习的逼真环境。其首要目标是软件工程。Mechanize认为未来的编码代理将首先从专业程序员的示例中学习,然后通过强化学习在越来越逼真的软件环境中改进,这些环境捕捉真实工程项目的复杂性。随着这些环境的改善,该公司相信同样的方法可以扩展到各种白领工作。奖励信号是这些 RL 环境的关键部分,他在去年接受《商业内幕》采访时说。“你希望能够告诉模型你做的任务是正确的而不是错误的,”Besiroglu 解释道。“然后你希望利用这点来强化导致其正确执行任务的行为模式。”Meta 的数据获取,这一思路也为为何大型科技公司突然对收集自己员工实际工作数据感兴趣提供了可能的解释。Meta 的内部公告称其追踪软件将帮助 AI 理解人们如何完成日常计算机任务,因为
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡