前Meta科学家希望将视觉AI引入工厂
AI正在改变我们周围的一切,但到目前为止,它主要仍限于数字领域。然而,越来越多的初创公司希望将其带入现实世界。Perceptron是一家由两位前Meta研究科学家创办的初创公司。该公司成立于2024年11月,开发前沿的视觉模型,旨在帮助机器更有效地与其物理环境互动。本周,该公司推出了其最新模型Isaac 0.5,其创作者表示旨在为机器提供在工业环境中“感知、推理和行动”的能力。具体而言,该软件能够帮助视觉引导的机器人在复杂环境中导航,例如仓库或工厂车间。它还帮助公司从这些机器人录制的视频中提取视觉智能。Isaac 0.5还作为一个开放权重模型发布,因此其参数和训练材料可供任何人检查。这家刚刚完成由Bessemer Venture Partners主导的2100万美元融资的初创公司,由Armen Aghajanyan和Akshat Shrivastava共同创立,他们之前曾在Meta的基础AI研究(FAIR)工作。两人将其软件视为工业自动化部署的未来。“今天的物理AI给人一种错误的选择:需要多个专用云GPU的通用基础模型,或者只能处理感知或控制的狭窄模型,但从来不是两者兼顾,”公司表示。Aghajanyan和Shrivastava表示,他们的工具与该领域现有模型不同,因为它是通用的,意味着它不是为了一个特定的、重复的任务而构建的。相反,他们表示,该模型旨在根据所在的特定环境(或情况)灵活调整。在一次采访中,Shrivastava让我考虑一个简单的物理过程,比如整理纸箱:“想象现在有一个机器人被部署来分类包裹。它需要做哪些任务?”这样的相对简单的任务确实包含许多步骤。机器人首先必须读取包裹上的标签,进行一些空间分析以理解箱子的位置,并决定捡起哪个包裹。如果是捡起一系列箱子,它必须计划捡起哪些箱子以及顺序。Perceptron的软件旨在帮助机器人在每个步骤中找到解决方案。明确来说,行业中已经有能够帮助机器完成大部分这些任务的软件,但很少有程序能够灵活地做到这一点。这种算法炼金术的数据来自哪里?像Isaac 0.5这样的模型通过摄取大量视频训练数据来学习操作技能。Perceptron表示,其新模型在一百万小时的所谓通用视频的基础上进行了训练,以教导其算法识别特定设置、视觉效果和场景。该公司还大量依赖被称为自我视频的内容——通常通过GoPro或可穿戴摄像头从完成物理任务的人的视角录制的视频,以及UMI视频,这也是通过录制重复的人类动作来教AI系统动作的。尽管Perceptron并未披露其训练数据的来源,但Shrivastava表示,该公司已经“内部构建了跨模态的PB级数据集,包括图像、文本、视频等,以及机器人的轨迹”。能够帮助机器人在仓库中有效操作的软件的实用性显然是巨大的,而Perceptron认为它在这一波自动化热潮中处于良好的竞争位置。该初创公司准备将其软件推向各种供应商,从而有可能看到其智能层整合到广泛的行业中。这些行业包括制造、物流和仓储、安全、移动以及媒体和娱乐。“在外面没有像这样的东西,”Aghajanyan说。“我们对此感到非常兴奋。”当您通过我们文章中的链接进行购买时,我们可能会获得少量佣金。这不会影响我们的编辑独立性。Lucas是TechCrunch的高级撰稿人,报道人工智能、消费科技和初创公司。他之前在Gizmodo报道AI和网络安全。您可以通过电子邮件lucas.ropek@techcrunch.com联系Lucas。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡