返回

文章详情

AI can't take over your holiday shopping quite yet, a new study suggests.

新的研究表明,人工智能尚无法接管您的假日购物。

Business Insider2026年9月25日 09:37

新的研究表明,人工智能尚无法接管您的假日购物。阿历克斯·比特(Alex Bitter)的报道。您目前正在关注这位作者!点击以取消邮件提醒。来自Product.ai的一项研究发现,主要的LLM在在线购物时查找产品时存在高错误率。安德里·奥努弗里延科/盖蒂图片社。人工智能尚未能够接管您的假日购物,这是一项新的研究的结论。根据本周发布的一项研究,AI驱动的购物助手在提供产品价格、规格以及哪些产品是当前的方面,经常给出相互矛盾的答案,这项研究是由初创公司Product.ai完成的,该公司将产品声明与证据进行比较。该公司使用220个购物问题对ChatGPT、Claude、Gemini和Perplexity的免费和付费版本进行了测试,产品范围从笔记本电脑和电视到床垫、防晒霜和机器人吸尘器。它在每项服务上对每个问题进行了五次测试,捕获了8794个响应。Product.ai发现,86%的问题产生了可重复的事实冲突。该研究将冲突定义为可检查的意见分歧——例如不同的价格、产品型号或规格——在多个响应中出现。“简而言之,这表明这些LLM在端到端体验方面还未达到标准,”Product.ai的搜索产品负责人达科塔·南利(Dakota Nunley)表示。人工智能在购物中逐渐深入,零售商和LLM都提供工具来在线查找和购买商品。像Meta的Muse或Instinct这样的AI代理可以为您完成更多工作。Product.ai的研究指出了一个更根本的问题:人工智能仍然难以提供人类或AI代理需要的准确信息。“Perplexity是唯一一家专注于实现100%准确性的人工智能公司,我们在每一个衡量标准上都处于行业领先地位,”Perplexity的一位发言人说。其他三家LLM的代表未对此做出回应。研究发现,97%的对抗性问题,例如要求AI模型比较两个产品,产生了冲突。这比简单的事实或规格问题的75%冲突率要高。模型在提供正确的产品价格方面也表现乏力。在Product.ai可以验证的913个答案中,85%与当前或列出的价格相符。不同的LLM之间存在差异。Gemini在Product.ai分类为代价高昂错误的问题中占比最高:其免费版本为56%,付费版本为54%。使用Claude时,结果在其付费版本中有所改善,代价高昂错误率下降至21%,而之前为44%。Perplexity的付费版本拥有最低的代价高昂错误率,为14%,其次是ChatGPT的付费版本,代价高昂错误率为17%。Product.ai还发现,当被反复问同一问题时,这些工具有时会自相矛盾。Gemini的免费版本在29%的问题上出现了这种情况,是研究中最高的比例。然而,当答案错误时,实际价格的偏差中位数为300美元,Product.ai表示。如此大的差异应足以让购物者对依赖AI代理有所顾虑,南利表示。“这确实是个大失误。”他说。南利表示,与其把支付信息交给代理或盲目相信AI代理的话,用户需要自己验证信息。这意味着可以询问多个AI引擎并比较结果——或者简单地查看卖家的官方网站。“在即将到来的假期季节,使用人工智能作为发现工具和思想合作伙伴,”南利说。“但要小心目前的放手。”您是否对人工智能和购物有故事想法?请联系本记者,邮箱为abitter@businessinsider.com,或通过加密消息应用Signal联系,电话号码为808-854-4501。请使用个人电子邮件地址、非工作WiFi网络和非工作设备;以下是我们安全分享信息的指南。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

☕请我喝杯咖啡