我们仍然不知道人们是如何真正使用AI的
像Anthropic和OpenAI这样的AI公司定期发布关于人们使用Claude和ChatGPT等产品的报告,但他们只发布他们希望我们看到的数据,AI研究人员说。斯坦福大学值得信赖的AI研究实验室(STAIR)的计算机科学博士候选人安卡·瑞尔(Anka Reuel)表示:“没有独立的来源来证实这些数据。”瑞尔是一个名为AI观察站的新研究项目的共同负责人,该项目旨在填补这一空白。它是一个公共平台,聚合并分析了与用户同意下收集的热门模型(如Claude和Gemini)的真实AI对话,这些对话来源于七个现有的数据集。观察站的目的是为研究人员和政策制定者提供独立的信息来源,以评估人们是如何使用生成式AI的。瑞尔表示,利益相关者目前正在基于非常有限的数据做出关于AI收益和风险的重大决定。AI观察站发现,不同模型的AI使用情况有显著差异,并且随着时间的推移而发生变化。其研究显示出许多比主要AI公司报告中捕获的敏感行为要多,这些公司表示其关注点更多地放在工作而非个人使用上。Anthropic经济指数是关于AI使用数据的知名且被广泛引用的来源之一,但它存在盲点。顾名思义,它专注于与Claude AI相关的工作和生产力使用——过滤掉与这些使用无关的对话。当AI观察站团队将Anthropic的方法应用于他们的数据集时,他们发现近一半(即48%)的对话会被过滤掉。那些被过滤掉的与工作无关的对话更可能包括健康和人际关系(44.2%,与Anthropic分析中的31.2%相比),成人或非法话题(7.9%,与2.1%相比),骚扰和仇恨(27.5%,与5.66%相比),以及性内容(16.7%,与2.4%相比)。OpenAI在其2025年关于ChatGPT使用的报告中也发现,只有30%的消费者使用与工作相关。Anthropic曾发布关于人们如何使用Claude进行支持或陪伴、甚至生成儿童性虐待材料的单独博客文章,“但拥有[AI观察站的]鸟瞰分析,而不是分散到单独的报告中,有助于”研究人员更一致地了解不同的使用方式,德州大学奥斯汀分校信息学院的助理教授David Widder表示,他研究人们如何与AI系统互动,并未参与AI观察站。AI观察站关注的数据集包括2023年至2025年之间进行的对话,发现人们使用AI的方式以及各种AI平台的反应有所不同。AI观察站的研究中包括的最大且最详细的数据集之一WildChat的对话随着时间的推移变得更长、更详细,这从提示标记、响应标记和对话回合的增加中得以体现。随时间推移,闲聊的数量也明显增加。这表明AI陪伴的需求正在增加;同时,AI助手的自我披露(即它是一个聊天机器人)减少了。此外,研究人员标记为敏感使用的交流——即可能包含有害或受限内容的交流,包括性骚扰和仇恨言论——有所下降。这可能表明平台普遍采取了更有效的保障措施。AI观察站还发现,不同模型的AI使用情况差异显著。根据工具的不同,用户的主题、互动风格、对话结构,以及敏感使用案例的可能性和类型都有所不同。例如,研究人员发现,人们更频繁地使用Grok和Gemini进行信息检索。Grok尤其受欢迎,用于获取新闻和政治信息,但也是虚假信息集中的地方。(这与其他研究一致,其他研究同样表明虚假信息在Grok上容易传播。)然而,人们更倾向于使用Anthropic进行编程,Gemini用于社交和角色扮演,而ChatGPT则用于作业帮助。同一模型的不同版本之间甚至也存在差异。研究人员发现,当ChatGPT使用GPT-3.5时,人们的对话更短,而使用GPT-4时则是更长且更迭代的对话——这与该版本被称为导致情感依赖是一致的。然而,公司报告通常未能捕捉到这些细微差别。“没有任何单一的公司报告能够讲完整个故事,”最近从麻省理工学院媒体实验室毕业的博士生Shayne Longpre说,他与瑞尔共同领导了这项研究。为了创建AI观察站,瑞尔和来自麻省理工学院、斯坦福大学、数据来源倡议等其他机构的研究人员,聚集了24521个对话,包含85633个对话回合(即用户提示和响应)。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡