如何识别某些东西是否由人工智能撰写
《经济学人》2026年8月9日 — 下午1:00 幽灵作家正在困扰英语语言。这种语言幽灵可以应对散文、诗歌、新闻体和企业行话。它非常多才多艺:你可以让它模仿莎士比亚的十四行诗或一部文学庸俗的沙滩读物;欧内斯特·海明威的简洁文字或办公室打印机手册。它的效率惊人,每分钟可以输出数千个单词。(海明威每天很少能写这么多,而且需要喝更多酒。)文学创作者们感到不安。人工智能的散文可以通过词汇和标点选择,以及句子和段落结构来区分。但其特征并不是你可能预期的部分,因为它的写作风格随着软件更新而变化。彭博社的人工智能写作无处不在。它在你的收件箱中,在你的领英动态上。它遍布互联网,据一种统计,撰写了新网站的三分之一以上。大型语言模型(LLM)正在帮助学生写论文,可能也在帮助科学家撰写论文。今年,有人声称人工智能生成的散文赢得了英联邦短篇小说奖,评委们赞扬其“宁静的权威”。(英联邦基金会否认了这一说法。)LLM有自己的风格特征。人们认为它们倾向于最大化使用长破折号——以及像“最大化”这样的词。它们喜欢“深入探讨”(更好,还能“挖掘”)这个世界的“丰富织锦”。人工智能写作不仅仅是单个词或短语,而是事物的丰富织锦。识别人工智能文本可能很棘手。这在一定程度上是因为你需要超出几个词或破折号的证据:仅仅因为一篇文章使用了“挖掘”这个词就声称它是由LLM撰写的,就像声称某篇文章是简·奥斯汀的作品,因为它使用了“轻率”一样。机器人写作的方式也稍有不同。格但斯克大学的语言学家卡罗琳娜·鲁德尼卡解释说,没有一种单一的人工智能写作风格,就像人类写作没有单一风格一样。作家有个性特征——例如,艾米莉·狄金森就喜欢破折号——机器人可能也有。但有几种方法可以识别LLM生成的文本。一种是使用检测算法,这些算法经过训练,可以识别出人类或人工智能散文的特征。领先的公司Pangram声称其准确率为99.98%。(它与博客平台Substack在这一工具上合作。)然而,检测器是黑箱算法,可能会给出错误的正面结果。它们不会给出达到结论的理由。研究人员还尝试通过搜索文本中的可疑词汇或比较LLM开放给公众之前和之后的论文来进行识别。但这些方法也有缺点,尤其是因为很难将人工智能特征与其他语言趋势区分开。通过比较人类和机器的写作,可以发现人工智能的特征。为此,你需要一个独特且熟悉的基准。《经济学人》借助于我们确信是人类撰写的散文,以及读者会认识的散文。我们设计了一项研究,询问顶级LLM——OpenAI的ChatGPT、Anthropic的Claude、谷歌的Gemini和xAI的Grok——撰写我们文章的版本,而不去查阅网络。(作为提示,我们给了它们我们实验性地添加到部分文章中的人工智能生成的摘要。)这给我们提供了一个人类与人工智能创作的语料库,我们在55,940个句子和120万字之间进行了比较。为了确保我们检测到的是人工智能的特征,而不是我们自己的特征,我们还将人工智能文本与CNN、纽约时报和华盛顿邮报的报道进行了对比。1950年至2022年间出版的热门小说摘录提供了另一个测试。我们的发现令人惊讶。人工智能散文通过词汇和标点选择,以及句子和段落结构可以识别。但其特征并不是你可能预期的,这在一定程度上是由于它的写作风格随着软件更新而变化。这并不意味着LLM是出色的作家:它们的散文缺乏清晰性和优雅,通常是公式化的。因此,渴望成为令人印象深刻的(人类)讲述者的人应避免自己散文中的以下特征。首先,考虑词汇。机器人的过度使用词汇发生了变化:它们不再“深入探讨”,而且“织锦”的数量也减少了。相反,它们提供了大量多音节词,如“显著”、“越来越”和“后果”。它们使用的稀有词(如“相互依赖”、“再工业化”)和科学术语(如“参数”、“方法论”)比人类更多,并且喜欢名词化(将动词变为名词,如“expand”变为“expansion”)。我们研究中的所有LLM都使用了这些词,特别是Gemini和Claude。这些词汇中的大部分可以被描述为乔治·奥威尔所称的“矫饰的辞藻”。他批评那些用复杂的词汇和行话来“装扮简单陈述”的作家,以试图显得聪明。这样的自命不凡的作家,奥威尔观察到,还相信“拉丁或希腊词比撒克逊词更显得宏伟”。(机器人同意:它们的写作中出现了更多的拉丁后缀。)
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡