如何判断某些文字是由人工智能撰写的
《经济学人》2026年8月9日——下午1:00 幽灵作家正在困扰英语。 这种语言幽灵可以胜任散文、诗歌、新闻语言和企业行话。它非常灵活:你可以让它模仿莎士比亚的十四行诗或一本低劣的沙滩小说;厄内斯特·海明威的简洁散文或办公室打印手册。它出奇得快,每分钟可以生成数千个字。(海明威一天很少能写这么多,需要大量的酒。)文人们感到不安。人工智能的散文可以通过单词和标点符号的选择以及句子和段落的结构来区分。然而,它的特征并不是你可能所期望的,部分原因在于其写作风格随着软件更新而变化。彭博社的人工智能写作无处不在。它在你的收件箱和领英动态中。它在互联网上随处可见,据某项统计,草拟了超过三分之一的新网站。大型语言模型(LLMs)正在帮助学生写论文,并可能助力科学家撰写文章。今年有人声称人工智能生成的散文获得了英联邦短篇小说奖,评委称赞其“沉静的权威”。(英联邦基金会否认了这一说法。)LLMs 具有风格特征。人们认为它们倾向于最大化使用长破折号——以及类似“最大化”这样的词语。它们喜欢“深度探索”(而且,最好是“探讨”)“丰富的织锦”。人工智能写作并不局限于单个单词或短语,而是一个丰富的组合。识别人工智能文本可能很棘手。这部分是因为你需要超出几个单词或破折号的证据:声称某个文本是由LLM撰写的,因为它使用了“探讨”这个词,就像声称某个文本是简·奥斯汀的,因为它使用了“轻率”一样。机器人也以略微不同的方式写作。波兰格但斯克大学的语言学家卡罗琳娜·鲁德尼茨卡解释说,人工智能写作没有单一风格,就像人类写作也没有单一风格。作家有特立独行之处——例如,艾米莉·迪金森喜欢用破折号——机器人也可能有。但是,有几种方法可以识别LLM生成的文本。一种方法是使用经过训练的检测算法来识别人类或人工智能散文的特征。领先的公司Pangram声称其准确率达99.98%。 (它与博客平台Substack合作开发了这样的工具。)然而,检测器是黑箱算法,可能会给出误报。它们并不提供为何得出结论的原因。研究人员还尝试搜索文本中的可疑词汇,或比较LLM向公众开放前后的论文。但这些方法也有缺陷,尤其是因为很难将人工智能的特征与其他语言趋势区分开。通过比较人类和机器的写作,可以发现人工智能的特征。为了做到这一点,你需要一个独特且熟悉的基线。《经济学人》选择了我们确定是人类创作的散文,读者对此会有所认可:我们自己的文章。我们设计了一项研究,要求顶级LLM——OpenAI的ChatGPT、Anthropic的Claude、谷歌的Gemini和xAI的Grok——在不查阅网页的情况下撰写我们文章的版本。 (作为提示,我们给它们提供了我们实验性添加到某些文章中的人工智能生成的摘要。)这让我们得到了一个人类和人工智能创作的语料库,并在55940个句子和120万字中进行比较。为了确保我们检测到的是人工智能的特征,而不是我们自己的,我们还将人工智能文本与CNN、纽约时报和华盛顿邮报的新闻进行了对比。1950年到2022年间出版的热门小说摘录提供了另一个测试。我们的发现令人惊讶。人工智能的散文可以通过单词和标点符号的选择以及句子和段落的结构来区分。然而,它的特征并不是你可能期望的,部分原因在于其写作风格已经随软件更新而变化。这并不意味着LLMs是优秀的作家:它们的散文缺乏清晰度和优雅,并且往往是公式化的。因此,那些渴望成为令人印象深刻(人类)故事讲述者的人应避免其散文中的以下特征。首先,考虑单词。机器人过度使用的词汇已经改变:它们不再使用“探讨”,而且“织锦”的数量减少了。相反,它们提供了大量的多音节词,如“重要”、“日益”和“后果”。它们使用比人类更多的稀有词汇(“相互依存”、“再工业化”)和科学术语(“参数”、“方法论”),并且喜欢名词化(将动词变为名词,例如“扩展”变为“扩展”)。我们研究中的所有LLM都使用这样的词,但尤其是Gemini和Claude。可以将许多这种语言描述为乔治·奥威尔所称的“爱卖弄的辞藻”。他痛斥那些用复杂的单词和行话来“打扮简单陈述”的作家,以显得聪明。奥威尔观察到,这些爱说教的作家也认为“拉丁或希腊词汇比撒克逊词更显得高贵”。(机器人同意:更多的拉丁后缀在它们的写作中频繁出现。)
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡