
时下人工智能的文章笔触随处可见,然而其身后总是暗藏着某些识别特征。英国《经济学人》杂志采取了一套创新的对比研究方法,将AI生成的文本与自身出版物、CNN、纽约时报、华盛顿邮报等权威媒体的报道进行交叉对标,同时引入跨越七十余年的畅销文学作品作为样本,最终梳理出了英文AI文章的主要特征。
人工智能创作的英文表现为句式结构的冗长沉闷,极少出现那种简洁有力的短语,整体读感略显乏味枯燥。为了增强表达的生动性,它们频频采用「非X即Y」式的对比句型、「不仅……还……」的递进表述,以及层次递进的三段论法。研究人员通过数据统计发现,在每千句的使用频率上,ChatGPT与Claude都明显超越其他大语言模型及人类作者。
在词汇的遣选上,人工智能表现出了鲜明的偏好特征。它钟爱多音节的字词——诸如significant(重要)、increasingly(日益)、consequences(后果)——以及那些相对罕见的用法,比如interdependence(相互依赖)这样的生冷措辞,还特别青睐methodology(方法论)之类充满学术气质的表述。值得注意的是,它还习惯性地将动词转化为名词形式,这种做法恰好印证了《1984》作者欧威尔曾经的批评观点:某些写作者刻意选用复杂的措辞与专业术语,将简单的意思人为复杂化,以此来彰显自己的学问高深。
关于标点符号的应用,人们曾普遍认为大语言模型对破折号情有独钟,但这一认知在最新一代模型身上已不相符。事实证明,仅有Claude的破折号使用频率超越人类水平,而ChatGPT反而跻身所有研究对象中用得最少的行列。这表明大家完全无需担忧破折号会成为识别AI的「标签」。
反之,那些标点符号极为稀疏的英文作品则很可能源自人工智能之手。大语言模型生成的文本在这方面颇似《尤利西斯》作者乔伊斯的风格——逗号与分号的频率均明显低于人类作者,括号的现身更是寥寥可数。这背后存在两重原因:其一,由于它们倾向于冗长的句法结构,导致「and」这个连词频频被过度使用;其二,因为它们极少援引专业人士的言论,自然也就很少出现引号这类标点。
因此,当下识别人工智能文章最为可行的办法,便是留意那种平铺直叙、充溢说教意味、大量运用拉丁语系词汇的文风特质。然而,《经济学人》的研究也揭示了一个发人深省的趋势:每一次模型的迭代更新,人工智能的写作都在不断拉近与真人创作的距离。当今或许借助Pangram等识别工具仍可奏效,但这样的优势恐怕难以长久保持。