Naturalmelo 研究 · 原创数据研究

AI 词汇鸿沟:33,160 篇配对人机文本,揭示 AI 究竟怎么写

我们统计了 14 个广为人知的「AI 味」短语,在配对的人类与 AI 写作中实际出现的频率——每位作者各 8,290 篇文档,合计约 1,650 万词。有些 AI 套话在 GPT-4o 文本中最高可达人类的 205×。另一些——包括最出名的那条「AI 铁证」——则被证明是误传。

205×
含 "tapestry" 的 GPT-4o 文档占比,是人类文档的倍数
26.1%
的 GPT-4o 文本含 "tapestry" 或 "delve"——人类仅为 0.36%
33,160
篇配对的约 500 词文档(合计 ≈1,650 万词)
2 / 14
条著名「AI 铁证」未通过检验——包括 "important to note"

01 — Overview核心发现

19.8% vs 0.10%"Tapestry" 是我们测到的最强单一 AI 标记。它出现在约五分之一的 GPT-4o 文档中,但在配对的人类文档里仅约千分之一——差距达 205×(p < 0.001)。
1 in 4 vs 1 in 276组合检验更尖锐。26.1% 的 GPT-4o 文档含 "tapestry" 或 "delve";人类写作者仅为 0.36%——差距 72×。
3 fingerprints模型并不共用一种文风。GPT-4o 偏爱 tapestry / testament / underscores;GPT-4o mini 在 not only… but also 上领先(23.4%);Llama 3 70B 更爱用 in conclusion(11.5%——比 GPT-4o 还高)。
0.04% vs 0.21%最出名的「AI 铁证」失效了。"It's important to note" 在 GPT-4o 中出现得比人类文本更少。"Worth noting" 则完全没有显著差异(p = 0.38)。

为什么重要:像 "furthermore"、"moreover" 这类经典连接词,在 AI 文本中仅升高约 3–7×,却仍出现在约 2.5% 的真实人类文档中——这也是「凭单个短语抓 AI」容易误伤无辜的原因之一。可靠的检测需要基线频率(base rate),而这正是本研究提供的。

02 — Background我们为什么做这项研究

几乎人人「都知道」AI 写作里满是 delve(深挖)、tapestry(织锦/万花筒式比喻)和 it's important to note。老师会把这些短语圈出来;Reddit 帖子把它们当成 ChatGPT 的铁证;检测工具也会标记它们。可几乎没人公布过基线频率:这些短语在 AI 文本里究竟多常见——同样重要的是,真人写作者用得有多勤?

第二个数字决定了一个短语究竟是证据,还是误伤机器。于是我们两边都测了,数据来自 HAP-E 平行语料库(Reinhart 等,卡内基梅隆大学,2024)——一套难得的数据:人类与大语言模型续写的是同一批原文,比较可以在学术文、新闻、小说、博客、口述转录与影视剧本等体裁之间真正「苹果对苹果」。

03 — The Data14 个短语 × 33,160 篇配对文档

每个单元格表示约 500 词文档(每位作者 n = 8,290)中至少出现一次该短语的占比——底色深浅与占比成正比。匹配不区分大小写,并覆盖词形变化(如 delve/delving/delves)。

表 1 — 各短语在文档中的出现占比(按作者)HAP-E 语料 · n = 8,290 篇 ≈ 每位作者 410 万词 · 按 GPT-4o ÷ Human 比值排序
PhraseHumanGPT-4oGPT-4o miniLlama 3 70BGPT-4o ÷ Human
tapestry0.10%19.8%20.9%1.5%205×
testament to0.10%16.1%8.4%5.4%167×
in conclusion0.07%7.2%5.4%11.5%100×
underscores / underscoring0.13%12.7%9.9%0.7%96×
vibrant0.17%12.1%16.8%2.3%72×
delve / delving0.27%8.1%8.7%2.9%31×
serves as a0.13%3.3%4.3%0.8%25×
crucial role0.08%2.1%1.7%2.2%24×
not only … but also1.30%15.4%23.4%1.5%12×
showcase / showcasing0.31%3.3%6.2%1.1%11×
moreover2.42%12.3%17.7%6.3%5.1×
furthermore2.48%8.6%11.4%12.6%3.5×
worth noting0.10%0.16%0.24%0.35%1.6× n.s.
important to note0.21%0.04%0.10%0.13%0.2×
文档占比更高 文档占比更低 ≥30× 强 AI 标记 n.s. / reverse 不可靠的 AI 证据

除 "worth noting" 外,所有差距在 p < 0.01 水平上统计显著(卡方检验,2×2,连续性校正)。人类基线 = 同一源文本的真实续写(HAP-E「chunk 2」)。

图 1 — 六大最强标记:GPT-4o vs 人类,同一写作任务
含该短语的文档占比 · 柱长按 21% 缩放
tapestry
GPT-4o19.8%
Human0.10%
testament to
GPT-4o16.1%
Human0.10%
underscores / underscoring
GPT-4o12.7%
Human0.13%
vibrant
GPT-4o12.1%
Human0.17%
in conclusion
GPT-4o7.2%
Human0.07%
delve / delving
GPT-4o8.1%
Human0.27%
GPT-4o (gpt-4o-2024-08-06)人类(配对续写)
26.1%
GPT-4o
含 "tapestry" "delve" 的文档——超过四分之一
72×
GPT-4o 与人类写作者在同一双词检验上的差距——同一主题、同一篇幅、同一体裁
0.36%
人类写作者
同一检验、同一写作任务——约每 276 篇才有 1 篇

04 — Model Comparison每个模型都有自己的指纹

一份「AI 短语清单」往往把所有模型当成同一个作者。数据并非如此——每个模型都有一套标志性习惯:

GPT-4o

「tapestry」模型——偏意象化的抽象词
tapestry19.8%
testament to16.1%
underscores12.7%

GPT-4o mini

更小的模型,套话更重——偏结构模板
not only … but also23.4%
tapestry20.9%
moreover17.7%

Llama 3 70B

少用「ChatGPT 词」——偏爱议论文脚手架
furthermore12.6%
in conclusion11.5%
tapestry1.5%
启示:只按 2023 年 ChatGPT 词表调校的检测器,会漏掉 Llama 风格的输出,反之亦然。可靠的 AI 写作检测必须综合许多重叠信号——措辞、节奏、结构——而不是一张词表。这也正是 Naturalmelo 的 AI 率检测做句级检测的思路。

05 — Myth Check两条著名「AI 铁证」未通过检验

谣言破除
"It's important to note…"

或许是互联网上被引用最多的 ChatGPT 短语——然而 GPT-4o 在 8,290 篇文档中只用了 3 次(0.04%),比人类写作者(0.21%)还少五倍

不显著
"Worth noting…"

任一模型与人类写作者之间均无统计显著差异(p = 0.38)。把它圈成 AI 证据,等于在猜。

为什么?短语习惯是版本相关的。早期 ChatGPT(GPT-3.5,2023)在问答场景里大量「留后路」,梗就这样流传下来。但 2024 一代模型写连贯长文时习惯不同——套话从规避风险("important to note")转向了宏大修辞("a testament to"、"a rich tapestry")。

给老师与编辑的提醒:"furthermore" 与 "moreover" 大约出现在 2.5% 的真实人类文档中——是我们测到的人类基线最高的一批。把一个 "furthermore" 当成 AI 证据,误伤真人的概率远高于那批 205× 级标记。单个短语只是概率性线索,绝不是铁证——这与业界报告的 AI 检测器约 20% 误报率是一致的。

06 — Case Study"Tapestry" 入侵小说

差距最大的地方,往往是这个词最不该出现的地方。在续写经典小说——公版长篇与短篇时:

29.1%

的 GPT-4o 小说续写塞进了 "tapestry" 一词(1,395 篇中的 406 篇)——而真实人类续写仅为 0.5%(1,395 篇中的 7 篇)。在一个几乎用不上这个词的体裁里,差距仍达 58×。

GPT-4o29.1%
Human0.5%
"The bustling scenes outside the window blurred past, a tapestry of colors and shapes, as adventures waited just beyond the horizon." —— GPT-4o 续写一部公版儿童小说(HAP-E,文档 fic_0012@gpt-4o-2024-08-06)

这就是模板化措辞的签名:无论语境如何,模型都伸手去够同一种装饰性抽象。这也是为什么句级审阅优于整篇一个分数——标记应该指向那一句,而不是模糊地扣在整页上。

07 — Takeaways对学生与写作者意味着什么

如果你用 AI 起草或润色:风险最高的短语,往往不是你听过的那些。交稿前,在草稿里搜一下 tapestry, testament, underscores, vibrant, delve, showcase, not only… but also——每一个在 AI 文本中都高出人类 10–205×。换成具体、有所指的说法,就能去掉最强的模板信号。

如果你不用 AI 写作:从统计上看,你不太可能踩中强标记(含 "tapestry" 或 "delve" 的人类文档不到 1/250)。但你很可能用到 "furthermore" 或 "moreover"——粗糙的短语清单检测仍可能把你标红。若真发生,版本历史与草稿仍是最好的证据;可参阅我们的指南:AI 检测原理

30 秒自查你的草稿

Naturalmelo 免费 AI 率检测按句标出模板套话——包括本研究中的这些标记——并可一键对标红句子降重。免登录。

免费开始 AI 率检测 → 或直接用 AIGC降重 处理标红文本

08 — Methods研究方法

语料

我们使用 Human-AI Parallel Corpus(HAP-E),由卡内基梅隆大学研究者发布(Reinhart、Brown 等,2024;arXiv:2410.16107)。HAP-E 取 8,290 篇真实约 1,000 词的人类文本,覆盖六种体裁(学术文章、新闻、小说、博客、播客转录、影视剧本),每篇拆成两段约 500 词的 chunk,把第一段交给大语言模型,要求它以相同风格与语气续写接下来约 500 词。真实的第二段人类 chunk 作为配对的人类基线——同一主题、同一语域、同一目标篇幅。

比较的作者

人类续写(「chunk 2」)、GPT-4o(gpt-4o-2024-08-06)、GPT-4o mini(2024-07-18)以及 Llama 3 70B Instruct——各 8,290 篇,合计 33,160 篇文档、约 1,650 万词。(HAP-E 还包含 Llama 基座模型,我们未纳入,因为它们并非作为写作助手部署。)

测量方式

对 14 个短语模式,我们分别统计每位作者中至少出现一次该模式的文档数(不区分大小写的子串匹配;词干模式覆盖屈折形式,如 delv- → delve/delves/delving)。计数通过有文档记录的 SQL(DuckDB)查询,于 2026年8月2日 经 Hugging Face datasets 服务器对语料完成,可精确复现。报告的是「文档包含占比」,而非原始 token 频率,以使各文档权重相等。显著性检验:带连续性校正的 2×2 卡方。

局限

  • 子串匹配可能纳入少量非目标用法(例如 "underscore" 作为人名也会计入);在每组 n = 8,290 的规模下,相对我们观察到的差距,这类噪声可忽略。
  • 语料对标点做了规范化,因此流行的标点「铁证」(如破折号 em dash)无法在此检验。
  • 模型属于 2024 一代;更新模型会改变指纹——这本身就是本研究的论点之一,我们计划定期重跑。
  • 仅英语。不同语言的短语清单不同。
  • 短语频率说明 AI倾向于怎么写,不能证明某一篇具体文本是否由 AI 写成。这些数字单独都不能认定作者身份。

数据与许可

本页的研究发现与图表以 CC BY 4.0 发布——可自由复用,请署名 Naturalmelo Research 并链接至本页。底层语料 © HAP-E 作者(CC BY 4.0)。

09 — Questions常见问题

用了 "delve" 或 "tapestry" 就能证明文本是 AI 写的吗?

不能。这些短语是强概率标记——"tapestry" 在 GPT-4o 文本中大约是配对人类文本的 205×——但真人也会用(我们数据里约每 1,000 篇人类文档有 1 篇)。把它们当作需要复看某句的信号,绝不要当作作者身份的铁证。

"it's important to note" 是可靠的 ChatGPT 迹象吗?

对当前模型来说不是。在我们 2026 年对 8,290 篇 GPT-4o 文档的分析中,"important to note" 仅出现在 0.04% 的文档里——比配对人类写作(0.21%)还少。该短语是 2023 年 ChatGPT 在问答场景里的习惯;写连贯长文的现代模型很少再用。

2026 年最强的 AI 标记词是哪些?

在本研究中:相对配对人类写作,tapestry(205×)、testament to(167×)、in conclusion(100×)、underscores(96×)、vibrant(72×)以及 delve(31×)。组合检验「含 tapestry 或 delve」可将 GPT-4o 与人类分开:26.1% vs 0.36%。

所有 AI 模型都会滥用同一批短语吗?

不会。GPT-4o 偏爱 tapestry/testament/underscores;GPT-4o mini 在 not only… but alsovibrant 上领先;Llama 3 70B 大多避开这些,却过度使用 in conclusionfurthermore。只按单一模型词表做检测,会漏掉其他模型。

用了 "furthermore" 或 "moreover" 会被误标吗?

粗糙的短语检测有可能——这些连接词出现在约 2.5% 的真实人类文档中,在 AI 文本中仅升高约 3–7×,是我们测到的最弱信号。好的检测应综合句级多重信号,而不是盯住一个词;任何标记都应可复审,而不是自动定论。

如何对照这些标记自查草稿?

Naturalmelo 的免费 AI 率检测按句扫描模板套话(含本研究中的模式),说明每句为何被标红,并可用内置 AIGC降重 改写标红句子。免费、免登录,适用于 50–1,000 词草稿。

10 — Citation如何引用本研究

记者、教师与研究者欢迎署名复用这些发现。 Naturalmelo Research (2026). "The AI Vocabulary Gap: Phrase Frequency in 33,160 Matched Human and AI Texts." Naturalmelo. https://www.naturalmelo.com/research/ai-vocabulary-gap (data: HAP-E corpus, Reinhart et al. 2024, arXiv:2410.16107; analysis CC BY 4.0)

相关阅读:AI 检测原理 · 人话改写技巧 · Naturalmelo vs Turnitin