AI 词汇鸿沟:33,160 篇配对人机文本,揭示 AI 究竟怎么写
我们统计了 14 个广为人知的「AI 味」短语,在配对的人类与 AI 写作中实际出现的频率——每位作者各 8,290 篇文档,合计约 1,650 万词。有些 AI 套话在 GPT-4o 文本中最高可达人类的 205×。另一些——包括最出名的那条「AI 铁证」——则被证明是误传。
01 — Overview核心发现
为什么重要:像 "furthermore"、"moreover" 这类经典连接词,在 AI 文本中仅升高约 3–7×,却仍出现在约 2.5% 的真实人类文档中——这也是「凭单个短语抓 AI」容易误伤无辜的原因之一。可靠的检测需要基线频率(base rate),而这正是本研究提供的。
02 — Background我们为什么做这项研究
几乎人人「都知道」AI 写作里满是 delve(深挖)、tapestry(织锦/万花筒式比喻)和 it's important to note。老师会把这些短语圈出来;Reddit 帖子把它们当成 ChatGPT 的铁证;检测工具也会标记它们。可几乎没人公布过基线频率:这些短语在 AI 文本里究竟多常见——同样重要的是,真人写作者用得有多勤?
第二个数字决定了一个短语究竟是证据,还是误伤机器。于是我们两边都测了,数据来自 HAP-E 平行语料库(Reinhart 等,卡内基梅隆大学,2024)——一套难得的数据:人类与大语言模型续写的是同一批原文,比较可以在学术文、新闻、小说、博客、口述转录与影视剧本等体裁之间真正「苹果对苹果」。
03 — The Data14 个短语 × 33,160 篇配对文档
每个单元格表示约 500 词文档(每位作者 n = 8,290)中至少出现一次该短语的占比——底色深浅与占比成正比。匹配不区分大小写,并覆盖词形变化(如 delve/delving/delves)。
| Phrase | Human | GPT-4o | GPT-4o mini | Llama 3 70B | GPT-4o ÷ Human |
|---|---|---|---|---|---|
| tapestry | 0.10% | 19.8% | 20.9% | 1.5% | 205× |
| testament to | 0.10% | 16.1% | 8.4% | 5.4% | 167× |
| in conclusion | 0.07% | 7.2% | 5.4% | 11.5% | 100× |
| underscores / underscoring | 0.13% | 12.7% | 9.9% | 0.7% | 96× |
| vibrant | 0.17% | 12.1% | 16.8% | 2.3% | 72× |
| delve / delving | 0.27% | 8.1% | 8.7% | 2.9% | 31× |
| serves as a | 0.13% | 3.3% | 4.3% | 0.8% | 25× |
| crucial role | 0.08% | 2.1% | 1.7% | 2.2% | 24× |
| not only … but also | 1.30% | 15.4% | 23.4% | 1.5% | 12× |
| showcase / showcasing | 0.31% | 3.3% | 6.2% | 1.1% | 11× |
| moreover | 2.42% | 12.3% | 17.7% | 6.3% | 5.1× |
| furthermore | 2.48% | 8.6% | 11.4% | 12.6% | 3.5× |
| worth noting | 0.10% | 0.16% | 0.24% | 0.35% | 1.6× n.s. |
| important to note | 0.21% | 0.04% | 0.10% | 0.13% | 0.2× |
除 "worth noting" 外,所有差距在 p < 0.01 水平上统计显著(卡方检验,2×2,连续性校正)。人类基线 = 同一源文本的真实续写(HAP-E「chunk 2」)。
04 — Model Comparison每个模型都有自己的指纹
一份「AI 短语清单」往往把所有模型当成同一个作者。数据并非如此——每个模型都有一套标志性习惯:
GPT-4o
GPT-4o mini
Llama 3 70B
05 — Myth Check两条著名「AI 铁证」未通过检验
或许是互联网上被引用最多的 ChatGPT 短语——然而 GPT-4o 在 8,290 篇文档中只用了 3 次(0.04%),比人类写作者(0.21%)还少五倍。
任一模型与人类写作者之间均无统计显著差异(p = 0.38)。把它圈成 AI 证据,等于在猜。
为什么?短语习惯是版本相关的。早期 ChatGPT(GPT-3.5,2023)在问答场景里大量「留后路」,梗就这样流传下来。但 2024 一代模型写连贯长文时习惯不同——套话从规避风险("important to note")转向了宏大修辞("a testament to"、"a rich tapestry")。
06 — Case Study"Tapestry" 入侵小说
差距最大的地方,往往是这个词最不该出现的地方。在续写经典小说——公版长篇与短篇时:
的 GPT-4o 小说续写塞进了 "tapestry" 一词(1,395 篇中的 406 篇)——而真实人类续写仅为 0.5%(1,395 篇中的 7 篇)。在一个几乎用不上这个词的体裁里,差距仍达 58×。
"The bustling scenes outside the window blurred past, a tapestry of colors and shapes, as adventures waited just beyond the horizon." —— GPT-4o 续写一部公版儿童小说(HAP-E,文档 fic_0012@gpt-4o-2024-08-06)
这就是模板化措辞的签名:无论语境如何,模型都伸手去够同一种装饰性抽象。这也是为什么句级审阅优于整篇一个分数——标记应该指向那一句,而不是模糊地扣在整页上。
07 — Takeaways对学生与写作者意味着什么
如果你用 AI 起草或润色:风险最高的短语,往往不是你听过的那些。交稿前,在草稿里搜一下 tapestry, testament, underscores, vibrant, delve, showcase, not only… but also——每一个在 AI 文本中都高出人类 10–205×。换成具体、有所指的说法,就能去掉最强的模板信号。
如果你不用 AI 写作:从统计上看,你不太可能踩中强标记(含 "tapestry" 或 "delve" 的人类文档不到 1/250)。但你很可能用到 "furthermore" 或 "moreover"——粗糙的短语清单检测仍可能把你标红。若真发生,版本历史与草稿仍是最好的证据;可参阅我们的指南:AI 检测原理。
30 秒自查你的草稿
Naturalmelo 免费 AI 率检测按句标出模板套话——包括本研究中的这些标记——并可一键对标红句子降重。免登录。
免费开始 AI 率检测 → 或直接用 AIGC降重 处理标红文本08 — Methods研究方法
语料
我们使用 Human-AI Parallel Corpus(HAP-E),由卡内基梅隆大学研究者发布(Reinhart、Brown 等,2024;arXiv:2410.16107)。HAP-E 取 8,290 篇真实约 1,000 词的人类文本,覆盖六种体裁(学术文章、新闻、小说、博客、播客转录、影视剧本),每篇拆成两段约 500 词的 chunk,把第一段交给大语言模型,要求它以相同风格与语气续写接下来约 500 词。真实的第二段人类 chunk 作为配对的人类基线——同一主题、同一语域、同一目标篇幅。
比较的作者
人类续写(「chunk 2」)、GPT-4o(gpt-4o-2024-08-06)、GPT-4o mini(2024-07-18)以及 Llama 3 70B Instruct——各 8,290 篇,合计 33,160 篇文档、约 1,650 万词。(HAP-E 还包含 Llama 基座模型,我们未纳入,因为它们并非作为写作助手部署。)
测量方式
对 14 个短语模式,我们分别统计每位作者中至少出现一次该模式的文档数(不区分大小写的子串匹配;词干模式覆盖屈折形式,如 delv- → delve/delves/delving)。计数通过有文档记录的 SQL(DuckDB)查询,于 2026年8月2日 经 Hugging Face datasets 服务器对语料完成,可精确复现。报告的是「文档包含占比」,而非原始 token 频率,以使各文档权重相等。显著性检验:带连续性校正的 2×2 卡方。
局限
- 子串匹配可能纳入少量非目标用法(例如 "underscore" 作为人名也会计入);在每组 n = 8,290 的规模下,相对我们观察到的差距,这类噪声可忽略。
- 语料对标点做了规范化,因此流行的标点「铁证」(如破折号 em dash)无法在此检验。
- 模型属于 2024 一代;更新模型会改变指纹——这本身就是本研究的论点之一,我们计划定期重跑。
- 仅英语。不同语言的短语清单不同。
- 短语频率说明 AI倾向于怎么写,不能证明某一篇具体文本是否由 AI 写成。这些数字单独都不能认定作者身份。
数据与许可
本页的研究发现与图表以 CC BY 4.0 发布——可自由复用,请署名 Naturalmelo Research 并链接至本页。底层语料 © HAP-E 作者(CC BY 4.0)。
09 — Questions常见问题
用了 "delve" 或 "tapestry" 就能证明文本是 AI 写的吗?
不能。这些短语是强概率标记——"tapestry" 在 GPT-4o 文本中大约是配对人类文本的 205×——但真人也会用(我们数据里约每 1,000 篇人类文档有 1 篇)。把它们当作需要复看某句的信号,绝不要当作作者身份的铁证。
"it's important to note" 是可靠的 ChatGPT 迹象吗?
对当前模型来说不是。在我们 2026 年对 8,290 篇 GPT-4o 文档的分析中,"important to note" 仅出现在 0.04% 的文档里——比配对人类写作(0.21%)还少。该短语是 2023 年 ChatGPT 在问答场景里的习惯;写连贯长文的现代模型很少再用。
2026 年最强的 AI 标记词是哪些?
在本研究中:相对配对人类写作,tapestry(205×)、testament to(167×)、in conclusion(100×)、underscores(96×)、vibrant(72×)以及 delve(31×)。组合检验「含 tapestry 或 delve」可将 GPT-4o 与人类分开:26.1% vs 0.36%。
所有 AI 模型都会滥用同一批短语吗?
不会。GPT-4o 偏爱 tapestry/testament/underscores;GPT-4o mini 在 not only… but also 与 vibrant 上领先;Llama 3 70B 大多避开这些,却过度使用 in conclusion 与 furthermore。只按单一模型词表做检测,会漏掉其他模型。
用了 "furthermore" 或 "moreover" 会被误标吗?
粗糙的短语检测有可能——这些连接词出现在约 2.5% 的真实人类文档中,在 AI 文本中仅升高约 3–7×,是我们测到的最弱信号。好的检测应综合句级多重信号,而不是盯住一个词;任何标记都应可复审,而不是自动定论。
10 — Citation如何引用本研究
Naturalmelo Research (2026). "The AI Vocabulary Gap: Phrase Frequency in 33,160 Matched Human and AI Texts." Naturalmelo. https://www.naturalmelo.com/research/ai-vocabulary-gap (data: HAP-E corpus, Reinhart et al. 2024, arXiv:2410.16107; analysis CC BY 4.0)
相关阅读:AI 检测原理 · 人话改写技巧 · Naturalmelo vs Turnitin