皮尤研究:ChatGPT 发布后,超三成新网页带 AI 创作痕迹
皮尤研究中心 8 月 20 日发布的一项研究显示:2026 年 7 月随机抽样的 1 万个英文网页里,约 10% 有明显 AI 写作或 AI 大幅编辑的痕迹;而如果把范围限定在 ChatGPT 发布之后创建的网页,这个比例超过三分之一。换句话说,AI 早就不再只是写作工具,它正在成为互联网新内容的"默认生产方式"。
数据是怎么来的
据皮尤公布的方法,他们从 Common Crawl 网页存档中取了近 50 万个英文网页,时间跨度从 2021 年 1 月到 2026 年 7 月,然后用 Pangram 的开放权重 AI 检测模型 Open Pangram 逐页分析,看文本里是否存在明显的 AI 创作特征。几个关键数据(据报道):
- 2026 年 7 月样本中,约 10% 的网页有明显 AI 创作或大幅编辑痕迹;
-
- ChatGPT(2022 年 11 月发布)之后创建的网页,超过三分之一带 AI 痕迹;
-
- 按域名看,.com 约 10%,.org 约 4.6%,.edu 和 .gov 都只有约 1%——商业网站的比例大约是教育和政府网站的 10 倍;
-
- AI 文本的特征词也在全网扩散:破折号(em dash)出现频率比 2023 年翻了一倍,牛津逗号增加了 63%,delve、tapestry 这类 AI 高频词翻了一倍以上,"not just X, it’s Y"式的否定排比句式涨了近三倍。
技术本质:AI 文本有"口音"
检测模型能认出 AI 写的东西,靠的不是玄学,是统计。大模型的训练数据里,某些词和句式被过度表达,于是生成时这些特征出现的频率明显高于人类平均值,时间长了就形成一种可被识别的"AI 口音"。皮尤自己也承认:这类检测模型不完美,会误判,单个文档很难下结论,但大样本下的趋势是可靠的。
这个研究最值得注意的不是"AI 写了很多内容"本身,而是两点:第一,AI 内容的占比在持续爬升,按皮尤给出的分阶段数据,.com 域名的 AI 痕迹比例从 2023 年初的 1% 出头涨到了现在的约十分之一;第二,检测与反检测是一场军备竞赛,今天靠"delve"这类词识别的模型,明天就会被刻意绕开这些词的生成策略反制。
对打工人意味着什么
对普通从业者,最现实的感受是信息变"脏"了:搜索结果里大量 AI 批量生产的文章,读半天发现全是套话;对做内容、运营、SEO 的岗位,AI 内容已经抬高了竞争水位——你不一定被 AI 替代,但得跟海量 AI 生成内容抢流量、抢信任。
对写代码和写文档的人来说,还有个实际风险:代码注释、技术博客如果满是模板化套话,被 AI 检测工具标记的概率不小,而招聘、投稿审核环节已经有人开始用这类工具做初筛。
怎么识别、怎么应对
想直观感受 AI 文本的特征,可以用下面这个脚本统计本地文本里的高频 AI 特征词(只依赖 Python 标准库,可以直接跑):
import re
from collections import Counter
text = open("article.txt", encoding="utf-8").read()
signals = ["delve", "tapestry", "testament", "pivotal", "underscore",
"moreover", "furthermore", "crucial", "landscape"]
words = re.findall(r"[a-z']+", text.lower())
freq = Counter(words)
for w in signals:
print(f"{w}: {freq[w]}")
```
(示例代码:统计本地文本中 AI 高频特征词的出现次数)
几个实用建议:
- **内容/运营岗**:AI 生成只当草稿,务必补上真实细节、具体数字和个人判断,把套路词替换掉,这既是给读者看的,也是给检测模型看的;
- - **写代码和文档的**:注释和 README 写清楚"为什么这么写",别复制模板化表述,这对 AI 和同事都有价值;
- - **别迷信 AI 检测工具**:误报率不低,当参考可以,拿来定性某篇文章、某个作者,容易误伤;
- - **招聘和审核方同理**:用检测结果刷人之前,先想清楚误伤成本,检测模型连皮尤自己都说"不完美"。
## 结尾
AI 生成的内容正在以肉眼可见的速度淹没网页,人类亲手写的字反而可能变成稀缺品。这到底是内容通胀,还是新的机会,你怎么看,评论区聊聊。
更多推荐

所有评论(0)