三分之一的新网页疑似由 AI 参与撰写:互联网正在失去原件

如果互联网的信噪比持续恶化,最先受到冲击的是依赖搜索流量的内容生产者。

Pew Research Center本周发布了一项基于Common Crawl网络档案的大规模分析。研究团队从2021年1月到2026年7月间的49次网页抓取中,各随机抽样1万个英文网页,合计约49万个页面,然后用一个名为Open Pangram的AI检测模型逐页扫描。

结论可以用两个数字概括。2026年7月的全量快照中,约10%的英文网页呈现出"显著的AI写作或深度编辑迹象"。如果只看ChatGPT发布(2022年11月30日)之后上线的网页,这个比例飙升到35%。

35%这个数字不是说三分之一的互联网由AI写成,因为互联网上沉淀着大量2022年之前的存量页面,但它指向一个清晰的方向:新增内容里,AI参与正在从例外变成常态。

哪些角落AI含量最高?

分布并不均匀。

.com域名下,约十分之一的页面在2026年的样本中呈现AI写作特征,这个比例是.org域名(4.6%)的两倍多,是.edu和.gov域名(均约1%)的十倍,商业互联网吸收AI的速度远快于学术和政府机构。

Pew的研究还拆解了AI写作的"语言指纹"。

和2023年相比,2026年的新网页中,em dash(破折号)的使用频率翻了一倍,Oxford comma(牛津逗号)增加了63%,AI模型偏爱的词汇(如delve、interplay、tapestry、pivotal)使用量翻了一倍以上,而"it's not just X, it's Y"这种否定并列句式的出现频率接近三倍,这些单独看都不构成定罪证据,但统计聚合后指向一个明确的信号:新网页的语言纹理正在趋向AI生成文本的特征分布。

更大的图景:读者是谁?

Pew的报告关注的是"谁在写",但把它和另一组数据放在一起看,画面变得更完整。

2026年6月3日,Cloudflare CEO Matthew Prince在社交媒体上宣布了一个他自己也没料到会这么快到来的里程碑:AI机器人流量首次超过人类流量,占全球网页HTTP请求的57.4%。

他原本预计这个交叉点会在2027年底出现,实际提前了18个月。HUMAN Security的2026年报告给出了同一方向的数据:2025年全年,AI驱动的自动流量增速是人类流量增速的8倍,其中"代理型AI"(agentic AI,代替用户执行任务的AI)的流量同比增长了近8000%。

把这两件事拼起来:互联网内容的供给侧,三分之一的新增网页由AI参与撰写;需求侧,超过一半的"读者"是机器。一个本来为人类交流而建造的基础设施,正在加速变成机器写给机器看的信息管道。

自我污染循环

这不只是一个关于"内容质量下降"的故事,它触及AI行业自身的地基问题。

2024年,Nature发表了一篇来自牛津和剑桥研究团队的论文,证明AI模型在递归训练(用AI生成的数据训练下一代AI)中会出现"模型坍缩"(model collapse):输出逐渐偏离真实世界的数据分布,丢失分布尾部的稀有模式,经过数代迭代后生成越来越同质化甚至无意义的内容。Epoch AI的研究者预测,适合训练AI的高质量人类原创文本可能在2026到2032年之间耗尽。

循环已经可以描述了:AI模型读取人类互联网,批量生成新网页;新网页被搜索引擎收录,被Common Crawl之类的抓取工具归档;下一代AI模型继续用这些数据训练。每一轮循环,训练数据中"AI写AI"的浓度都在升高,而真正来自人类一手经验的信号在被稀释。

如果互联网的信噪比持续恶化,最先受到冲击的是依赖搜索流量的内容生产者。

搜索结果被同质化的AI改写内容填满,意味着读者越来越难区分"原件"和"复印件"。Google已经在用AI Overview取代部分搜索结果的点击链接,Pew今年7月的另一项研究发现,只有20%的用户认为AI搜索摘要"非常有用",仅6%表示"非常信任"。

当AI生成的二手转述遍地都是,能提供以下内容的媒体将获得稀缺性溢价:到过现场的一手信息,独家获取的数据和文件,可以追溯到具体人类来源的观点和判断,以及读者愿意为之付费的编辑品味。

从另一个角度来看,衡量一家媒体竞争力的指标正在悄悄变化。

发稿数量已经不是壁垒,AI可以一天生成一千篇,真正的壁垒是“可证明的人类原创”:这篇稿子里的信息,是记者跑出来的还是模型编出来的?这个判断,是有行业经验的编辑做出的还是prompt拼接的?

在一个35%新网页都带有AI痕迹的互联网上,能够回答好上述问题,就是竞争优势。

发布于
免责声明:市场有风险,投资需谨慎,本文不构成投资建议