当AI开始吃掉互联网:一场没人想付账的盛宴

当AI开始吃掉互联网:一场没人想付账的盛宴

开放互联网最讽刺的结局,可能是被它自己养大的AI吃干抹净。

当AI开始吃掉互联网:一场没人想付账的盛宴

从 kernel.org 的十四个CPU核心说起

先说一件小事。

9月7日,Linux 内核官方仓库 kernel.org 的管理员发了一篇博客,标题叫 “Creepy Crawlies”。内容不复杂:他们在 5 个分布式节点上常驻了 14 个CPU核心,只为给AI爬虫渲染 commit 页面。这些请求的算力消耗,已经超过了所有正常用户 git clone 的总和。

管理员给这种流量起了个名字:”背景辐射”。

无处不在,屏蔽不掉,也不针对谁,就是持续地、安静地耗着你的电。

说真的,我看完第一反应是想起自己服务器上那些永远查不清来源的异常流量。原来 Linux 基金会也为这种事头疼,而且比我们惨得多。

爬虫为什么突然变贵了

爬虫不是新东西。Googlebot 爬了二十多年,大家早就习惯了。那为什么现在突然吵起来?

成本结构变了。

老式爬虫抓 HTML、建索引,服务器端几乎无感。AI 时代的机器流量分三种,代价完全不在一个量级:

流量类型 典型代表 服务器成本 站长得到什么
索引爬虫 Googlebot 搜索流量回报
训练爬虫 LLM 数据采集 中高 几乎为零
智能体流量 AI Agent 实时抓取渲染 极高(要跑JS渲染) 零,读者还被分走了

第三种最要命。智能体为了回答用户一个问题,可能要实时抓取并渲染十几个网页。渲染是重操作,比抓静态页面贵一个数量级。而站长得到什么?什么都没有。用户看到的是AI的转述,原始页面可能一次都没被打开过。

Googlebot 至少还会把流量还给你。AI爬虫是纯抽取。

连锁反应已经开始

这件事不会停留在”服务器管理员发牢骚”的层面。几个信号都摆在这了:

  • Cloudflare 推出了 pay-per-crawl,按次向AI爬虫收费,默认拦截
  • Reddit 和 X 早就把 API 锁起来卖了,训练数据明码标价
  • 宾州的社区居民联名抵制数据中心,理由是用电、用水和噪音
  • HN 上一则实测显示:Google AI Mode 推荐的商品,比传统搜索结果平均贵 21.6%

最后一条值得多看一眼。它说明AI中间层不只是在抽走流量,还在悄悄改变你看到的东西。当搜索结果变成AI的转述,选择权在谁手里,商业中立性就得打个大问号。

灯火通明的数据中心机房

数据中心是另一重压力。AI 的算力需求是实打实的物理消耗,电、水、地,样样都要。当基建开始影响居民生活,政治反弹只是时间问题。FT 那篇报道里,宾州选民的态度很直白:不反对技术,但别建在我家后院。

谁来付账,怎么付

问题摆在这了:机器流量免费薅羊毛的模式撑不下去,接下来怎么走?我看到几条路径:

  1. 大平台直接签授权协议。Reddit 模式,训练数据明码标价。缺点是只有头部玩家有谈判筹码,个人博客什么也拿不到
  2. 按次付费抓取。pay-per-crawl 是这个思路,爬虫付费才能进。技术上可行,难在定价和支付基础设施
  3. 技术性反制。类似 Anubis 那种工作量证明,让爬虫自己付出算力成本。kernel.org 迟早会走到这一步
  4. 什么都不做。小站点被薅死,大平台筑墙,开放互联网萎缩成几个付费花园

我个人觉得第 2 条最有希望,但也最难。它需要一套类似广告联盟的东西,让千万个小站长能低成本地”挂表计费”。这件事到现在没人做,是因为没人能靠它赚快钱,而不是做不了。

真正的输家是谁

写到这里,说一个可能有点反直觉的判断。

数据墙本身不可怕,可怕的是墙建起来之后,互联网上只剩下墙。

很多人把爬虫对抗理解成”AI公司 vs 内容方”的博弈,我觉得没抓住重点。真正被这场消耗战消耗的,是开放网络本身:个人博客、论坛、维基、开源项目文档,这些不设防的公共空间。它们没钱签授权协议,也没技术团队部署反爬,最先撑不住的一定是它们。

讽刺的地方在于,AI产业是开放网络最大的受益者,理论上也是最希望它活下去的一方。语料枯竭已经是行业里公开的焦虑,如果开放互联网继续被自己家的爬虫压垮,明年拿什么训练?

这是经典的囚徒困境:每家AI公司单独看,多爬一点是赚的;大家一起爬,把公共资源爬垮,全输。kernel.org 那 14 个CPU核心,就是这场困境里一个具体的、小小的注脚。

交错延伸的光纤网络

Greg Brockman 最近写过一篇 “The Defender’s Window”,讲AI安全防御的时间窗口。我觉得这个词挪到这里也合适:现在还来得及建立新的流量规则,等大多数站点都筑了墙,再想拆就难了。

写在最后

  • kernel.org 披露AI爬虫算力消耗已超过正常 git clone,机器流量成了”背景辐射”
  • 智能体流量的成本结构和传统爬虫完全不同:渲染贵,回报为零
  • 几条应对路径里,按次付费最有希望,但缺基础设施
  • 最该担心的不是大平台筑墙,而是不设防的开放网络空间先被消耗殆尽

互联网当年能长成一片旷野,是因为早期大家都默认分享的成本低到可以忽略。AI正在把这个前提拆掉。接下来几年我们怎么给”抓取”重新定价,大概率会决定二十年后网上还剩多少野地。