当RSS拔掉管子:Reddit对AI爬虫的釜底抽薪

当RSS拔掉管子:Reddit对AI爬虫的釜底抽薪

9月30日,Reddit做了件很多人以为早就发生了的事:RSS订阅全线下线,公开API访问同步终止,TechCrunch转述官方理由时毫不掩饰,因为AI爬虫。一个每天被大模型倒背如流的网站,决定不再让任何机器免费读它。很多人当它是又一次平台收费的老套路,我却觉得这事比API定价重要得多:RSS死了不到十年,这次连它的尸体也被收走了。Reddit拔掉的不是一条数据管子,是搜索引擎时代留下的最后一根公共管子。管子里流的,是下一代模型的训练数据。

当RSS拔掉管子:Reddit对AI爬虫的釜底抽薪

一、关掉RSS防不了爬虫,但能精确地防住「便宜」

先说一个可能和直觉相反的技术判断:关RSS在防爬虫这件事上,几乎是无效防御。会写爬虫的人都知道,RSS只是结构化输出的便利接口。拿掉它,真实内容的传输层一点没少,网页本体还在,HTML还在,移动端接口还在。真正难缠的分布式抓取网络从来不需要RSS,它们模拟浏览器指纹,轮换住宅IP,随机化访问节奏,反爬工程师把这类流量叫「不可约分数」,意思是无论怎么拦总有一部分能漏过去。Reddit既然已经开始向Google收费授权,反爬能力的下限是有的,但它面对职业爬虫本就是猫鼠游戏,RSS下线改变不了战局。

那Reddit图什么?图的是成本曲线的另一端。RSS堵住的从来不是「能不能抓」,而是「抓得多便宜」。它免去了写解析器的成本,把内容获取的成本压到接近零。拔掉RSS,等于把获取成本从近零抬回到「写解析器」的门槛上。对职业爬虫,这道门槛拦不住;对成千上万中小工具、研究者和独立开发者,这道门槛就是一堵墙。所以这次下线的防御效能有限,价格信号却极其精确:这扇门的把手,以后不白给了。顺带受伤的是被殃及的第三方生态,Reddit Aux类的老工具一夜断粮,而它们从来不是Reddit的收入来源,只是开放时代的纪念品。

数据中心的服务器与线缆:开放数据接口正在一个个熄灯

二、Reddit对模型公司不是一个网站,是三层筛选器

为什么一家论坛公司的技术决定值得写一千字?因为Reddit在AI产业链里的位置,远比「一个社区」重要。它是三层筛选器叠在一起的东西。

第一层是规模。Reddit官方口径的月活用户超过三亿,每天的帖子和评论以亿计。这些文本不是营销稿,不是新闻通稿,是带上下文、带反驳、带追问的真实对话。英文互联网上能同时满足大规模、对话式、真实这三个条件的语料源,一只手数得过来。

第二层是密度,或者说语气密度。Reddit的投票机制是编辑不在场的编辑:用户推什么,什么就被看见。二十年的用户投票蒸馏出一个网站的集体语气,TIL、LPT、Change My View,还有无数只有老用户才懂的缩写黑话。这些指纹让Reddit文本在训练语料里一眼可辨。而模型公司恰恰最馋这种高信号密度的文本:AI味最浓的语料来源是AI自己产出的内容,最香的来源恰恰是投票蒸馏出来、带真实人类情绪的讨论。近两年评测圈甚至流行一个提示词技巧,在题目后面加一句「如Reddit所述」,让模型模仿社区语气来回答。当一家公司的内容成了行业默认的考试题库,它就不再只是个网站,而是一种基础设施。

第三层是时效性。知识截止日期是每家模型公司的命门,而Reddit是全网少有的每天自发产出海量、多样、带讨论链的高质量文本的地方。同一个事件,不同版块的视角差异极大;同一个帖子,评论区里自发地附证据、附经验、附反驳。对训练管线来说,这不是论坛,是一条每天自我更新的高质量文本流水线。

规模、密度、时效,三样东西组合起来意味着一件事:模型公司每次迭代都要回来重新进货。这不是一次性买断,是订阅关系。而订阅关系的另一面是,供应商一旦断供,你每一次迭代都被人捏着闸门。模型公司的自由航行权,从第一天起就是租来的。

真实的人类讨论:投票蒸馏出的语气,是语料里最贵的部分

三、人可读和机器可读,原来是同一根管子

我自己是RSS的遗民。2013年Google Reader被关的时候,我花了一个下午把订阅列表迁去Feedly,然后眼睁睁看着自己花在阅读器上的时间被算法信息流一口口吃掉。所以这次Reddit动手,我以为我只会从数据经济的角度关心它,没想到最刺痛我的是另一件事:人可读与机器可读,原来一直是同一根管子,而且机器这份账单是后付的。

回想一下旧网络的默契:内容公开挂在网上,robots.txt管的是礼貌而不是法律,RSS和公开API是这个默契的工程化表达。搜索引擎拿着这份默契建起了万亿生意,网站拿着流量分成,大家相安无事。Reddit自己就是这个时代的最大受益者之一,它的全部内容,都来自用户以为自己在参与「公开讨论」。转折点是2023年,Reddit和Google签下每年6000万美元的数据授权协议,「公开可获取」这个词第一次带上了价格标签。随后几年剧本不断加码:先区分训练用途和搜索用途,再给AI爬虫单列条款,到今天直接把便利接口整根拔掉。五年时间,「公开」的内涵被重新定义了:公开等于人可读,公开不再等于机器可读。

有意思的是谁在付账。搜索引擎当年是这份默契的既得利益者,AI公司本该是它的继承者,结果却是AI公司把这份默契送进了坟墓。不是因为他们更贪婪,而是因为机器的胃口和人不一样:人每天只读几十页,机器每天要吞整个互联网。当读者从人变成模型,公开的成本结构就彻底变了,任何平台都会重新算账。算完之后,账本上只写着一个词:授权。

结语:管子拔掉之后,谁在漏水

短期看,这事伤不到大模型公司。它们付得起授权费,Reddit也乐于收钱,一只愿打一只愿挨。真正的输家排在后面:拿不到授权费的开源社区,靠公开数据做研究的学术界,以及所有付不起入场费的创业公司。开放数据的公共池在缩小,未来能在池子里游泳的,只剩付得起门票的人。

长期看,更值得担心的是模型这一侧。当训练数据的公共来源一根根熄灯,模型的通用性会慢慢背上一笔隐性债务:它对世界的理解,越来越依赖几大平台愿意卖给它的那部分世界。我们以为模型在学习人类,其实它在学习被授权的那部分人类。

最后说回Reddit自己。它拔掉的是别人搭的管子,可别忘了,它也是靠开放网络的爬虫和聚合长成今天的规模的。它用户以为的公开讨论,成了明码标价的商品。这才是真正的寓言:开放网络的公共性,很少死于技术的淘汰,多半死于第一个发现它可以变现的人。RSS的尸体被收走只是开始,下一个被重新定价的,会是今天我们习以为常的每一样「公开」的东西。


题图与文中配图:封面为程序生成;两张实拍图来自Unsplash,署名如下。

📷 Photo by Albert Stoynov on Unsplash

📷 Photo by Vitaly Gariev on Unsplash