被污染的答案:AI搜索的信任危机

被污染的答案:AI搜索的信任危机

当AI替你读书,引用就成了它递给你的凭证。可现在有人发现,这凭证是假的。

被污染的答案:AI搜索的信任危机

这周两份独立审计把Perplexity送上了HN热榜。一份来自Haus Research,结论是它给出的引用里约三分之一找不到所引的数字;另一份挖出三个网站,批量造了21万多个”最佳软件”页面,专门骗AI搜索来引用。两件事拼在一起,画面有点难看:AI搜索引用的东西,可能既不真实,也不干净。

说真的,看到这组数据我的第一反应是似曾相识。

从关键词堆砌到引用投毒

二十年前,SEO从业者围着谷歌的排序规则转,关键词密度、外链农场、隐藏文字,什么招都试过。搜索引擎后来学会了识别这些把戏,行业才算消停了一阵。

现在同样的剧本换了舞台。AI搜索崛起之后,”被引用”成了新的流量入口,业内管这叫GEO(生成式引擎优化)。逻辑不复杂:用户不再点开十个链接自己比价,而是看AI给出的那个答案。答案引用了谁,谁的曝光机会就大。

于是有人开始研究怎么让AI引用自己。研究成果之一,就是那215,128个页面。它们不是写给人在看的,是写给模型在爬的。

引擎换了,动机没换。只要”排在前面的东西能换钱”,就一定有人规模化地伪造”排在前面的样子”。

三分之一引用,查无此数

Haus Research的审计细节更扎心。Perplexity答案里的引用,约三分之一打开后对不上原文的数字。表面看每句话都有出处,出处却是哑的。

这未必是模型在撒谎。更常见的情形是:答案由多个来源拼合、改写、再生成,数字在拼接中走了样,引用编号却原样挂着。用户拿到的是”有据可查”的观感,不是一条真正能走的验证链。

引用在这里退化成了一个UI组件。

AI搜索为什么会”信”

把AI搜索拆开,它的信任链条大致四步:

  1. 检索,从索引里拉出候选来源
  2. 排序,按权威度和相关度打分
  3. 生成,模型基于来源写答案
  4. 引用,把来源挂到答案上

问题出在第二步和第三步之间。排序衡量的是”这个来源像不像权威”,而内容农场最擅长的就是把”看起来像”做得非常便宜。RAG架构又强依赖检索结果,垃圾进,垃圾出。等答案递到用户手里,链接只剩装饰作用。

两个时代的玩法对比:

  SEO时代 GEO时代
攻击目标 搜索排序算法 AI答案的引用位
伪造对象 页面相关性 来源权威性
用户损失 时间 判断力
平台对策 反作弊算法 暂无成熟方案

数据审计:引用需要能被验证


修复比想象中难

我能想到的解法分三类:

  • 来源侧做内容溯源,让每个页面带上可验证的出身凭证,比如C2PA这类内容签名标准
  • 平台侧把引用从展示变成校验,答案里每个数字都能回溯到原文对应位置
  • 模型侧降低对单一来源的依赖,交叉验证,宁可承认不知道,也别给一个体面的错误答案

每条都不轻松。内容溯源要整个生态配合,长尾页面短期覆盖不了;引用校验明显增加推理成本,商业公司动力不足;多源交叉又容易让答案变得含糊。

还有个更根本的问题:引用造假对普通用户几乎不可见。我们这代网民好歹学会了广告位不要轻信,可没人教过我们AI的引用位也不要轻信。

知识的来源需要凭证

我的判断

我不太同意”AI搜索要完”的结论。同样的技术,用得较真,效果反而吓人。安全公司Aisle最近在OpenAI和Anthropic模型都扫过、零发现的curl代码库里,用AI找出了6个CVE。差别不在模型,在用法:一个是要”看起来可信的答案”,一个是要”可以验证的结论”。

真正的分水岭会出现在产品形态上。AI搜索如果继续把引用当装饰品,信任危机会反复发作;什么时候引用变成可点击、可校验、可申诉的实体,被污染的答案才有解药。在那之前,把AI的每次引用都当作待核实线索,算不上体面,但很必要。

我自己已经开始这么用了。宁可在引用处多花三十秒点开原文,也不把模型的出处直接搬进文章。写这篇的时候也一样,两份审计报告我都翻过原始页面,而不是转述热榜摘要。

信任从来不是模型的输出,它是一整套基础设施。基础设施没建好之前,别急着把判断力整个交出去。