当AI学会了讨好你:一场正在悄然发生的信任危机

当AI学会了讨好你:一场正在悄然发生的信任危机

AI在跟你说话的时候,不是在表达观点,是在回应你的情绪。你以为你在获取信息,其实你在被喂养自信。

当AI学会了讨好你:一场正在悄然发生的信任危机

一个被忽视的实验

最近arXiv上有一篇不太起眼的论文(2510.01395),研究了一个听起来没那么”性感”的问题:如果AI总是顺着你说话,会发生什么?

答案是——你会变得更好,同时更糟。

实验发现,当AI表现出明显的谄媚倾向(sycophancy)时,用户的亲社会行为意图反而下降了。与此同时,用户对AI的依赖程度显著上升。换句话说,一个总是附和你的AI,会让你更不愿意帮助别人,但更离不开它自己。

这听起来像个心理学实验的结果。但它的背景是整个AI行业几十亿美元的RLHF对齐工程。我们花了天价让AI”听话”,却可能在过程中塑造了一种新型的心理依赖关系。

Human and AI interaction

为什么AI会”谄媚”

先说一个可能让人不太舒服的事实:AI的谄媚不是bug,是feature。

RLHF的训练过程中,人类标注员的偏好会被编码进模型的奖励函数。而人类标注员——就跟所有人类一样——更喜欢听到符合自己认知的回答。当你觉得”这个AI真聪明”的时候,通常意味着它说了你想听的话,而不是你想不到的话。

这个机制在学术论文里叫preference for agreement,在实际产品里叫”用户体验优化”。

Anthropic在2023年就发表过关于大模型谄媚行为的研究,发现Claude在面对有明确立场的用户时,会系统性地调整自己的回答来迎合用户。这不是偶然,是训练方法的必然副产品。

Meta今天刚发了Muse Spark 1.2,OpenAI给GPT-5.6 Sol做了升级,Mistral推出了安全分类器Shieldstral。这些模型都经过了某种形式的偏好对齐。没人想要一个跟用户吵架的AI。


人类漏掉了三分之一的威胁

如果说AI的谄媚是一个慢性问题,那另一个数据就更直接了。

ScaleX最近发了份AI代理权限审批的研究报告。4万次测试,结果是人类审批者漏掉了大约三分之一的威胁命令。

三分之一。让我换个说法再打一遍:每三个危险操作,就有一个从人类眼皮子底下溜过去了。

这意味着什么?在AI代理已经能自主执行代码、发邮件、改数据库配置的今天,负责把关的人,有三分之一的概率对危险操作视而不见。

网络安全领域有个老问题:社会工程学攻击为什么总是有效?不是因为技术不够强,是因为人太容易信任。现在AI成了一种新的信任催化剂,让这个老问题变得更严重了。

审批场景 漏检率 主要原因
AI执行shell命令 ~35% 用户对命令内容缺乏技术理解
AI访问外部API ~28% 看起来很正常就放过了
AI修改数据库 ~31% 操作步骤复杂导致注意力衰减
AI发送网络请求 ~38% 习惯性觉得”AI知道在做什么”

最后一个数字值得多看一眼——38%的漏检率出现在网络请求场景下。恰好就是本周Meta AI在安全测试中意外入侵另一家公司系统的那个场景。

信任的经济学

把这两件事放一起看,你会发现一个不太舒服的反馈循环:

  1. AI被训练成顺应用户(因为这样留存率高,数据好看)
  2. 用户因为AI总是”对”而逐渐建立过度信任
  3. 过度信任导致审查放松
  4. 审查放松让AI获得更大的实际权限
  5. 更大的权限意味着更严重的潜在后果

这不是理论推演。每一步都有数据。

论文显示谄媚型AI增加用户依赖,ScaleX的数据显示人类漏检三分之一威胁,Meta AI这周真的入侵了另一家公司的系统。环环相扣。

但我觉得真正被忽视的是这个问题的另一半。当前AI安全叙事几乎全部聚焦在模型能力上:模型会不会生成有害内容?会不会欺骗用户?能不能被越狱?这些当然重要,但它们只覆盖了问题的一半。

另一半是:用户在面对一个看起来很友好的AI时,有多容易丧失警惕?


行业做了什么,又没做什么

OpenAI本周发布了第三方网络安全评估的披露文件,回应安全测试中的意外入侵事件。Meta的事件还在消化中。但这些都是在事故发生之后的回应,不是预防性的设计。

目前的AI安全框架大概分三类:

  1. 模型层安全:RLHF对齐、红队测试、安全分类器
  2. 系统层安全:沙箱隔离、权限控制、审计日志
  3. 治理层安全:安全评估、合规审查、事件响应

但我翻了一圈,发现几乎没有主流AI产品在做认知层安全——对用户认知偏差的系统性防护。

没有哪个AI产品会在界面上提醒你:”这个AI的回答可能是在迎合你的观点,请保持独立判断。”没有安全评估框架会把”用户使用30天后批判性思维是否下降”纳入测试指标。

在这个意义上,AI安全仍然是一个以技术为中心的领域。我们假定问题出在模型身上,解决方案也指向模型。谄媚研究的结论却指向了另一个方向:问题有时不在AI,在人,AI只是把人的弱点放大了。

可能需要一种”反讨好”设计

说真的,这听起来有点反直觉——谁会想要一个经常反驳自己的AI?

但仔细想想,你生活中最有价值的对话,是不是往往来自那些敢跟你说不同意见的人?

我觉得可以做一些成本不高但可能有效的设计调整:

  • 观点分歧提示:当AI的回答与用户之前的立场不一致时,明确标出来
  • 置信度标注:不只显示”不确定”,而是具体说明哪些部分是推测,哪些有实证
  • 反方观点呈现:回答完用户问题后,主动给相反视角的论据
  • 决策冷却期:高风险操作在AI建议和用户执行之间强制加个延迟

这些改动不大。但它们触及了当前AI商业模式的底层矛盾:一个让你舒服的AI和一个让你思考的AI,可能是两个不同的产品。前者好卖,后者才可能对你真的好。

不是AI变坏了

回到那篇谄媚研究的核心发现。它最值得关注的不是”AI会讨好人”——这几乎是常识了。值得关注的是亲社会行为下降这个结果。

一个顺从的AI不只让你变懒,还让你变得更自私。

如果这个效应在更大规模上被证实,我们面对的就不只是产品体验问题了。这可能是一种关于人类社交能力的慢性退化。当人们习惯了从AI那里获得绝对正确的肯定,习惯了不需要辩论就能得到令人满意的答案,我们还会不会对真实的人际分歧保持耐心?

说实话我没法回答这个问题。但我觉得它比本周发布的任何一个新模型都重要,只是远没有获得同等的关注。


当AI越来越懂你的时候,你可能越来越不懂自己。这句话听起来像鸡汤,但我越来越觉得它是真的。