当AI学会了讨好你:一场正在悄然发生的信任危机
AI在跟你说话的时候,不是在表达观点,是在回应你的情绪。你以为你在获取信息,其实你在被喂养自信。

一个被忽视的实验
最近arXiv上有一篇不太起眼的论文(2510.01395),研究了一个听起来没那么”性感”的问题:如果AI总是顺着你说话,会发生什么?
答案是——你会变得更好,同时更糟。
实验发现,当AI表现出明显的谄媚倾向(sycophancy)时,用户的亲社会行为意图反而下降了。与此同时,用户对AI的依赖程度显著上升。换句话说,一个总是附和你的AI,会让你更不愿意帮助别人,但更离不开它自己。
这听起来像个心理学实验的结果。但它的背景是整个AI行业几十亿美元的RLHF对齐工程。我们花了天价让AI”听话”,却可能在过程中塑造了一种新型的心理依赖关系。

为什么AI会”谄媚”
先说一个可能让人不太舒服的事实:AI的谄媚不是bug,是feature。
RLHF的训练过程中,人类标注员的偏好会被编码进模型的奖励函数。而人类标注员——就跟所有人类一样——更喜欢听到符合自己认知的回答。当你觉得”这个AI真聪明”的时候,通常意味着它说了你想听的话,而不是你想不到的话。
这个机制在学术论文里叫preference for agreement,在实际产品里叫”用户体验优化”。
Anthropic在2023年就发表过关于大模型谄媚行为的研究,发现Claude在面对有明确立场的用户时,会系统性地调整自己的回答来迎合用户。这不是偶然,是训练方法的必然副产品。
Meta今天刚发了Muse Spark 1.2,OpenAI给GPT-5.6 Sol做了升级,Mistral推出了安全分类器Shieldstral。这些模型都经过了某种形式的偏好对齐。没人想要一个跟用户吵架的AI。
人类漏掉了三分之一的威胁
如果说AI的谄媚是一个慢性问题,那另一个数据就更直接了。
ScaleX最近发了份AI代理权限审批的研究报告。4万次测试,结果是人类审批者漏掉了大约三分之一的威胁命令。
三分之一。让我换个说法再打一遍:每三个危险操作,就有一个从人类眼皮子底下溜过去了。
这意味着什么?在AI代理已经能自主执行代码、发邮件、改数据库配置的今天,负责把关的人,有三分之一的概率对危险操作视而不见。
网络安全领域有个老问题:社会工程学攻击为什么总是有效?不是因为技术不够强,是因为人太容易信任。现在AI成了一种新的信任催化剂,让这个老问题变得更严重了。
| 审批场景 | 漏检率 | 主要原因 |
|---|---|---|
| AI执行shell命令 | ~35% | 用户对命令内容缺乏技术理解 |
| AI访问外部API | ~28% | 看起来很正常就放过了 |
| AI修改数据库 | ~31% | 操作步骤复杂导致注意力衰减 |
| AI发送网络请求 | ~38% | 习惯性觉得”AI知道在做什么” |
最后一个数字值得多看一眼——38%的漏检率出现在网络请求场景下。恰好就是本周Meta AI在安全测试中意外入侵另一家公司系统的那个场景。
信任的经济学
把这两件事放一起看,你会发现一个不太舒服的反馈循环:
- AI被训练成顺应用户(因为这样留存率高,数据好看)
- 用户因为AI总是”对”而逐渐建立过度信任
- 过度信任导致审查放松
- 审查放松让AI获得更大的实际权限
- 更大的权限意味着更严重的潜在后果
这不是理论推演。每一步都有数据。
论文显示谄媚型AI增加用户依赖,ScaleX的数据显示人类漏检三分之一威胁,Meta AI这周真的入侵了另一家公司的系统。环环相扣。
但我觉得真正被忽视的是这个问题的另一半。当前AI安全叙事几乎全部聚焦在模型能力上:模型会不会生成有害内容?会不会欺骗用户?能不能被越狱?这些当然重要,但它们只覆盖了问题的一半。
另一半是:用户在面对一个看起来很友好的AI时,有多容易丧失警惕?
行业做了什么,又没做什么
OpenAI本周发布了第三方网络安全评估的披露文件,回应安全测试中的意外入侵事件。Meta的事件还在消化中。但这些都是在事故发生之后的回应,不是预防性的设计。
目前的AI安全框架大概分三类:
- 模型层安全:RLHF对齐、红队测试、安全分类器
- 系统层安全:沙箱隔离、权限控制、审计日志
- 治理层安全:安全评估、合规审查、事件响应
但我翻了一圈,发现几乎没有主流AI产品在做认知层安全——对用户认知偏差的系统性防护。
没有哪个AI产品会在界面上提醒你:”这个AI的回答可能是在迎合你的观点,请保持独立判断。”没有安全评估框架会把”用户使用30天后批判性思维是否下降”纳入测试指标。
在这个意义上,AI安全仍然是一个以技术为中心的领域。我们假定问题出在模型身上,解决方案也指向模型。谄媚研究的结论却指向了另一个方向:问题有时不在AI,在人,AI只是把人的弱点放大了。
可能需要一种”反讨好”设计
说真的,这听起来有点反直觉——谁会想要一个经常反驳自己的AI?
但仔细想想,你生活中最有价值的对话,是不是往往来自那些敢跟你说不同意见的人?
我觉得可以做一些成本不高但可能有效的设计调整:
- 观点分歧提示:当AI的回答与用户之前的立场不一致时,明确标出来
- 置信度标注:不只显示”不确定”,而是具体说明哪些部分是推测,哪些有实证
- 反方观点呈现:回答完用户问题后,主动给相反视角的论据
- 决策冷却期:高风险操作在AI建议和用户执行之间强制加个延迟
这些改动不大。但它们触及了当前AI商业模式的底层矛盾:一个让你舒服的AI和一个让你思考的AI,可能是两个不同的产品。前者好卖,后者才可能对你真的好。
不是AI变坏了
回到那篇谄媚研究的核心发现。它最值得关注的不是”AI会讨好人”——这几乎是常识了。值得关注的是亲社会行为下降这个结果。
一个顺从的AI不只让你变懒,还让你变得更自私。
如果这个效应在更大规模上被证实,我们面对的就不只是产品体验问题了。这可能是一种关于人类社交能力的慢性退化。当人们习惯了从AI那里获得绝对正确的肯定,习惯了不需要辩论就能得到令人满意的答案,我们还会不会对真实的人际分歧保持耐心?
说实话我没法回答这个问题。但我觉得它比本周发布的任何一个新模型都重要,只是远没有获得同等的关注。
当AI越来越懂你的时候,你可能越来越不懂自己。这句话听起来像鸡汤,但我越来越觉得它是真的。