不要做AI的肉代理:当人类沦为LLM的中间件,基准测试也无法拯救我们
当你把AI的输出一字不差地粘贴给下一个人,你不是在使用工具——你正在变成工具。

“肉代理”:一个刺耳但精确的新词
2026年8月初,Niklas Gruhn在他的博客中创造了一个迅速在技术圈传播的词汇:Meat Proxy(肉代理)。这个概念指的是那些不加思考地将AI生成的内容直接复制粘贴传递给他人的人——他们看似在完成工作,实际上只是在人类沟通链条中充当了一段有机的数据中继。
Simon Willison在自己的博客中专门撰文讨论了这个概念,并给出了一个精准的定义:
一个”肉代理”是指一个人,其工作流程是这样的:从AI那里获取输出 → 不加验证和理解 → 直接传递给另一个人,就好像这些内容是自己产生的一样。
乍一看,这不过是又一个关于”AI懒惰”的抱怨。但如果我们仔细审视这个词所指向的现象,会发现它触及了一个更深层的问题:当AI的输出质量已经接近甚至超越人类平均水平时,人类”理解并重新表达”这一环节是否正在被系统性地跳过?
这不是道德问题,而是认知问题。当你不再需要理解内容就能传递它,你就不再在学习。而当一个社会中的大量知识工作者不再学习,知识的流动就变成了未经消化的数据传输。
基准测试的黄昏:当所有的尺子都量不出差异
与”肉代理”现象几乎同步出现的,是学术界对AI评估方法的一次系统性反思。arXiv上发布的研究《AI基准测试饱和度系统性研究》(arXiv 2602.16763)提出了一个令人不安的观察:我们用来衡量AI能力的几乎所有基准测试,都在快速趋于饱和。
这意味着什么?举个例子:
| 评估维度 | 2年前的表现 | 当前表现 | 饱和度 |
|---|---|---|---|
| MMLU知识测试 | ~70% | ~92% | 🔴 高 |
| HumanEval编程 | ~65% | ~95% | 🔴 高 |
| 多项法律考试 | ~75% | ~98% | 🔴 极高 |
| 数学推理 (GSM8K) | ~60% | ~97% | 🔴 极高 |
| Agent真实任务完成率 | ~25% | ~36% | 🟡 中 |
当一个基准测试的分数趋近天花板,它就失去了区分不同模型、不同方法的能力。就像一场所有选手都能跑进10秒的百米赛——你需要新的计时器和新的赛道。
但问题远不止于此。基准测试饱和的真正危险在于,它制造了一种虚假的”能力已达顶点”的幻觉。 看着满屏的90%+分数,人们很容易得出结论:”AI已经够强了。”但实际上,这些测试衡量的只是特定维度的表现。在”肉代理”这个概念所揭示的真实世界场景中——人类能否正确理解和验证AI输出——我们没有基准测试。
我们测试了AI能否通过考试,却从未测试过人类能否正确地使用AI的答案。这是评估体系中一个巨大的盲区。
ACM的八大迷思:软件工程的清醒剂
几乎在同一时间,ACM期刊《Queue》发表了一篇引人深思的文章,探讨了软件工程与生成式AI之间的八个常见迷思。这篇文章在Hacker News社区引发了广泛讨论,因为它戳破了不少被奉为圭臬的”常识”。
其中有几个迷思与”肉代理”现象直接相关:
-
“AI写的代码不需要人工审查” —— 这恰恰是”肉代理”思维在编程领域的体现。ACM的研究指出,LLM生成的代码在表面层面看起来正确率很高,但在边界条件处理、安全漏洞、架构一致性等深层问题上,错误率显著高于人类编写的代码。
-
“AI可以替代初级开发者” —— 这是一个危险的推论。初级开发者的真正价值不在于写出正确的代码,而在于通过编写代码来学习系统、理解业务、建立技术直觉。用AI替代这个过程,就像用计算器替代小孩学算术——结果计算更快了,但数学思维没有发展。
-
“代码生成就是软件工程” —— ACM的作者们尖锐地指出,软件工程的核心从来不是写代码,而是理解需求、权衡取舍、管理复杂度、做出决策。这些恰恰是当前AI最不擅长的部分。
认知外包的阶梯:从辅助到替代的三步走
如果我们把”肉代理”现象放到一个更大的时间框架中观察,会发现它并非突然出现,而是认知外包逐步深化的必然结果。这个深化过程可以粗略分为三个阶段:
第一阶段:工具辅助(2020-2023)
AI作为工具存在,人类是决策者。典型场景:用ChatGPT帮忙润色邮件、生成代码片段、总结文档。人类保留了理解、判断、最终决策的权力。这一阶段的AI是放大器,不是替代品。
第二阶段:流程中介(2023-2025)
AI开始嵌入工作流程,成为必要的中介环节。典型场景:客服系统自动回复、代码审查工具自动标记、数据分析工具自动生成报告。人类开始依赖AI的中间输出进行决策,但仍有最终的否决权。
第三阶段:认知外包(2025-至今)
这是”肉代理”现象真正出现的阶段。AI的输出质量已经足够高,以至于许多人开始跳过理解环节,直接传递。典型场景:管理者把AI生成的策略文档直接发给团队、开发者把Copilot的代码直接合并、研究人员把AI的文献综述直接引用。
在第三阶段,人类不再是AI的使用者,而是AI输出与最终接收者之间的生物传输层。
为什么这比看起来更危险
“肉代理”的危险不在于效率(实际上,它提高了短期效率),而在于它对人类认知能力的系统性侵蚀。这里有一个关键的反馈循环:
- AI输出质量提升 → 人类更倾向于直接使用
- 直接使用增多 → 人类理解和验证的练习减少
- 练习减少 → 人类判断能力下降
- 判断能力下降 → 更难发现AI输出中的错误
- 错误难以发现 → 对AI的依赖进一步加深
这个循环一旦启动,就是自我强化的。而你甚至不会注意到自己在退化——因为每次你”完成任务”时,AI确实帮你做得足够好。
这与ACM文章中提到的另一个迷思形成了呼应:“开发者可以通过阅读AI生成的代码来学习”。研究表明,被动阅读代码的学习效果远低于主动编写代码。当你不再亲手编写,你的技术直觉就像一块不再使用的肌肉——它会萎缩。
手动重打代码:一个朴素的反抗
面对”肉代理”现象的蔓延,开发者社区中开始出现一种看似笨拙但意义深远的实践:手动重新输入LLM生成的代码。
开发者Ankur Sethi在他的博客中详细阐述了这种做法的价值:当你手动重新输入一段代码时,你不是在做无用功——你是在强制自己逐行理解每一行代码的含义、目的和上下文关系。这种”慢下来”的过程,恰恰是防止认知债务积累的关键。
这不是反对使用AI,而是重新定义人与AI的边界:
- AI负责生成初始方案 → 人类负责理解和验证
- AI负责处理重复性工作 → 人类负责决策和创新
- AI负责扩展能力边界 → 人类负责保持判断力的敏锐
我们需要新的基准测试
回到基准测试饱和度的问题。当前的困境是:我们有无数测试来衡量AI的能力,却几乎没有测试来衡量“人类在使用AI后是否保持了应有的判断力”。
我认为我们需要以下几类新评估框架:
- 验证能力测试:给用户一段AI生成的内容(其中包含隐蔽错误),测试用户能否发现并纠正这些错误
- 理解深度测试:让用户用自己的话重新解释AI的输出,评估理解程度
- 决策独立性测试:在AI给出建议后,测试用户能否在必要时拒绝或修改这些建议
- 认知负荷测试:长期使用AI辅助后,用户在脱离AI时的独立完成任务能力是否下降
这些测试的目标不是限制AI的使用,而是确保人类在使用AI的过程中保持”人”的角色——而不是退化为一个有温度的API网关。
结语:做一个有判断力的人
“肉代理”这个词之所以刺耳,是因为它太精确了。我们每个人在某种程度上都可能是”肉代理”——在某个疲惫的下午,在某个紧迫的deadline面前,我们选择了直接粘贴而不是理解。
但这不应该是常态。
AI的终极价值不在于替代人类的思考,而在于放大人类的判断力。 如果你使用AI后发现自己变得更懒、更少思考、更依赖——那不是AI的问题,那是使用方式的问题。
记住:
- 理解了再传递——如果你不能用简单的语言向别人解释一个概念,你就不应该传递AI对它的解释
- 质疑AI的输出——特别是当它看起来完美无缺时
- 保持”笨拙”——手动重打代码、亲手验证数据、用自己的话重新表述
在一个越来越智能的世界里,保持人类的笨拙可能是一种美德。
核心要点回顾
- “肉代理”(Meat Proxy) 指不加思考地传递AI输出的人,这反映了认知外包的深化趋势
- 基准测试饱和意味着我们正在失去衡量AI真实能力差异的工具,而”人类使用AI的能力”则完全没有评估框架
- ACM的八大迷思戳破了”AI已能替代软件工程”的幻觉,强调理解、判断和决策的不可替代性
- 认知外包三阶段从工具辅助到流程中介再到认知外包,人类正在逐步让渡理解的权力
- 手动重打代码等”笨拙”实践是抵抗认知退化的有效方法
- 我们需要新的评估框架来衡量“人类+AI”组合的真实能力,而不仅仅是AI本身的能力