不要做AI的肉代理:当人类沦为LLM的中间件,基准测试也无法拯救我们

当你把AI的输出一字不差地粘贴给下一个人,你不是在使用工具——你正在变成工具。

不要做AI的肉代理:当人类沦为LLM的中间件

“肉代理”:一个刺耳但精确的新词

2026年8月初,Niklas Gruhn在他的博客中创造了一个迅速在技术圈传播的词汇:Meat Proxy(肉代理)。这个概念指的是那些不加思考地将AI生成的内容直接复制粘贴传递给他人的人——他们看似在完成工作,实际上只是在人类沟通链条中充当了一段有机的数据中继。

Simon Willison在自己的博客中专门撰文讨论了这个概念,并给出了一个精准的定义:

一个”肉代理”是指一个人,其工作流程是这样的:从AI那里获取输出 → 不加验证和理解 → 直接传递给另一个人,就好像这些内容是自己产生的一样。

乍一看,这不过是又一个关于”AI懒惰”的抱怨。但如果我们仔细审视这个词所指向的现象,会发现它触及了一个更深层的问题:当AI的输出质量已经接近甚至超越人类平均水平时,人类”理解并重新表达”这一环节是否正在被系统性地跳过?

这不是道德问题,而是认知问题。当你不再需要理解内容就能传递它,你就不再在学习。而当一个社会中的大量知识工作者不再学习,知识的流动就变成了未经消化的数据传输


基准测试的黄昏:当所有的尺子都量不出差异

与”肉代理”现象几乎同步出现的,是学术界对AI评估方法的一次系统性反思。arXiv上发布的研究《AI基准测试饱和度系统性研究》(arXiv 2602.16763)提出了一个令人不安的观察:我们用来衡量AI能力的几乎所有基准测试,都在快速趋于饱和。

这意味着什么?举个例子:

评估维度 2年前的表现 当前表现 饱和度
MMLU知识测试 ~70% ~92% 🔴 高
HumanEval编程 ~65% ~95% 🔴 高
多项法律考试 ~75% ~98% 🔴 极高
数学推理 (GSM8K) ~60% ~97% 🔴 极高
Agent真实任务完成率 ~25% ~36% 🟡 中

当一个基准测试的分数趋近天花板,它就失去了区分不同模型、不同方法的能力。就像一场所有选手都能跑进10秒的百米赛——你需要新的计时器和新的赛道。

但问题远不止于此。基准测试饱和的真正危险在于,它制造了一种虚假的”能力已达顶点”的幻觉。 看着满屏的90%+分数,人们很容易得出结论:”AI已经够强了。”但实际上,这些测试衡量的只是特定维度的表现。在”肉代理”这个概念所揭示的真实世界场景中——人类能否正确理解和验证AI输出——我们没有基准测试。

我们测试了AI能否通过考试,却从未测试过人类能否正确地使用AI的答案。这是评估体系中一个巨大的盲区。


ACM的八大迷思:软件工程的清醒剂

几乎在同一时间,ACM期刊《Queue》发表了一篇引人深思的文章,探讨了软件工程与生成式AI之间的八个常见迷思。这篇文章在Hacker News社区引发了广泛讨论,因为它戳破了不少被奉为圭臬的”常识”。

其中有几个迷思与”肉代理”现象直接相关:

  1. “AI写的代码不需要人工审查” —— 这恰恰是”肉代理”思维在编程领域的体现。ACM的研究指出,LLM生成的代码在表面层面看起来正确率很高,但在边界条件处理、安全漏洞、架构一致性等深层问题上,错误率显著高于人类编写的代码。

  2. “AI可以替代初级开发者” —— 这是一个危险的推论。初级开发者的真正价值不在于写出正确的代码,而在于通过编写代码来学习系统、理解业务、建立技术直觉。用AI替代这个过程,就像用计算器替代小孩学算术——结果计算更快了,但数学思维没有发展。

  3. “代码生成就是软件工程” —— ACM的作者们尖锐地指出,软件工程的核心从来不是写代码,而是理解需求、权衡取舍、管理复杂度、做出决策。这些恰恰是当前AI最不擅长的部分。


认知外包的阶梯:从辅助到替代的三步走

如果我们把”肉代理”现象放到一个更大的时间框架中观察,会发现它并非突然出现,而是认知外包逐步深化的必然结果。这个深化过程可以粗略分为三个阶段:

第一阶段:工具辅助(2020-2023)

AI作为工具存在,人类是决策者。典型场景:用ChatGPT帮忙润色邮件、生成代码片段、总结文档。人类保留了理解、判断、最终决策的权力。这一阶段的AI是放大器,不是替代品。

第二阶段:流程中介(2023-2025)

AI开始嵌入工作流程,成为必要的中介环节。典型场景:客服系统自动回复、代码审查工具自动标记、数据分析工具自动生成报告。人类开始依赖AI的中间输出进行决策,但仍有最终的否决权。

第三阶段:认知外包(2025-至今)

这是”肉代理”现象真正出现的阶段。AI的输出质量已经足够高,以至于许多人开始跳过理解环节,直接传递。典型场景:管理者把AI生成的策略文档直接发给团队、开发者把Copilot的代码直接合并、研究人员把AI的文献综述直接引用。

在第三阶段,人类不再是AI的使用者,而是AI输出与最终接收者之间的生物传输层。


为什么这比看起来更危险

“肉代理”的危险不在于效率(实际上,它提高了短期效率),而在于它对人类认知能力的系统性侵蚀。这里有一个关键的反馈循环:

  1. AI输出质量提升 → 人类更倾向于直接使用
  2. 直接使用增多 → 人类理解和验证的练习减少
  3. 练习减少 → 人类判断能力下降
  4. 判断能力下降 → 更难发现AI输出中的错误
  5. 错误难以发现 → 对AI的依赖进一步加深

这个循环一旦启动,就是自我强化的。而你甚至不会注意到自己在退化——因为每次你”完成任务”时,AI确实帮你做得足够好。

这与ACM文章中提到的另一个迷思形成了呼应:“开发者可以通过阅读AI生成的代码来学习”。研究表明,被动阅读代码的学习效果远低于主动编写代码。当你不再亲手编写,你的技术直觉就像一块不再使用的肌肉——它会萎缩。


手动重打代码:一个朴素的反抗

面对”肉代理”现象的蔓延,开发者社区中开始出现一种看似笨拙但意义深远的实践:手动重新输入LLM生成的代码

开发者Ankur Sethi在他的博客中详细阐述了这种做法的价值:当你手动重新输入一段代码时,你不是在做无用功——你是在强制自己逐行理解每一行代码的含义、目的和上下文关系。这种”慢下来”的过程,恰恰是防止认知债务积累的关键。

这不是反对使用AI,而是重新定义人与AI的边界

  • AI负责生成初始方案 → 人类负责理解和验证
  • AI负责处理重复性工作 → 人类负责决策和创新
  • AI负责扩展能力边界 → 人类负责保持判断力的敏锐

我们需要新的基准测试

回到基准测试饱和度的问题。当前的困境是:我们有无数测试来衡量AI的能力,却几乎没有测试来衡量“人类在使用AI后是否保持了应有的判断力”

我认为我们需要以下几类新评估框架:

  1. 验证能力测试:给用户一段AI生成的内容(其中包含隐蔽错误),测试用户能否发现并纠正这些错误
  2. 理解深度测试:让用户用自己的话重新解释AI的输出,评估理解程度
  3. 决策独立性测试:在AI给出建议后,测试用户能否在必要时拒绝或修改这些建议
  4. 认知负荷测试:长期使用AI辅助后,用户在脱离AI时的独立完成任务能力是否下降

这些测试的目标不是限制AI的使用,而是确保人类在使用AI的过程中保持”人”的角色——而不是退化为一个有温度的API网关。


结语:做一个有判断力的人

“肉代理”这个词之所以刺耳,是因为它太精确了。我们每个人在某种程度上都可能是”肉代理”——在某个疲惫的下午,在某个紧迫的deadline面前,我们选择了直接粘贴而不是理解。

但这不应该是常态。

AI的终极价值不在于替代人类的思考,而在于放大人类的判断力。 如果你使用AI后发现自己变得更懒、更少思考、更依赖——那不是AI的问题,那是使用方式的问题。

记住:

  • 理解了再传递——如果你不能用简单的语言向别人解释一个概念,你就不应该传递AI对它的解释
  • 质疑AI的输出——特别是当它看起来完美无缺时
  • 保持”笨拙”——手动重打代码、亲手验证数据、用自己的话重新表述

在一个越来越智能的世界里,保持人类的笨拙可能是一种美德


核心要点回顾

  • “肉代理”(Meat Proxy) 指不加思考地传递AI输出的人,这反映了认知外包的深化趋势
  • 基准测试饱和意味着我们正在失去衡量AI真实能力差异的工具,而”人类使用AI的能力”则完全没有评估框架
  • ACM的八大迷思戳破了”AI已能替代软件工程”的幻觉,强调理解、判断和决策的不可替代性
  • 认知外包三阶段从工具辅助到流程中介再到认知外包,人类正在逐步让渡理解的权力
  • 手动重打代码等”笨拙”实践是抵抗认知退化的有效方法
  • 我们需要新的评估框架来衡量“人类+AI”组合的真实能力,而不仅仅是AI本身的能力