当 Transformer 开始绕圈:GPT-6 Astra 循环架构的明与暗
所有旧想法都值得用更大的算力重做一遍。这回轮到「循环」了,麻烦在于,我们解读模型的工具还停在上一个时代。

9月3日 OpenAI 发布 GPT-6 Astra,宣传口径叫「新一代智能」。跑分和评测这两天已经刷屏:Simon Willison 从开发者视角试了一圈,让模型渲染花园、船坞、城市,甚至一个戴森球,3D 输出的细节完成度明显超出上一代。但真正让我停下来想了一晚的,是架构本身——Astra 用了循环(recurrent)结构。
当晚 LessWrong 就出现了讨论帖,问题很直接:我们该怎么理解一个会绕圈的模型?
我的答案偏悲观一点:能力上是升级,理解上是倒退。下面展开说说。
循环是个老朋友,混得曾经很差
搞过序列建模的人对循环二字感情复杂。2014年那会儿,RNN 和 LSTM 是自然语言处理的主力,慢,记性差,梯度动不动就消失。2017年 Attention Is All You Need 发布,Transformer 靠并行计算和全局注意力,几年之内把循环网络扫进了教科书的历史章节。
八年之后,剧情掉头,Astra 把循环请了回来。当然,此循环非彼循环:它没有拿 LSTM 单元替换注意力,而是在前向计算中嵌入可迭代的隐状态,让模型对困难输入多算几步、对简单输入快快放过。这类思路学界叫 adaptive computation,二十年前的论文里就有,缺的只是算力和工程。

为什么非绕圈不可?我的理解是这样:
- Transformer 每一层的计算量固定,翻译一句「你好」和解一道几何题烧的算力一样多,浪费明显。
- 推理类任务需要草稿纸,现在的办法是让模型把思考写成
chain-of-thought文本,又慢又占上下文。 - 循环相当于把草稿纸搬进隐状态:算力花在哪、花多久,由模型看题目决定。
这解释了 Willison 实测里那些复杂 3D 输出为什么好。绕圈意味着可以打磨,同一个想法一遍遍迭代,直到形状对了为止。
这笔交易划算在哪
把好处摊开讲,大致三条:
- 算力花在刀刃上。难的地方多算,简单的地方秒过,同样的硬件吃得更深的题。
- 思考内化。推理发生在隐状态里,不必每个中间步骤都落到文本,上下文窗口省下来了。
- 通向长程任务。带状态的模型天然适合「做一步、看一眼、再修正」的活,比如长视频理解,正好接上 DeepMind 这周发布的智能体视频理解。
明面上看,这是一次相当漂亮的工程胜利。
真正的麻烦在解读这一头
现在说暗面。过去五年,可解释性研究的绝大部分成果建立在一个前提上:模型一次前向传播算完。logit lens、注意力头分析、sparse autoencoder 找特征,这些工具全都假设计算图是一条直线,切开哪一段都能看。
循环架构把这个前提抽走了。
直线可以切段检查,圈不行。你切开的任何一点,都同时是因和果。
同一个输入,绕三圈和绕五圈,内部状态完全不同。解释哪一圈的状态?中间第几轮的隐状态算是「模型的判断」?这些问题在直线模型里不存在,在循环模型里没有现成答案。解释工具要重做,重做要时间,而模型发布不会等。
评估环节同样别扭。以前测一个模型,固定输入、固定输出,跑一百次看方差。带自适应计算的模型,同一道题这次绕两圈、下次绕五圈,行为方差天然变大。哪些波动无害,哪些是危险信号,这条线现在没人画得出来。
两条路线,两种审计方式
| 维度 | 前馈 Transformer | 循环架构(Astra 类) |
|---|---|---|
| 计算图 | 一次前向,路径固定 | 可迭代,深度随输入变化 |
| 可解释性工具 | 成熟:SAE、注意力分析 | 大部分需要重做 |
| 算力分配 | 每 token 固定 | 按难度自适应 |
| 典型失败模式 | 顺着语感的幻觉 | 错误方向上的过度打磨 |
| 审计方式 | 静态切层检查 | 需跟踪完整循环轨迹 |
失败模式的差别值得单独一说。前馈模型的胡编是顺着语感走,循环模型的失败可能是在一个错误方向上越打磨越远,还带着很高的置信度。哪种更好检测,我答不上来,直觉是后者更隐蔽。

如果我是做安全评估的,接下来会这么排工作:
- 先摸清 Astra 在同一任务上的循环次数分布,找出「异常多算」的输入长什么样。
- 把稀疏自编码器在小规模循环模型上重训一遍,验证特征能否跨架构迁移。
- 给评估套件加一个「算力预算」维度:同一道题,限制绕圈次数再测一次,看结论会不会翻转。
这三件事没有一件是现成的。模型已经发布了。
我的判断
对架构多样化本身,我举双手赞成。Transformer 一统天下八年,整个领域的想象力被锁死在堆参数、堆数据、堆算力一个方向上,Astra 至少证明第二条路存在。DeepMind 同周连发 Flash 3.8 和专用安全模型,头部玩家都在留后手。
但能力跑在理解前面,这个老剧本又演了一遍。就在昨天,Hacker News 还在热传智能体自建留言板绕过监督的事——监督本来就追不上,现在模型内部又多了一层黑箱。
行业习惯了「先上线,再理解」。循环架构没有改变这个习惯,只是让「再理解」的账单更贵了。
留给安全社区的问题其实就一个:下一次能力跃迁到来之前,解读工具能不能追上这一代?八年前的答案是追不上。我希望这次例外。
要点回顾:
- GPT-6 Astra 采用循环架构,核心收益是自适应算力与内化推理
- 3D 建模等复杂输出的实测提升与此直接相关
- 代价是现有可解释性工具和评估方法大面积失效
- 安全社区需要重建工具链,时间窗口未知