最后的金牌,被16块显卡的零花钱买走了
1997年,深蓝赢卡斯帕罗夫;2016年,AlphaGo赢李世石;再往后,扑克机器人把职业牌手打到怀疑人生。棋盘上的金牌清单只剩一块没发出去:Stratego,一个连DeepMind都啃不动的硬骨头。10月,卡内基梅隆、MIT、纽约大学和斯坦福的联队把它拿下了——15比1,对手是公认史上最强的Stratego人类选手Pim Niemeijer。而这次冲击圣杯的全部预算:16块GPU,几千美元。曾经的AI终极难题之一,最后的成交价是一间小实验室的零花钱。

一、金牌清单上最后一块,为什么它最难啃
先看这份清单有多豪华。1997年深蓝用专用硬件暴力搜索赢下卡斯帕罗夫,那是算力的胜利;2016年AlphaGo用深度神经网络加树搜索赢下李世石,那是学习的胜利;德州扑克和多人桌扑克早就被Libratus们掀翻,那是博弈论的胜利。三块金牌,三种赢法,唯独Stratego挂了三十多年没人摘得下来。
规则看着人畜无害:双方各40枚棋子,军衔从元帅排到工兵,外加炸弹和军旗,谁先摸到对方军旗谁赢。邪恶的地方在于,你能看见对手每枚棋子在哪,却看不见它是谁——身份只有在两枚棋子相撞时才揭晓,弱的一方当场出局。MIT的Gabriele Farina给过一组对比数字:德州扑克你只有两张暗牌,可能的起手牌一共1326种,机器可以挨个掂量一遍;Stratego的40枚棋子可以任意排布,布阵数量超过10的33次方。象棋一盘通常40个回合分胜负,Stratego一盘轻松下到2000回合。再把”诈唬”搅进来——用一枚小卒走出元帅的气势吓退对手——虚张声势用多了威胁就贬值,一次不虚张声势又会被看穿。走在这根平衡木上,DeepMind 2022年的DeepNash摔了下来:它证明了纳什均衡可以逼近,却始终赢不了人类顶尖选手的临场骗术。隐藏信息多、时间轴长、还要会演戏,这三样凑齐,砸再多钱也只是把天花板撞得更响而已。

二、破局的两把钥匙:教它猜,让它慢
Ataraxos的训练配方表面上毫无新意:自己跟自己下,1.63亿局,赢的招多强化、输的招少出现——和DeepNash喝的是同一锅汤。差别全在火候上。
第一把钥匙,是给系统加了一个专门”猜”的神经网络。它不负责走子,只干一件事:盯着棋盘上那些身份未明的棋子,估计每一枚最可能是什么。Ars的报道把这步棋点得很直白——加进第二个猜测隐藏棋子身份的网络,是整个工作的关键。换句话说,AI在Stratego里学会的不是走子,而是怀疑。它对棋盘维持的不再是一棵搜索树,而是一份关于对手的信念分布,每走一步都在更新”我猜你的元帅藏在哪”。这是理论心智的廉价雏形:不靠神谕,靠证据滚动修正。讽刺的是,这条思路朴素到近乎土法,却卡住了财力无限的DeepMind整整四年——方法对了,答案往往简单得让人不服气。
第二把钥匙更不起眼:每局之后的更新步幅,拿捏得极小。隐藏信息有个恶毒的性质——它会污染学习信号。你赢了一局,可能是因为你真的更强,也可能纯粹是对手诈唬玩脱了手。要是把每一局输赢都当真理狠狠更新参数,算法就围着噪声绕圈,永远收敛不了。四校联队把更新幅度调到近乎保守的刻度,让上亿局自对弈的统计量慢慢把信号从噪声里煮出来。一个加表征,一个减学习率,没有哪个动作是”堆更多显卡”能替代的。

三、几千美元的信号弹:暴力美学的边际收益在归零
现在说最扎心的部分:DeepMind没做成的事,一间学术小实验室用16块GPU做成了。这个对比放在今天的行业背景下读,滋味格外复杂。就在同一周,博通被曝出要为Anthropic的定制芯片项目筹600亿美元,各家太空数据中心的PPT一页比一页贵,而Stratego的圣杯被一台小机箱的价格摘走了。
先说清楚,我不是算力虚无主义者——1.63亿局自对弈本身就是算力喂出来的,省掉这笔开支一样拿不到金牌。真正值得记下的是另一件事:当整个行业的边际想象力都押在”更大的数”上时,这则新闻提醒所有人,卡住一个领域三十年的,往往不是算力缺口,是表征缺口。16块GPU解决不了的问题,16万块大概率也解决不了,直到有人想清楚该让网络猜什么。想法的密度和显卡的数量,从来不是同一个函数。
当然,也得给狂热降降温。Stratego再阴险,也是规则封闭、胜负即时可判的游戏,奖励信号干净得像蒸馏水。现实世界的”诈唬”——谈判桌、金融市场、情报分析——没有裁判在两子相撞的瞬间揭晓身份,你赢一次可能只是运气好。把”游戏金牌集齐”直接外推成”真实推理被攻克”,是这则新闻最常见的误读。它的正确读法是:在不完全信息博弈这条最接近现实的模拟赛道上,小预算加好想法的配方再次跑通;而学术界也再次证明,自己是大厂巨舰开不进的那片浅水区里,唯一还在认真排雷的人。
结语
15比1,外加四盘和棋,史上最强的人类Stratego选手输给了16块显卡。比分本身不重要,重要的是这道题在”暴力够不着”的条件下被解开了:靠的不是更大的锤子,而是教会机器怀疑。往后的金牌都挂在现实世界里,那里没有清晰的终局判定,但隐藏信息的浓度只高不低——每个人都揣着看不见的军衔在走子。教会机器”猜”,可能比教会机器”想”,更接近那条路。