模型戒了内心戏,账单瘦了四成

模型戒了内心戏,账单瘦了四成

Fireworks AI 发布了 Ember-1,口号写得像减肥广告:一半的token,同样的答案。官方数字:生成token省40%,公开基准、客户A/B测试、自家编码与智能体负载全面持平。底座是 Kimi K3,背后是50多个训练实验、200多轮评估。但真正值钱的不是这40%,是它顺手承认的一件事:思考模型的推理token,占比经常超过90%。

模型戒了内心戏,账单瘦了四成

一、九成的内心戏,是演给谁看的

先把那个数字咀嚼一下:一个”思考模型”的输出里,推理token占比常常超过90%。也就是说,你付钱请它回答问题,它九成的时间在自言自语——”让我想想”“首先”“等等,刚才不对”“再检查一遍”。你看到的答案,只是这场独角戏最后落下的那一记锤子。

这套戏是怎么养成的?链条其实很清楚。思维链被证明能提分之后,整个行业把”展示工作过程”变成了标配训练目标;评测榜单奖励想得多的模型;于是模型学到了一条铁律:想得越长,分越高。唠叨不是bug,是被分数喂出来的习性。

Ember-1的贡献,是用实验数据捅破了这层窗户纸:砍掉40%的生成token,公开基准不掉,客户A/B测试不掉,编码和智能体负载也不掉。翻译一下——至少四成的内心戏,删了没人看得出来。这四成既不影响对错,也不影响好坏,它的全部功能是过场。就像注水的剧集:正片四十分钟,剧情推进十分钟,剩下三十分钟是回眸、慢镜头和回忆杀。

空荡的舞台,幕布未启——模型输出里的大半是过场戏

二、动手戒唠叨的不是科学家,是账房

有意思的是这件事的发起方。Fireworks不是研究”思维本质”的地方,它是卖推理的。推理是按token计费的生意,而智能体的出现让唠叨从个人习惯变成了财务问题:聊天场景里模型啰嗦两句,用户多等一秒,忍了;智能体场景里,一个循环跑上百次调用,每次多吐四成token,成本曲线直接翻上去。唠叨在聊天里是性格,在智能体里是负债。

所以再看那50多个训练实验、200多轮评估——这不是哲学思辨的排场,是工业级的行为矫正。团队的目标函数里没有”什么是思考”,只有”哪些token删了不掉分”。而结果显示,这个可删除空间大得惊人。

我猜接下来一年,”教模型少想”会成为一个正经赛道,就像当年”教模型多想”一样。这里有一组不太舒服的对照:当初给模型加上思维链,理由是”想得多=想得好”;如今给模型做减法,依据是”删得多=掉分少”。两个方向的指挥棒都不是认识论,是评测榜和账本。模型的内心生活究竟是什么样,从来没人在乎——大家在乎的只是分数和发票。顺带一句,token便宜了用量会不会反扑,杰文斯老先生的那个问题,这回先按下不表。

三、被静默删掉的40%,原本还兼职我们的”安全旁白”

还有一层,聊的人不多:思维链不只是性能部件,它长期兼任着透明度的卖点和安全观测的窗口。监管者看它,安全团队盯它,”可解释AI”的宣传也指着它——我们安慰自己:至少模型把推理过程写出来了,出了事能查。

现在这个窗口被证明掺了四成的水。这不只是浪费钱的问题,它动摇的是一个假设:模型写出来的”思考”,等价于它实际的”思考”。如果四成旁白可以无损删除,那保留下来的六成,是更接近本质了,还是只是被修剪得更得体了?我们盯着思维链做安全审计的样子,会不会像检查学生笔记的家长——笔记越工整心里越踏实,离孩子的真实想法却越来越远。

不过我也不想把这事只讲成阴暗面。往好处说,”该沉默时沉默”本来就是智力的组成部分。资深医生看片子,不会把鉴别诊断逐条念出来;老编辑改稿,不会为每处语病开个短会。真正的专家省掉的是过场,留下的是判断。如果Ember-1这类工作最终让模型学会把token花在刀刃上,那不是思考的退化,是思考的成年。只是要记住,促成这场成年礼的不是哪个实验室对智能本质的顿悟,而是推理账单上那个刺眼的数字。

机房里的推理服务器,每一行内心戏都记在账上

结语

Ember-1最诚实的部分,是它那句”一半的token,同样的答案”。它没宣称模型更聪明了,只说钱花得更少了。这很符合这个行业一贯的真相顺序:先有账单,后有洞察;先教模型开口,再教它闭嘴,两头的钱都挣到了。至于被删掉的那四成内心戏里,本来有没有可能长出点什么别的想法——没人会为一个不存在的token立项。

📷 Photo by Paolo Chiabrando on Unsplash

📷 Photo by Tyler on Unsplash