Token末日:当企业发现AI账单比预期贵了一个数量级
企业AI消费正在经历一个从”先跑起来再说”到”等等,这个账单对吗”的集体转向。这不是技术问题,是钱的问题。

今年夏天,AI行业最热闹的话题不是哪个模型又刷了新SOTA,而是钱。具体来说,是AI token的花出去的速度,和很多公司CFO看到的账单数字之间,那条巨大的鸿沟。
8月初,404 Media搞到了一段埃森哲的内部音频。录音里讨论的核心议题让人意外:怎么让非技术员工少用点AI。不是技术部门,是那些把PDF转成PPT、用AI写周报的普通员工,他们反而是token消耗的大户。同样的信号来自Uber——这家公司已经开始限制员工使用Claude Code和Cursor。GitHub悄悄改了计费方式,按token用量收费。
两年前大家还在比赛谁能更快把AI塞进每一个工作流。现在比赛变成了谁能更快地把失控的AI支出拉回来。
谁在花钱?答案可能让你意外
很多人直觉上会觉得,AI token的主要消费者是工程师——那些写代码、调模型的技术人员。实际数据指向了完全不同的方向。
埃森哲的案例特别有代表性。作为全球最大的咨询公司之一,埃森哲内部推AI的力度不比任何人小。但内部讨论发现,真正把token用量推上去的,恰恰是非工程师群体。有人用AI把一份30页的PDF转成幻灯片,另一个人让AI帮忙写项目汇报,第三个人让AI总结会议纪要。每一次操作看起来都很合理,但加在一起就是天文数字。
这背后有一个容易被忽略的数学问题。一个工程师用Claude Code写代码,一天可能消耗几万个token。但一个非技术员工如果把每封邮件、每份文档、每个会议记录都扔给AI处理,token消耗量可能轻易超过工程师。因为后者使用AI的频率和场景远比前者分散和密集。
Databricks最近联合Stripe、Coinbase、Uber、Ramp等公司做了一份AI编码成本管理的大规模实践报告。报告里有一个观点我觉得特别到位:效率前沿的推进速度远超智能前沿。翻译成大白话就是——便宜模型变聪明的速度,比贵模型变得更聪明的速度快得多。

内存末日:硬件层面的成本暴击
AI成本失控不只有token这一条线。硬件供应链正在给所有人补一刀。
IGN报道说,2027年的内存产能已经被预订一空。这是”RAM末日”的延续——从2024年底开始,AI训练和推理对高带宽内存(HBM)的需求暴涨,三星、SK海力士和美光的产能被GPU厂商几乎全部吃掉。现在这个压力已经传导到普通服务器内存市场。
对于企业来说,这意味着运行AI推理的基础设施成本不会降,只会继续涨。Oracle就是最鲜活的例子。Larry Ellison今年豪掷700亿美元扩建数据中心,赌的是AI推理需求会持续爆发。结果S&P把Oracle的信用评级降到了BBB-,距离垃圾级只差一步。讽刺的是,同一个Oracle,一方面禁止AI生成代码进入OpenJDK开源项目,理由是安全和知识产权风险;另一方面,Ellison公开说Oracle的代码已经在用AI来写了。
这种左右互搏的状态,其实反映了很多大公司目前的真实处境:嘴上说拥抱AI,手上开始收紧预算。
企业省钱三板斧
从Databricks的报告和各家公司的做法来看,控制AI成本大致有几条路径,我按可行性和效果排了个序:
1. 模型降级:用更便宜的模型干同样的活
这是见效最快的。Databricks内部评估发现,GLM系列模型在编码任务上的性价比极高——成本只有GPT-5.6的零头,但效果差距并没有想象中大。他们还做了个有意思的事:推出了一个叫Omnigent的开源元工具,专门用来帮团队找到最适合当前任务的模型。
Stripe的做法更直接:把内部AI任务的80%迁移到了开源低成本模型上,只在确实需要前沿能力的地方保留昂贵模型。效果?成本降了60%以上,而员工感知到的质量变化微乎其微。
2. 用量管控:不是不让你用,是给你设边界
Uber对Claude Code和Cursor加了使用限制。GitHub开始按token计费。埃森哲在内部推动”合理使用”的教育。
这些措施本质上都是在解决同一个问题:当AI工具的使用成本几乎为零时,人类会怎样使用它?答案是——无节制地使用。这不是道德问题,是经济学问题。免费或近乎免费的资源总是会被过度消耗,直到出现约束机制。
3. 架构优化:从根子上减少token消耗
Neon的子公司Castform提供了一个有趣的案例。他们推出了RL后训练工具,让企业可以把开源模型针对自己的知识库做强化学习训练。训练后的模型在特定搜索任务上,效果能匹配甚至超越GPT-5.6 Sol,但推理成本几乎可以忽略。这等于把token消耗从”每次调用都花钱”变成了”一次训练,长期省线”。
Cloudflare的Kitesurf走的是另一个方向:它是一个专为AI Agent设计的轻量浏览器,CPU和内存消耗远低于Chromium。如果你要跑成千上万个Agent实例做网页抓取和交互,基础设施成本的差异会被成倍放大。

一组令人不安的数据
404 Media报道中提到的Scalex.dev研究值得单独拿出来说。这个研究设计了一个浏览器审批游戏:模拟AI Agent发送命令请求人类审批。四万次实验,四十多万个审批决定。
结果是:人类平均漏掉了三分之一的威胁。准确率只有66.3%,三分之一的会话最终得分为负。最容易被忽略的威胁类型是凭据泄露(35%)和代码执行/外泄(33.4%)。npm run命令是最大盲区——npm run analyze的误批准率高达64.7%。
这个数据放在成本讨论的语境里看更有意思。当你发现AI Agent的审批环节需要更严格时,人工审批本身也在消耗资源——要么多雇人来审,要么让现有的人花更多时间审。两条路都是钱。
“npm run analyze”的误批准率高达64.7%。当你让人类审批AI命令,你以为加了一道安全锁。实际上很可能加了一道心理安慰剂。
Token经济的未来走向
站在2026年8月往回看,企业AI消费的轨迹其实可以分成几段:
- 2023-2024年,兴奋期。不计成本地部署,先跑起来再说。
- 2025年,觉醒期。第一批大额账单到了,CFO开始问问题。
- 2026年,管理期。各种成本管控工具和最佳实践冒出来。
- 接下来大概率会走向分层管理——核心任务用最好的模型,常规任务用便宜够用的,边缘任务干脆不用。
Google DeepMind最近的人事变动某种程度上也反映了这种节奏变化。Demis Hassabis卸任CEO转任董事长,Jeff Dean在Google待了27年后离开,去创办独立的ML研究机构。行业从”跑马圈地”转向”精耕细作”,人才流动自然会跟着变。
Databricks报告里有句话我反复想了好几遍:”效率前沿推进速度远超智能前沿”。这句话的意思是,两年前你需要花100美元才能达到的效果,现在可能花10美元就能做到。这不是模型变笨了,是聪明模型变便宜了。对大多数企业来说,这是比任何”SOTA”新闻都重要的趋势。
写在最后
“AI成本管理”这个话题一直被低估。大家更爱讨论AGI什么时候来、AI会不会毁灭世界。但每天实实在在影响数百万开发者和数万家公司的,其实是token价格表。
埃森哲内部那段音频之所以重要,不是因为它揭露了什么秘密,而是因为它证实了一个正在发生的转向:从”每个员工都应该用AI”到”每个员工都应该合理地用AI”。这个”合理”两个字,值很多钱。
如果你所在的公司还在”先跑起来再说”的阶段,说句实在话:现在就该算账了。2027年的内存产能已经卖光了,token价格短期内不会自己掉下来。
参考资料:404 Media, Databricks Blog, IGN, Scalex.dev, The Register, Simon Willison