这只哨子,值31亿美元

这只哨子,值31亿美元

10月8日,AI行业同时收到两张账单。第一张:The Information爆料OpenAI营收比此前预期少了200亿美元,AI股票应声下跌。第二张:给这些模型打分的排行榜Arena,B轮拿走2亿美元,估值31亿美元,十个月翻近一倍。球员的钱包瘪了,裁判的身价涨了。这笔账怎么算都别扭——直到你想明白,在AI这个行业里,裁判从来不是比赛的配套设施,裁判就是比赛本身。

这只哨子,值31亿美元

一场人人都在输的比赛,只有记分牌在赚钱

先把31亿美元放回坐标系里。去年5月,Arena以6亿美元投后估值拿了一轮1亿美元的种子;今年1月A轮1.5亿美元,估值17亿;10月8日B轮2亿美元,Lightspeed和Khosla领投,估值31亿。从种子到如今,十七个月身价五倍;从年初算起,正好应了TechCrunch那句标题——十个月,接近翻倍。同期它做了什么?没有新产品线,没有收入模式的革命性转向,主业依旧是那个从伯克利宿舍里长出来的网页:你输入一句话,两个匿名模型各答一遍,你点选哪个更好,千百万次投票聚合成Elo分数。

对比另一边的玩家:Character.AI不到30亿美元就把团队和授权技术并进了谷歌;一众明星模型公司在B轮C轮倒在「评分不够、叙事来凑」的门槛上。一家不训练模型、不卖算力、不直接经手任何推理流量的公司,估值高过了绝大多数造模型的人。风险投资不是慈善家,他们买的是一个判断:只要这场比赛不停,记分牌就是全场唯一稳赚的位置。

这个判断本身没毛病。有毛病的是它照出的行业底色:当评级工具比被评级者更值钱,说明这一行的核心资产已经不是能力,而是「看起来有能力」。分数不是产品的附属品,分数就是产品。模型公司可以亏损,叙事不能破产——而叙事的硬通货,就是榜单上那几位数的名次。

微缩球场里的记分牌——整个行业在缩微的球场里比赛,看台上的投票才是硬通货

百万人的投票,投不出一个公正的裁判

Arena的合法性建立在「群众智慧」上:匿名对战、真人投票、百万级样本。但去年4月,Cohere联合艾伦研究所、普林斯顿、MIT、斯坦福的研究者发了一篇题为《The Leaderboard Illusion》的论文(arXiv:2504.20879,后来进了NeurIPS),把这台投票机器拆开了看。三个发现,每个都够扎心。

其一,数据不对等。Google和OpenAI被估算分走了全场19.2%和20.4%的对战数据——在这个行业,用户对战数据就是免费的反向工程燃料,头部实验室拿它调模型,等于在别人看不到的健身房里偷偷加练。其二,私有变体泛滥。研究者识别出单一提供商挂出过27个未公开的模型变体同场竞技:同一家公司可以同时派几十个「幽灵选手」上场试水,表现差的悄悄撤下,最好的那个再以正式身份官宣,落选者连统计痕迹都不留。普通开发者提交一个模型是测试,头部实验室提交二十七个是选秀。其三,撤回偏差。模型可以先匿名测完再悄悄下架,排行榜的历史名次被无声修改——你看到的榜单,是幸存者写的。

而这篇论文发表前的那个春天,市场已经预演过它的结论:Meta的Llama 4 Maverick在Arena上冲到总榜第二,媒体一片哗然——随后被发现参战的是一个专为对话场景调过教的实验版本,与公开发布的官方版本不是同一个东西。Meta辩称是「沟通误会」,Arena事后补了规则。但规则能补的只是流程,补不了结构性的问题:场上最强大的那几个玩家,恰恰是裁判最大的金主和最大的数据来源。这不是Arena独有的堕落,这是注意力市场的引力——越重要,越难中立。

它正在长成穆迪,而没人给它写招股书里的风险章节

把镜头拉远,Arena做的事情和评级机构高度同构:把复杂对象压缩成一个可比较的分数,让全市场的采购决策绕开尽调、直接引用。穆迪们给债券评级,Arena给模型评级;穆迪的AAA是养老基金进场的通行证,Arena的前三名是CTO选型的默认答案。而这个行业,已经开始往记分牌上挂真金白银。金融研究实验室nof1的Alpha Arena把六个前沿模型扔进加密永续合约市场,每个模型一万美金实盘;结果把传统基准排名整个掀翻——推理分数顶级的GPT-5是最差交易员,亏掉62.7%,而低调的Qwen 3 Max最赚钱,+22.3%。当模型排名开始被真金白银直接结算,一个评分机构的定价误差就不再是学术争鸣,而是实打实的盈亏。从这个角度看,31亿美元的估值买的不是一家排行榜公司,是一家准信用评级机构在未来万亿算力采购里的签字权。

但评级机构的历史账本,行业里没几个人翻过。2008年金融危机后,参议院常设调查小组委员会那份著名的《华尔街与金融危机》报告里,引述了标普内部员工的一封邮件:「让我们祈祷,等这座纸牌屋塌掉的时候,我们都已经致富退休了。」评级机构商业模式的原罪从来不是无能,而是结构:付钱的是被评级的发行方,引用分数的是投资方,被牺牲的永远是后者。今天的Arena面临一模一样的引力场——模型公司贡献流量、贡献数据、贡献发布会引用,谁在付钱一目了然;而拿分数做决策的开发者和企业买家,才是「纸牌屋」真正塌下来时最后接盘的人。区别只在于,穆迪好歹有SEC的注册监管和危机后的改革法案,Arena拥有的只有自己那份GitHub上的评审章程。

有意思的是,圈内人比谁都清楚这一点,但所有人照玩不误。实验室一边引用榜单发布模型,一边私下告诉投资人「Arena分数有水分」;企业买家一边在采购文件里要求「Arena排名前五」,一边抱怨评分无法反映自家工作负载。人人都知道皇帝新衣的裁缝同时开了家当铺,但没人敢先脱衣服——因为别人都穿着。这恰恰是资产空心化的标准前兆:一个所有人都不信任却所有人都要引用的指标,比一个所有人都信任的指标,脆弱得多。

投票箱:百万次点击堆出来的公信力,和金融市场的评级一样,是借来的时间

结语:下一次危机前,先问裁判拿什么吃饭

31亿美元的融资案,本质上是风险投资对这个行业做的一次心理测评:他们赌的是未来两年模型评测会变成一个牌照生意,而牌照已经发给他们看好的这一家。这个赌注未必输。但作为这个行业真正的用户,我们该在下一轮「榜单血洗」发生前,把三个问题变成肌肉记忆:这个指标的商业模式的收入来自谁?被评级的巨头在多大程度上参与了规则制定?分数的历史是否可被无声改写?

2008年之后,监管者花了整整十年才给评级机构套上笼头;那份参议院报告的结尾,把「扭曲的信用评级」列进危机成因清单。今天这个还没长出笼头的哨子,已经先长出了31亿美元的价签。吹哨的人越值钱,哨声就越值得怀疑——这不是对Arena的指控,是对所有把决策外包给记分牌的人的提醒:记分牌从不看球,看球的是你自己。

📷 Photo by Aurora Song on Unsplash

📷 Photo by Dmitrii Vaccinium on Unsplash