100倍成本优势,小模型凭什么反杀GPT-5.6?
说真的,当一个8B参数的小模型用100倍的成本优势干掉顶级闭源模型的时候,问题已经不是”小模型行不行”,而是”我们是不是一直在为不需要的东西付钱”。

Castform到底做了什么
事情是这样的。Neon(一家做Serverless Postgres的公司)和Castform(一个RL后训练工具)联合发了一篇技术博客,核心结论很直白:
在代理检索任务(agent retrieval)上,他们用RL后训练过的开源小模型,跑出了跟GPT-5.6 Sol基本持平的结果。成本呢?低100倍。
这不是那种”在某些特定benchmark上提高了2个百分点”的论文式突破。这是100倍。这个差距大到你会开始怀疑:GPT-5.6里那些多出来的参数,到底在干嘛?
Castform的卖点也很实在——他们把RL后训练包装成了”像写提示词一样简单”的工具。不需要懂GPU、不需要会写训练脚本,选个基础模型、定义个奖励函数、跑就行了。说得粗暴一点:他们把微调的门槛从”需要ML工程师”降到了”需要能写清楚你想要什么”。
先别急着吹,看看前提条件
不过我得说句公道话。这个结果有一个很重要的限定词:代理检索任务。
检索任务和通用对话是两回事。在”帮我写一封商务邮件”或者”分析这段代码的bug”这种开放式场景里,GPT-5.6的综合能力大概率还是碾压的。但当你的任务很具体——比如”从1000篇文档里找到跟这个查询最相关的5篇”——一个在同类任务上被RL精调过的小模型,完全可以比通用大模型更准。因为它没有被一万种其他任务”稀释”。
这就像问一个全科医生和专科医生谁更擅长看心脏病。全科医生什么病都懂一点,但真正遇到复杂的心脏病例,你可能更想找那个只看心脏的。

所以100倍的成本优势是真实的,但它的适用范围是有限定的。问题在于:企业里有多少AI任务其实是这种”限定任务”而非”通用对话”?
我猜,比你想象的多得多。
算一笔账
让我们把数字摆出来:
| GPT-5.6 Sol | Castform开源小模型 | |
|---|---|---|
| 单次检索调用成本 | ~$0.15 | ~$0.0015 |
| 准确率 | 基准水平 | 持平或略优 |
| 私有部署 | 不支持 | 支持 |
| 定制能力 | 提示工程 | 完全可微调 |
| 延迟 | API网络延迟 | 本地推理,几乎为零 |
| 数据不出境 | 需要上云 | 完全本地 |
假设一个中等公司每天需要处理5万次检索查询:
- 用GPT-5.6:每天约$7,500,每月约$22.5万
- 用Castform方案:每天约$75,每月约$2,250
一年下来,差距是260万美元。这笔钱够雇一个小型AI团队了。
而这对很多公司来说,甚至不是一个”要不要省钱”的问题。金融、医疗、法律这些行业对数据出境有硬性要求——你的数据根本不能上OpenAI的API。本地部署的开源方案不是省钱的选择,而是唯一合规的选择。
边缘AI正在变成正经事
这次报告中让我最兴奋的不是”100倍成本优势”本身,而是它发生的时机——几乎和几个边缘AI的里程碑式突破同时出现:
- Swiftlet让80B的Qwen模型在Mac上跑起来,只吃4.3GB内存
- Maple的20B MoE模型在iPhone上跑到120 token/s
- Soup让4GB笔记本GPU也能微调8B模型
把这些拼在一起看,一个完整的图景就出来了:
以前你需要的计算资源只有云厂商能提供,所以他们定了价格。现在,你手机上的算力就能跑一个足够好的模型,你笔记本上的GPU就能微调它,RL后训练工具让它快速适应你的具体任务。整个链条都脱离了对巨头的依赖。

这张图片挺合适的——小模型就像从数据中心巨头们铺好的混凝土裂缝里长出来的草。看起来不起眼,但它正在改变整个生态的格局。
我们在为什么付钱?
这让我想到一个更深的问题:我们到底在为GPT-5.6的什么能力买单?
它的参数量很大,能做数学推理、能写诗、能翻译、能编代码、能聊哲学。这些能力打包在一起当然很厉害。但如果你只需要它做检索呢?你需要为它会写诗这件事付钱吗?
传统软件行业早就解决过这个问题。没人会因为Oracle数据库能做全文搜索就去用Oracle做搜索引擎——Elasticsearch更便宜更快更灵活。但在AI领域,很多人还默认”最大的模型就是最好的选择”。
Castform的结果戳破了这个假设,至少在检索这个场景里。其他垂直场景——代码审查、合规检查、文档摘要、客户分类——大概率也会遵循同样的逻辑。
几条实在的建议
如果你在纠结是接GPT-5.6的API还是自己搞开源方案,我的想法:
先搞清楚你80%的调用到底是不是同一种任务。如果是,通用模型大概率是浪费。
然后试一把RL后训练。Castform这类工具现在的门槛已经很低了——选模型、写奖励函数、跑。花个周末就能有个结果,拿着结果跟API方案对比一下成本,答案自己就出来了。
数据隐私这事儿别等合规部门来找你。现在开始做本地化方案,比将来被叫停了再手忙脚乱地迁移要省事得多。
最后,别被参数量唬住。GPT-5.6确实强,但强在通用性。你干的是限定场景的活儿,”刚刚好”往往比”大而全”更值。
说到底,Castform的报告让我想起一句话:最好的技术不是最强大的,而是刚刚好够用的。100倍的成本优势不是讨价还价的结果,而是”我们本来就不需要那么多”的证明。
开源小模型不会取代GPT-5.6。但它会让很多人停下来想一想:我真的需要GPT-5.6吗?