向量数据库没死,它只是搬了家

向量数据库没死,它只是搬了家

9月30日,turbopuffer发了一篇标题不太吉利的博客:《RIP, vector database》。有意思的地方在署名——turbopuffer正是靠「服务器无关向量数据库」这个名头起家的,Cursor和Notion是它最早的客户,如今它亲手给这个品类写了讣告。讣告的核心只有一句话:向量索引正在从存储架构的王座上走下来,降级成众多二级索引中的一员。很多人把它读成一次例行的产品更新,我读到的却是一次品类层面的坍塌——不是向量检索不行了,而是「向量数据库」作为一个独立品类,从头到尾可能就是个误会。

向量数据库没死,它只是搬了家

一、讣告的技术细节:向量索引是怎么从王座上走下来的

先看事实。turbopuffer v1的设计非常纯粹:一个文档就是ID加向量,向量用分层聚类索引组织,底层完全压在对象存储上——S3当事实源,NVMe和内存只做缓存。这套架构在当时是异端:主流做法是图索引加本地盘,turbopuffer偏要用对象存储的廉价换规模。结果是单索引撑到千亿级向量、200毫秒的p99读延迟、每秒千级QPS,Cursor和Notion用脚投了票,这个赌局赢了。

变化从v2开始。客户要属性过滤、要全文检索、要正则、要聚合,工程师的办法是在向量主索引外面挂倒排索引——所有属性和全文索引都指向向量的聚类地址,一切查询计划围着向量转。痛点也在这里,官方博客列了三条:其一,文档的所有内容都按向量地址存放,多向量文档(比如late interaction这种一段文本拆多个向量的做法)要把全文复制好几遍,存储放大;其二,更新一个向量会触发聚类重排,重排会级联搬家几百个属性和它们的倒排索引,写放大严重到调优已经收益递减;其三,现代查询引擎靠向量化批处理吃饭,DuckDB一批2048行,ClickHouse六万五,向量索引却把所有计划摁在一百到两百的簇大小上,CPU吃不饱。

v3的方案说穿了很朴素:换一个新主索引,让近似最近邻检索「只是众多二级索引之一」。就这么一句话,宣告了「以向量为中心」这个架构信条的终结。写讣告的人没有换行业,他只是把自家架构的真实主从关系说破了。

图书馆书架上一排排按序归位的书:向量聚类成树,本质是给记忆编目

二、品类的死法:被一个更便宜的抽象收编

数据库这个行当有条铁律:独立品类的存续,靠的不是技术差异,是负载差异。一个新品类配得上独立存在,要同时满足两个条件——它有一种别家做不了的负载,和一套别家给不了的经济学。向量数据库在2023年两个都占:RAG爆发,所有公司一夜之间都要语义检索,专用引擎比通用方案早上线三个月,为这三个月付费是合理的。

但向量检索的负载天性是「读多写少、一写全动」:文档变成向量之后几乎不更新,一旦更新,聚类要重排、倒排要重挂——这正是turbopuffer自己在写放大一节里承认的死穴。这种负载和日志、全文检索、时序数据是同构的。存储引擎的历史反复上演同一出戏:专用引擎因为早到三个月而爆发,然后通用引擎把这种负载作为一个索引类型收编,专用厂商要么转型要么消失。LSM树吃掉了一半时序数据库的市场,对象存储吃掉了数据湖的存储层。当Postgres装个pgvector插件能做到八十分,为剩下的二十分养一整套独立运维,CFO的算盘比架构师的情怀响。更妙的是turbopuffer讣告里一句被多数人略过的话:新架构要「把更多SQL查询搬进自家引擎并跑快」。翻译一下——向量数据库奋斗的尽头,是变成一个通用数据库。它不是被谁杀死的,是被自己的下一步进化定义成非必要的。

三、真正的死因在需求端:Agent要的从来不是纯向量

有人会说,品类死了需求还在,无所谓。但需求端的变化比供给端更彻底。RAG早期的典型查询是纯语义的:「找出和这段话意思最近的十段文本」,向量一枝独秀。而今天Agent做检索,查询长这样:「找出去年签订、金额超过一百万、包含保密条款、且语义上涉及违约责任的合同」。这里面有过滤、有排序、有全文匹配、有语义召回,唯独没有一步是「纯向量」。turbopuffer披露的客户用例就是现成证据:Linear拿它做增量同步引擎,一个向量都不算;文本、正则、聚合的查询计划越挂越多,反客为主。连发明讣告的公司自己,都已经是通用查询引擎的形状了。

当向量从「查询的主体」降格为「众多谓词之一」,向量数据库这个品类就失去了语法。这和搜索引擎的故事互为镜像:搜索引擎没有死,但「搜索引擎公司」作为一个独立物种消失了——它们全都变成了更大系统里的一个组件。RIP的不是一个产品,是产品之间的那条边界线。

港口集装箱堆场:对象存储的经济学,按箱计费、随取随用,专有仓库撑不住这种成本结构

结语:风口品类的保质期

回看这三年,向量数据库从无人问津到融资榜常客,再到今天被自家头部玩家写进讣告,一个「AI基建风口品类」的完整生命周期,几乎精确等于风口本身的长度。类似的名单还能往下列:提示词管理平台、AI内容检测工具、专门的prompt交易市场——它们都曾宣布自己是「新品类」,如今一个个都在等着被上游的版本更新或下游的插件收编。

所以下次再看到「X数据库」「Y即服务」宣布开创品类时,先别激动,问一个turbopuffer用亲身经历回答过的问题:这种负载的独特性,三年后还配得上一台独立引擎吗?还是它只是下一代通用数据库更新日志里的某一行?向量没有死,向量只是搬了家——从专有的宫殿,搬进了通用引擎的集体宿舍。而住在宫殿里的品牌,从来付不起集体宿舍的房租。

📷 Photo by Zetong Li on Unsplash

📷 Photo by CHUTTERSNAP on Unsplash