十亿级向量检索新纪元:Qdrant发布FineWeb-10B与开源基准引擎Supernova
在人工智能系统日益依赖语义搜索与知识召回的今天,向量数据库的性能边界正被不断推高。然而,当前主流的向量检索基准测试仍停留在千万至亿级规模,且普遍缺乏真实世界所需的复杂查询模式——如稀疏向量融合、多向量交互(ColBERT-style)以及带过滤条件的混合检索。这种脱节导致学术优化与工业实践之间出现显著鸿沟。为弥合这一差距,Qdrant团队联合Vultr基础设施,正式发布Qdrant-FineWeb-10B——首个达到100亿向量规模的开源基准数据集,并同步推出全栈式开源基准引擎Supernova,彻底重构大规模向量检索的评估范式。
十亿级真实世界基准:FineWeb-10B的技术突破
FineWeb-10B并非简单地将现有语料库嵌入放大,而是通过严谨的工程链路构建出具备完整评估闭环的“活”数据集。其核心创新在于三点:规模真实性、查询多样性与真值完备性。
首先,在数据源选择上,项目采用Hugging Face的FineWeb语料库——一个经过严格清洗、覆盖多语言网页内容的高质量文本集合。这确保了嵌入空间的语义丰富性远超维基百科或MS MARCO等传统基准。使用gte-multilingual-base模型生成嵌入后,最终得到100.7亿条768维稠密向量,同时保留对应的稀疏表示(基于相同模型的词袋输出),总数据体积达24.47TB。
其次,为模拟真实用户行为,团队精心构造了10万条多样化查询。这些查询不仅涵盖信息检索、问答、语义相似度等典型任务,还特别设计了带元数据过滤条件的复合查询(例如“2023年后关于气候变化的科技文章”)。这种设计直击当前生产系统的核心痛点——纯向量相似度往往需与结构化过滤结合才能满足业务需求。
最关键的是真值(ground truth)的生成。传统基准常因计算成本放弃精确最近邻,转而使用近似结果作为伪标签,导致评估偏差。Supernova引擎通过GPU原生暴力搜索模块nova-bf,在分布式集群上完成了10万查询 × 100亿向量 × Top-1000 的全量距离计算,累计执行超过10^15次(一千万亿次)向量运算。该过程采用流式数据加载与定制化GPU融合核,避免内存溢出,最终产出精确的Top-1000真实近邻列表,为后续recall@k等指标提供黄金标准。
超越单模态:多场景基准数据集矩阵
FineWeb-10B虽以文本为主,但Qdrant团队同步发布了两个补充数据集,展示Supernova在异构场景下的扩展能力:
PubMed-Multi-Vector:基于生物医学文献库PubMed,使用BGE-M3模型同时生成稠密向量、稀疏向量及ColBERT风格的多向量token(每个文档拆分为83.7亿个细粒度token)。该数据集专为测试多粒度混合检索而设计,允许研究者在同一语料上公平比较不同表示方法的性能。
Coyo-Vector-Embeddings:聚焦多模态场景,利用Qwen3-VL视觉语言模型将LLaVA数据集中的图像-文本对映射到统一的2048维嵌入空间。这反映了当前AIGC应用中图文联合理解的典型需求,为跨模态检索提供新基准。
这三个数据集共同构成覆盖文本单模态、文本多表示、图文多模态的评估矩阵,填补了开源社区在复杂检索场景下的空白。
Supernova:解耦式分布式基准引擎架构
如果说FineWeb-10B是“弹药”,那么Supernova就是制造并发射弹药的“武器系统”。其设计哲学是模块化、无状态、云原生,彻底摆脱对特定数据库或云厂商的依赖。
四阶段流水线:从原始数据到性能报告
Supernova将基准构建拆解为四个独立可扩展的阶段:
嵌入生成(
nova-embed):支持SentenceTransformers、FastEmbed、OpenAI API等多种后端,输入数据可来自Hugging Face Datasets、S3或Cloudflare R2。关键创新在于无中心协调——每个工作节点仅根据自身rank和world size计算数据分片偏移量,实现线性扩展。实测在1000 GPU集群上,嵌入吞吐达每秒200万条。真值计算(
nova-bf):针对十亿级暴力搜索的内存墙问题,采用CPU-GPU协同过滤策略。先在CPU上应用元数据过滤器剔除无关向量,再将剩余数据流式传输至GPU。其自研的late-interaction核函数可高效处理稠密+稀疏混合距离计算,比FAISS brute-force快3.2倍。数据库加载(
nova-load):抽象出统一接口对接Qdrant、Milvus、Elasticsearch等后端。通过动态调整批大小与并发数,自动探测目标系统的最大写入吞吐,避免因配置不当导致的性能误判。压力测试(
nova-storm):模拟真实流量模式,支持泊松分布请求、突发流量注入。除常规QPS、延迟分位数(p50/p95/p99)外,独创recall漂移监测——持续对比近似搜索结果与nova-bf真值,量化精度损失随负载变化的趋势。
SkyPilot驱动的跨云弹性调度
为屏蔽底层基础设施差异,Supernova引入nova-dist控制器,深度集成SkyPilot框架。用户只需编写YAML配置声明资源需求(如“128×A100 GPU, 1TB内存”),nova-dist即可自动:
- 在AWS/GCP/Azure/K8s/Slurm间选择最优集群
- 处理节点故障与任务重试
- 挂载远程存储卷(如S3)供各模块直接读写
这种设计使研究人员能用同一套配置在公有云与本地超算中心无缝切换,极大降低大规模实验门槛。Vultr在FineWeb-10B生成中即采用此模式,仅用72小时完成全部嵌入计算。
对向量数据库生态的深远影响
FineWeb-10B与Supernova的发布标志着向量检索评估进入新阶段:
终结“玩具数据集”时代:过去在SIFT1M或GIST1M上的微优化不再具有说服力。数据库必须证明其在十亿级、带过滤、混合表示场景下的稳定性与效率。
推动混合检索标准化:稀疏+稠密融合已成为行业共识(如Elasticsearch的
text_expansion+knn),但缺乏统一评估协议。FineWeb-10B提供现成的稀疏-稠密对齐真值,促使各厂商公开其混合策略细节。降低创新门槛:初创公司或学术团队无需自建PB级数据管道,可直接基于Supernova复现SOTA结果或测试新算法。Hugging Face的托管进一步简化了数据获取流程。
值得注意的是,该项目刻意避免绑定Qdrant自身产品。所有工具链均以通用接口设计,明确支持竞品数据库评估。这种“基础设施先行”的开放策略,有望加速整个向量数据库领域的技术收敛与进步。
技术挑战与未来方向
尽管成果显著,十亿级基准仍面临未解难题:
动态更新场景缺失:当前数据集为静态快照,而生产系统需处理实时插入/删除。未来Supernova计划加入时间序列更新流模拟。
长尾查询覆盖不足:10万查询虽多,但相比真实用户query分布仍有偏差。团队正探索基于LLM合成边缘案例查询。
能耗指标整合:大规模GPU计算带来显著碳足迹。后续版本拟集成功耗监控,推动绿色AI评估。
Qdrant已承诺持续扩充数据集矩阵,下一步可能包括代码检索(GitHub数据)、语音嵌入(Whisper特征)等垂直领域基准。随着多模态大模型爆发,向量检索的复杂度只会更高——而FineWeb-10B与Supernova为这场升级提供了不可或缺的标尺。