Turbopuffer 介绍
了解工具的详细功能和使用方法
Turbopuffer 是面向开发者的托管搜索数据库,把对象存储作为持久化基础,计算层使用内存和 SSD 缓存。它支持向量近邻检索、BM25 全文检索、属性过滤和混合召回,适合有大量文档、多个租户或 RAG 检索需求的团队。
适合谁
- 正在为知识库、产品目录或 AI Agent 建立检索层,希望同时找到语义相近内容和精确关键词的开发团队。
- 数据量或租户数增长较快,需要按 namespace 隔离并关注存储成本的 B2B 产品。
- 愿意把权限校验、二阶段 rerank、离线评估留在自己的应用层实现的团队。
主要能力
同一个文本字段可配置全文搜索和原生 embedding;查询时分别跑向量与 BM25,再用 RRF 融合排序。也可以使用外部 embedding 模型。适合把第一阶段从海量文档缩减到几十条候选,再交给自建重排器。官方还提供属性过滤、复制 namespace 的 branching,以及多区域部署选项。具体模型可用性须按区域核对。
边界和成本
Turbopuffer 是商业托管产品,官方明确没有永久免费层或开源版。2026 年 10 月价格页显示 Launch 每月最低用量 16 美元,Scale 256 美元,Enterprise 至少 4,096 美元并有使用费溢价。最低用量是账单底线,不等于固定总价;超出后按实际用量计。BYOC 需联系销售。
对象存储架构会带来写入提交延迟和偶发冷查询。对每次请求都要求极低尾延迟的场景,要用真实数据测试热、冷缓存与不同区域。Turbopuffer 不提供内建的逐文档 RBAC:多用户数据应在服务端根据认证上下文加过滤条件,不能只把权限写在提示词里。
上线前验收
准备含准确答案的 50–100 条真实问题,分别测纯 BM25、纯向量与混合召回的 Recall@10、NDCG、p95/p99 延迟和每千次有效查询的账单。把错召回、无权限文档和冷启动请求单独统计,合格后再把它作为生成模型的上下文来源。