2026 年 9 月 23 日,AI API 聚合平台 OpenRouter 在官方博客发布了《2026 年最佳嵌入模型选型指南》。这份指南基于其嵌入模型目录中 37 个条目,对其中 19 个模型发起真实 API 请求、完成 28 项兼容性检查后,给出了按英文 RAG、多语言检索、代码搜索、图文检索和低成本建索引划分的推荐清单。OpenRouter 同时强调,这些检查只验证了请求与响应的兼容行为,不测量检索质量,部署前仍要用自己的标注数据对比候选模型。
按场景看推荐清单
| 使用场景 | 推荐模型 | 入选理由 |
|---|---|---|
| 英文 RAG 默认选项 | openai/text-embedding-3-small |
价格低、8192 token 上下文、支持 dimensions 参数压缩向量 |
| 输入超过 8192 token | voyageai/voyage-4-large |
32000 上下文,Voyage 4 各档向量空间互兼容,换档不用重建索引 |
| 多语言检索且要开源权重 | qwen/qwen3-embedding-8b |
支持 100 多种语言、32768 上下文,4096 维向量是 1024 维的 4 倍存储 |
| 代码搜索 | voyageai/voyage-code-4 |
专为代码检索与编码智能体训练,对比项是 Codestral Embed |
| 图文同库检索 | google/gemini-embedding-2 |
文本和图片进同一个向量空间,图片 token 按 $0.45/百万单独计价 |
| 付费模型里最便宜 | perplexity/pplx-embed-v1-0.6b |
输入 $0.004/百万 token,32000 上下文 |
| 免费路线 | nvidia/nemotron-3-embed-1b:free |
免费、32768 上下文,但免费路由有隐私设置限制 |
指南的验证方式和边界
这次验证的数据快照是 2026 年 9 月 11 日的目录状态。OpenRouter 对 19 个模型发送了双字符串批量请求,共跑 28 项检查,覆盖批输入、可调维度、图片输入、图文混合输入和错误处理。16 个付费模型都按预期每个输入返回一个向量,dimensions 参数在 OpenAI 3 Small、Gemini Embedding 2 和 Voyage 4 Large 上实测可用;请求不存在的模型会返回 400 错误。
边界要说清楚:这些请求只确认了 API 兼容性,没有测检索质量,也没有测响应延迟。模型与场景的匹配依据的是文档能力、语言覆盖、上下文长度、向量维度和价格,再参考 MTEB、CoIR 等公开评测初筛。最终用哪个,取决于你自己标注的 query 和文档跑出来的召回效果。
对做 RAG 的人意味着什么
英文知识库可以直接用 text-embedding-3-small 起步,这是 OpenRouter 给出的默认答案;只有 small 漏检、特别是跨语言检索时,再考虑 large,但向量维度从 1536 翻到 3072,存储和搜索成本同步上涨,切换前必须在保留问题上对比。长文档场景先看上下文窗口,32k 上下文的 Voyage 4 系列和 Qwen3 Embedding 是主要候选。
价格方面,指南里列的是 9 月 11 日目录快照价,OpenRouter 明确提醒大规模建索引前以模型页实时价格为准。另外免费的 Nemotron 路线在指南测试中因账号隐私设置返回了 404,OpenRouter 的文档也说明免费模型路由可能被用于训练——企业敏感数据建议走付费路由或自托管开源权重。
FAQ
Q:英文 RAG 到底先用哪个嵌入模型?
A:按这份指南,先用 openai/text-embedding-3-small。价格低、8192 token 上下文、支持降维,多数英文知识库够用;先在自己的标注问题上测召回率,达标就不用折腾。
Q:多语言检索又想自己部署权重,选哪个?
A:qwen/qwen3-embedding-8b。支持 100 多种语言、权重公开可下载,托管走 OpenRouter API 也行。注意它的默认向量是 4096 维,索引体积是 1024 维模型的 4 倍,估算存储时要算进去。
Q:代码库检索有什么专门选择?
A:voyageai/voyage-code-4,专为代码和技术内容检索设计,32000 上下文能吃下长文件。备选是 mistralai/codestral-embed-2505,上下文只有 8192,建议先测 Voyage 再拿它做对比。