AI导航

OpenRouter 发布 2026 嵌入模型选型指南:37 个模型实测,按场景直接抄答案

AI资讯
4 min read
1 次阅读

2026 年 9 月 23 日,AI API 聚合平台 OpenRouter 在官方博客发布了《2026 年最佳嵌入模型选型指南》。这份指南基于其嵌入模型目录中 37 个条目,对其中 19 个模型发起真实 API 请求、完成 28 项兼容性检查后,给出了按英文 RAG、多语言检索、代码搜索、图文检索和低成本建索引划分的推荐清单。OpenRouter 同时强调,这些检查只验证了请求与响应的兼容行为,不测量检索质量,部署前仍要用自己的标注数据对比候选模型。

按场景看推荐清单

使用场景 推荐模型 入选理由
英文 RAG 默认选项 openai/text-embedding-3-small 价格低、8192 token 上下文、支持 dimensions 参数压缩向量
输入超过 8192 token voyageai/voyage-4-large 32000 上下文,Voyage 4 各档向量空间互兼容,换档不用重建索引
多语言检索且要开源权重 qwen/qwen3-embedding-8b 支持 100 多种语言、32768 上下文,4096 维向量是 1024 维的 4 倍存储
代码搜索 voyageai/voyage-code-4 专为代码检索与编码智能体训练,对比项是 Codestral Embed
图文同库检索 google/gemini-embedding-2 文本和图片进同一个向量空间,图片 token 按 $0.45/百万单独计价
付费模型里最便宜 perplexity/pplx-embed-v1-0.6b 输入 $0.004/百万 token,32000 上下文
免费路线 nvidia/nemotron-3-embed-1b:free 免费、32768 上下文,但免费路由有隐私设置限制

指南的验证方式和边界

这次验证的数据快照是 2026 年 9 月 11 日的目录状态。OpenRouter 对 19 个模型发送了双字符串批量请求,共跑 28 项检查,覆盖批输入、可调维度、图片输入、图文混合输入和错误处理。16 个付费模型都按预期每个输入返回一个向量,dimensions 参数在 OpenAI 3 Small、Gemini Embedding 2 和 Voyage 4 Large 上实测可用;请求不存在的模型会返回 400 错误。

边界要说清楚:这些请求只确认了 API 兼容性,没有测检索质量,也没有测响应延迟。模型与场景的匹配依据的是文档能力、语言覆盖、上下文长度、向量维度和价格,再参考 MTEB、CoIR 等公开评测初筛。最终用哪个,取决于你自己标注的 query 和文档跑出来的召回效果。

对做 RAG 的人意味着什么

英文知识库可以直接用 text-embedding-3-small 起步,这是 OpenRouter 给出的默认答案;只有 small 漏检、特别是跨语言检索时,再考虑 large,但向量维度从 1536 翻到 3072,存储和搜索成本同步上涨,切换前必须在保留问题上对比。长文档场景先看上下文窗口,32k 上下文的 Voyage 4 系列和 Qwen3 Embedding 是主要候选。

价格方面,指南里列的是 9 月 11 日目录快照价,OpenRouter 明确提醒大规模建索引前以模型页实时价格为准。另外免费的 Nemotron 路线在指南测试中因账号隐私设置返回了 404,OpenRouter 的文档也说明免费模型路由可能被用于训练——企业敏感数据建议走付费路由或自托管开源权重。

FAQ

Q:英文 RAG 到底先用哪个嵌入模型?

A:按这份指南,先用 openai/text-embedding-3-small。价格低、8192 token 上下文、支持降维,多数英文知识库够用;先在自己的标注问题上测召回率,达标就不用折腾。

Q:多语言检索又想自己部署权重,选哪个?

A:qwen/qwen3-embedding-8b。支持 100 多种语言、权重公开可下载,托管走 OpenRouter API 也行。注意它的默认向量是 4096 维,索引体积是 1024 维模型的 4 倍,估算存储时要算进去。

Q:代码库检索有什么专门选择?

A:voyageai/voyage-code-4,专为代码和技术内容检索设计,32000 上下文能吃下长文件。备选是 mistralai/codestral-embed-2505,上下文只有 8192,建议先测 Voyage 再拿它做对比。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。