AI导航

Perplexity 开源 pplx-embed-v2-late:图文共用一个检索空间

AI资讯
2 min read
0 次阅读

Perplexity 在 2026 年 10 月 7 日宣布开源 pplx-embed-v2-late,首席执行官 Aravind Srinivas 当天发帖公布了这一消息。这是一组多模态 late-interaction 嵌入模型,包含 9B 与 0.6B 两个版本,权重已在 Hugging Face 提供,采用 MIT 许可,文本和图像被映射到同一个嵌入空间里做检索。

和普通嵌入模型差在哪

主流嵌入模型通常把一整段文本或一张图片压成单个向量,检索时算一次相似度。pplx-embed-v2-late 走的是 ColBERT 式的迟交互路线:为每个 token 生成一个 128 维向量,查询和文档之间用 MaxSim 逐 token 比对再汇总得分。好处是细粒度匹配更准,尤其是长文档、带版式的 PDF 页面和图片这类单个向量容易丢细节的内容;按官方介绍,PDF 页面无需先做 OCR 就能直接被检索到。模型基于 Qwen3.5 构建,使用双向注意力,两个版本由内部一个 18B 的 ColBERT 教师模型蒸馏而来。

两个版本怎么分工

9B 版本实际激活参数约 7.4B,适合离线建索引;0.6B 版本实际激活参数约 340M,适合放在设备端或在线查询侧。关键设计是两者共享同一个嵌入空间:可以用 9B 把整个文档库建好索引,再用 0.6B 在端侧发查询,不必为了查询端的能力妥协索引质量。模型卡给出的公开 ViDoRe v3 成绩中,9B 在图像类和 Markdown 类任务上的 nDCG@10 分别为 65.2% 和 64.7%,0.6B 为 62.3% 和 61.2%;发布方还给出了 MADQA 92.4%、BrowseComp+ 64% 的成绩,这些数字来自发布方口径,选型时应在自己的文档集上复测。

接入方式与使用细节

两个版本都通过 Sentence Transformers 的 MultiVectorEncoder 加载,要求 sentence-transformers 不低于 6.0.0、transformers 不低于 5.4.0。模型卡特别提醒:文本批次和图片批次要分开编码,不支持图文混合输入,用错编码入口不会报错,但检索质量会悄悄下降,这类细节在接入时要写进测试用例。

落地前先算存储账

迟交互的代价是索引体积:每个 token 一个向量,一篇长文档产生的向量数是单向量方案的成百上千倍,存储和内存成本会明显上升。因此它更适合视觉文档密集、检索精度直接影响业务结果的场景,比如合同、研报、票据和图文混排资料库;如果文档以短文本为主、现有单向量检索已经够用,换成迟交互多半是花大钱买小提升。先用真实查询集对比两种方案的召回率,再决定是否迁移。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。