Perplexity 在 2026 年 10 月 7 日宣布开源 pplx-embed-v2-late,首席执行官 Aravind Srinivas 当天发帖公布了这一消息。这是一组多模态 late-interaction 嵌入模型,包含 9B 与 0.6B 两个版本,权重已在 Hugging Face 提供,采用 MIT 许可,文本和图像被映射到同一个嵌入空间里做检索。
和普通嵌入模型差在哪
主流嵌入模型通常把一整段文本或一张图片压成单个向量,检索时算一次相似度。pplx-embed-v2-late 走的是 ColBERT 式的迟交互路线:为每个 token 生成一个 128 维向量,查询和文档之间用 MaxSim 逐 token 比对再汇总得分。好处是细粒度匹配更准,尤其是长文档、带版式的 PDF 页面和图片这类单个向量容易丢细节的内容;按官方介绍,PDF 页面无需先做 OCR 就能直接被检索到。模型基于 Qwen3.5 构建,使用双向注意力,两个版本由内部一个 18B 的 ColBERT 教师模型蒸馏而来。
两个版本怎么分工
9B 版本实际激活参数约 7.4B,适合离线建索引;0.6B 版本实际激活参数约 340M,适合放在设备端或在线查询侧。关键设计是两者共享同一个嵌入空间:可以用 9B 把整个文档库建好索引,再用 0.6B 在端侧发查询,不必为了查询端的能力妥协索引质量。模型卡给出的公开 ViDoRe v3 成绩中,9B 在图像类和 Markdown 类任务上的 nDCG@10 分别为 65.2% 和 64.7%,0.6B 为 62.3% 和 61.2%;发布方还给出了 MADQA 92.4%、BrowseComp+ 64% 的成绩,这些数字来自发布方口径,选型时应在自己的文档集上复测。
接入方式与使用细节
两个版本都通过 Sentence Transformers 的 MultiVectorEncoder 加载,要求 sentence-transformers 不低于 6.0.0、transformers 不低于 5.4.0。模型卡特别提醒:文本批次和图片批次要分开编码,不支持图文混合输入,用错编码入口不会报错,但检索质量会悄悄下降,这类细节在接入时要写进测试用例。
落地前先算存储账
迟交互的代价是索引体积:每个 token 一个向量,一篇长文档产生的向量数是单向量方案的成百上千倍,存储和内存成本会明显上升。因此它更适合视觉文档密集、检索精度直接影响业务结果的场景,比如合同、研报、票据和图文混排资料库;如果文档以短文本为主、现有单向量检索已经够用,换成迟交互多半是花大钱买小提升。先用真实查询集对比两种方案的召回率,再决定是否迁移。