2025 年 10 月 16 日,PaddleOCR 公布多模态文档解析模型 PaddleOCR-VL(核心模型 0.9B)。该方案采用 NaViT 风格动态分辨率视觉编码器,结合 ERNIE-4.5-0.3B 轻量语言模型,主打在低算力条件下实现文本、表格、公式、图表与手写体的统一识别与结构化输出。官方称在 OmniDocBench 等公开基准与自建集合上达到或刷新多项指标表现。
模型覆盖 109 种语言与多脚本场景,并已在 GitHub、Hugging Face 与在线 Demo 同步提供使用指引与示例。需注意,“SOTA”与跨模型对比来自官方模型卡与仓库公告;具体评测设置、数据版本与可复现实验细节以后续文档为准。此次更新与 PaddleOCR 3.3.0 同步发布,适配现有 PP-StructureV3 等管线以便生产部署。
常见问题
Q:PaddleOCR-VL 的定位是什么?
A:面向文档解析的视觉语言模型,参数约 0.9B,强调在低资源场景下的高准确度与端到端结构化输出。
Q:支持哪些类型与语言?
A:覆盖文本、表格、公式、图表与手写体,宣称支持 109 种语言与多脚本混排场景。
Q:SOTA 结论是否独立验证?
A:当前为官方在 OmniDocBench 与自建集的对比结果;若需独立复核,应关注后续第三方复测与公开复现实验。
Q:如何快速体验与部署?
A:可在 Hugging Face 使用模型卡示例或在线 Demo;GitHub 提供 CLI/Python 用法,并支持与 PP-StructureV3 等组件联动。
Q:此次发布时间与版本关系?
A:官方在 2025 年 10 月 16 日的仓库更新中宣布 3.3.0 版本并同时释出 PaddleOCR-VL 相关说明与用法。