AI导航

工业级多模态文档智能:PaddleOCR 推出超小型 Vision-Language 模型 PaddleOCR-VL

AI资讯
2 min read
123 次阅读

2025 年 10 月 16 日,PaddleOCR 公布多模态文档解析模型 PaddleOCR-VL(核心模型 0.9B)。该方案采用 NaViT 风格动态分辨率视觉编码器,结合 ERNIE-4.5-0.3B 轻量语言模型,主打在低算力条件下实现文本、表格、公式、图表与手写体的统一识别与结构化输出。官方称在 OmniDocBench 等公开基准与自建集合上达到或刷新多项指标表现。

模型覆盖 109 种语言与多脚本场景,并已在 GitHub、Hugging Face 与在线 Demo 同步提供使用指引与示例。需注意,“SOTA”与跨模型对比来自官方模型卡与仓库公告;具体评测设置、数据版本与可复现实验细节以后续文档为准。此次更新与 PaddleOCR 3.3.0 同步发布,适配现有 PP-StructureV3 等管线以便生产部署。

常见问题

Q:PaddleOCR-VL 的定位是什么?

A:面向文档解析的视觉语言模型,参数约 0.9B,强调在低资源场景下的高准确度与端到端结构化输出。

Q:支持哪些类型与语言?

A:覆盖文本、表格、公式、图表与手写体,宣称支持 109 种语言与多脚本混排场景。

Q:SOTA 结论是否独立验证?

A:当前为官方在 OmniDocBench 与自建集的对比结果;若需独立复核,应关注后续第三方复测与公开复现实验。

Q:如何快速体验与部署?

A:可在 Hugging Face 使用模型卡示例或在线 Demo;GitHub 提供 CLI/Python 用法,并支持与 PP-StructureV3 等组件联动。

Q:此次发布时间与版本关系?

A:官方在 2025 年 10 月 16 日的仓库更新中宣布 3.3.0 版本并同时释出 PaddleOCR-VL 相关说明与用法。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 文心一言 AI聊天 文心一言 是百度文心大模型 AI 助手,支持百度 AI 聊天、文案创作和图像理解,适合中文用户和内容创作者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Meta AI AI聊天 Meta AI 是 Meta 的个人 AI 助手,可在网页、应用、AI 眼镜及 WhatsApp、Instagram 中使用,支持问答、图像理解和语音交流,适合社交与生活场景,部分功能受地区限制。 Pi AI AI聊天 Pi AI 是 Inflection AI 推出的个人 AI 助手,强调情绪理解、陪伴式交流、生产力建议和安全对话,可在 pi.ai 与移动端使用。它适合日常思考、学习陪练和规划,不替代专业心理支持。