工业级多模态文档智能:PaddleOCR 推出超小型 Vision-Language 模型 PaddleOCR-VL
AI资讯 2025 年 10 月 16 日,PaddleOCR 公布多模态文档解析模型 PaddleOCR-VL(核心模型 0.9B)。该方案采用 NaViT 风格动态分辨率视觉编码器,结合 ERNIE-4.5-0.3B 轻量语言模型,主打在低算力条件下实现文本、表格、公式、图表与手写体的统一识别与结构化输出。官方称在 OmniDocBench 等公开基准与自建集合上达到或刷新多项指标表现。 模型覆盖 10...
AI导航 • • 123 次阅读