返回全部动态
NaviDC-OCR:轻量级文档解析模型,统一数字与拍摄文档
原标题:StarDoc-AI/NaviDC-OCR
AI 摘要
StarDoc-AI 发布了 NaviDC-OCR,一个约 1.2B 参数的开源视觉语言模型,专为文档解析设计,统一处理数字和相机拍摄文档。该模型引入了多节点共识投票、几何感知建模、曲率引导采样等技术,在 OmniDocBench 和 Wild_OmniDocBench 基准上达到最先进性能,且无需去畸变预处理。模型采用 Apache-2.0 许可证,支持中英日文。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
--- license: apache-2.0 language: - zh - en - ja library_name: transformers pipeline_tag: image-text-to-text tags: - document-parsing - ocr - document-understanding - vision-language - multimodal --- <div align="center"> <h1 align="center"> NaviDC-OCR: Navigating Document Parsing Across Digital and Camera-Captured Documents </h1> [](LICENSE) [![GitHub](https://img.shields.io/badge/GitHub-Repository-black?logo
发布时间:2026-08-30 15:20
抓取时间:2026-08-30 15:07
来源机构:Hugging Face