返回全部动态

NaviDC-OCR:轻量级文档解析模型,统一数字与拍摄文档

原标题:StarDoc-AI/NaviDC-OCR

Hugging Face New and Trending Models一手来源模型发布质量 86

AI 摘要

StarDoc-AI 发布了 NaviDC-OCR,一个约 1.2B 参数的开源视觉语言模型,专为文档解析设计,统一处理数字和相机拍摄文档。该模型引入了多节点共识投票、几何感知建模、曲率引导采样等技术,在 OmniDocBench 和 Wild_OmniDocBench 基准上达到最先进性能,且无需去畸变预处理。模型采用 Apache-2.0 许可证,支持中英日文。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

--- license: apache-2.0 language: - zh - en - ja library_name: transformers pipeline_tag: image-text-to-text tags: - document-parsing - ocr - document-understanding - vision-language - multimodal --- <div align="center"> <h1 align="center"> NaviDC-OCR: Navigating Document Parsing Across Digital and Camera-Captured Documents </h1> [![License](https://img.shields.io/badge/License-Apache--2.0-blue.svg)](LICENSE) [![GitHub](https://img.shields.io/badge/GitHub-Repository-black?logo


发布时间:2026-08-30 15:20
抓取时间:2026-08-30 15:07
来源机构:Hugging Face
阅读原文huggingface.co