返回全部动态

zai-org 开源 GLM-OCR 多模态文档理解模型

原标题:zai-org/GLM-OCR

Hugging Face New and Trending Models一手来源模型发布质量 72

AI 摘要

zai-org 发布并开源了多模态 OCR 模型 GLM-OCR,基于 GLM-V 编码器-解码器架构,引入多令牌预测(MTP)损失和全任务强化学习,并集成 CogViT 视觉编码器与 GLM-0.5B 语言解码器。该模型在 OmniDocBench V1.5 上取得 94.62 分排名第一,参数量仅 0.9B,支持 vLLM、SGLang、Ollama 等部署方式,采用 MIT 许可。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

--- license: mit language: - zh - en - fr - es - ru - de - ja - ko library_name: transformers --- # GLM-OCR <div align="center"> <img src=https://raw.githubusercontent.com/zai-org/GLM-OCR/refs/heads/main/resources/logo.svg width="40%"/> </div> <p align="center"> 👋 Join our <a href="https://raw.githubusercontent.com/zai-org/GLM-OCR/refs/heads/main/resources/wechat.jpg" target="_blank">WeChat</a> and <a href="https://discord.gg/QR7SARHRxK" target="_blank">Discord</a> community <br> 📍


发布时间:2026-09-11 18:08
抓取时间:2026-09-11 18:12
来源机构:Hugging Face
阅读原文huggingface.co