返回全部动态
zai-org 开源 GLM-OCR 多模态文档理解模型
原标题:zai-org/GLM-OCR
AI 摘要
zai-org 发布并开源了多模态 OCR 模型 GLM-OCR,基于 GLM-V 编码器-解码器架构,引入多令牌预测(MTP)损失和全任务强化学习,并集成 CogViT 视觉编码器与 GLM-0.5B 语言解码器。该模型在 OmniDocBench V1.5 上取得 94.62 分排名第一,参数量仅 0.9B,支持 vLLM、SGLang、Ollama 等部署方式,采用 MIT 许可。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
--- license: mit language: - zh - en - fr - es - ru - de - ja - ko library_name: transformers --- # GLM-OCR <div align="center"> <img src=https://raw.githubusercontent.com/zai-org/GLM-OCR/refs/heads/main/resources/logo.svg width="40%"/> </div> <p align="center"> 👋 Join our <a href="https://raw.githubusercontent.com/zai-org/GLM-OCR/refs/heads/main/resources/wechat.jpg" target="_blank">WeChat</a> and <a href="https://discord.gg/QR7SARHRxK" target="_blank">Discord</a> community <br> 📍
发布时间:2026-09-11 18:08
抓取时间:2026-09-11 18:12
来源机构:Hugging Face