腾讯云文档智能试卷切题能力解析:从坐标结构到模型选型
原标题:试卷拍照识别怎么自动切题?:腾讯云文档智能试卷切题从坐标结构到模型选型-腾讯云开发者社区-腾讯云
AI 摘要
腾讯云文档智能推出试卷切题原子能力 QuestionSplitOCR,可将整页试卷按题目边界自动拆分,并输出题干、选项、答案、图形、表格五类带四角坐标的语义区域,同时直接返回切好的题目图片和 LaTeX 公式。接口提供默认模型与多模态推理模型两种选择,分别偏向结构化全面与坐标精准,并支持切边增强、弯曲矫正、PDF 解析等拍照预处理开关。该能力面向题库建设、在线答题与批改回显场景,技术底座为腾讯混元大模型与自研 OCR 的组合。
正文节选
把一摞拍好的试卷变成可检索、可组卷、可在线作答的题库,第一步不是"识别文字",而是"切题"——把整页试卷按题目边界拆成一道一道独立的题。这一步卡住了很多团队:用通用文字识别拿到的是一整页文字流,题干、选项、答案、插图混在一起,题号一断就连不上题;自己写规则切,试卷版式千变万化(单栏双栏、选择题大题混排、数学题带公式图形),规则永远追不上版式。切题的本质是版面理解,不是文字识别——这个认知想清楚了,选型就不会跑偏。本文以腾讯云文档智能的试卷切题能力(QuestionSplitOCR)为坐标,把输出结构、模型选型、拍照预处理三个工程关键点讲透。 拍照试卷进题库的标准链路是"拍照 → 切题 → 识别 → 结构化入库": 腾讯云文档智能把切题做成了独立的原子能力——试卷切题接口(Action: QuestionSplitOCR),官方定位是"将整页练习册、试卷或教辅中的题目进行自动切题,并识别出其中的文字内容和坐标位置",明确它是题库建设与在线答题的基础。和批改 Agent 不同,腾讯云的切题接口是个可以单独调用的轻量原子能力——自建批改逻辑、自建题库系统的团队,要的就是这一层。 腾讯云试卷切