腾讯云智能体开发平台非结构化文档精准解析
核心观点与能力介绍
- 文档解析原子能力:基于OCR解析大模型,支持论文、说明书、试卷、PPT等多种场景复杂版面的解析。
- 传统OCR技术局限:识别精度低、元素易丢失。
- 文档解析优势:支持PDF、PPT、EXCEL、DOCX、URL、HTML等多种文件格式,处理多种版式(双栏、单双栏混排、三栏等),识别图文、公式、段落、表格、页眉、页脚等版面元素,提取文档元信息并按阅读顺序排序。
复杂文档解析能力
- 复杂版面解析:针对图文混排、无明显边界的图形组合、易重叠错位的文档,通过定位版面元素位置、类型、顺序,识别内容并组装成Markdown格式输出,准确率提升约3x%。
- 多阶段方案:阶段①定位版面元素;阶段②识别元素内容;阶段③整合结果为Markdown。
- 多模态大模型:支持文档中的多种元素类型进行解析,效果处于行业领先地位。
场景说明与案例
- 文档阅读理解:支持版面元素类型、版面排序、文字识别、多语种识别、公式识别、表格识别等。
- 示例:图3位置识别、监控拍摄时间提取、收听目的理解。
- 文档解析优势:OCR&结构化全文识别、结构化信息提取。
- 典型案例:
- 头部大模型公司:复杂公式解析成功率提升至9x%。
- LLM大模型底座:利用腾讯云文档解析能力生成丰富结构化语料,优化预训练。
MLLM原子能力
- MLLM多模态模型:对数据图、架构图、思维导图等图片进行精调,支持图片解读。
- 文档切分大模型:业内首个语义切分大模型,采用多级文档切分方式,保障语义完整性,端到端检索准确度大幅提升。
- 切分效果:一级片段层次准确率8x%,召回率9x%;二级片段层次准确率9x%,召回率8x%。
研究结论
- 腾讯云文档解析能力在复杂版面处理、公式识别、结构化语料生成等方面表现优异,支持多场景应用,效果行业领先。
- MLLM和文档切分大模型进一步提升了文档处理和理解的语义完整性及准确率。