传统OCR深度学习模型与OCR大模型进行对比,OCR大模型展现出更广泛的应用场景和更强的性能。OCR大模型的特点包括适用场景多样,涵盖票据识别、表格识别、文档识别和自然场景识别。腾讯云OCR大模型家族主要包括DocLM、DocQA和MLLM三个模型。
DocLM是端到端文档图像理解模型,具有图像到文字直接生成、单模型支持多任务、效果更优和场景泛化能力等特点,且数据与推理成本低。DocLM核心技术包括结构化理解、内容感知和多任务融合。DocLM模型效果在结构化指标、自然场景支持和任务泛化方面表现优异。
DocQA是阅读理解问答模型,同步提升结构化和阅读理解任务能力,并支持基于检索的知识库问答。DocQA核心技术包括知识检索和阅读理解融合。DocQA模型效果在封闭式问答和文本摘要能力上表现突出。
MLLM是多模态大模型,从支持自然场景扩展至文档场景,并在结构化任务上表现优异。MLLM核心技术包括多模态融合和外部知识生成。MLLM模型效果在归纳、理解和基于外部知识生成能力上表现优异。
TI-OCR支持OCR大模型精调,提供精调所需资源。典型案例展示了OCR大模型在实际应用中的效果。