本报告评测了国内外主流大模型在保险领域应用的成熟度和稳定性。报告从保险业务场景中抽离出三大主要应用能力,细分为十大能力测试维度,71个评测任务。评测结果显示,百度、阿里巴巴、科大讯飞等大模型在保险常识问答、法律知识问答和医疗知识问答等基础能力上表现较好,但在业务场景应用能力上仍有待提高。此外,报告还指出,大模型在保险行业的应用仍存在一定的局限性和偏差,需要进一步研究和改进。