大模型行业能力评测总结
评测方法与结果
- 评测范围:16个大模型参与评测,涵盖报告撰写、行业研究和理解能力。
- 评测方法:采用人评和机评双盲模式,确保公平性。
- 评测内容:包括报告撰写能力(信息检索层和逻辑推理层)、行业研究基础能力、行业基础理解能力。
- 综合结果:商汤、腾讯会员、通义千问等模型表现突出,位于前列。
报告撰写能力
- 测评模块:定义分类、发展历程、政策分析等八个模块。
- 信息检索层:考察互联网信息检索能力,平均分9.17分。
- 逻辑推理层:考察综合分析和逻辑推断能力,平均分8.69分。
- 综合表现:商汤日新、阿里通义千问、灵异万物表现优异。
逻辑推理与信息检索
- 逻辑推理层:商汤、通义千问、360智能表现突出,展现高阶知识能力。
- 信息检索层:360智脑、通义千问、百川智能表现突出,尤其在产业链分析和市场规模预测方面。
商汤模型表现
- 行业研报撰写:商汤在竞争格局和行业技术能力方面表现卓越,日新、360等模型紧随其后。
- 文本生成能力:商汤V5.5版本在生成长文本时展现强大能力,速度和质量均保持高水平。
- 综合能力:商汤在逻辑推理、意图理解和长文本知识储备方面表现优异。
行业能力评测
- 评测范围:17个行业的10款大模型。
- 行业表现差异:各模型在不同行业中的表现存在显著差异。
- 讯飞在教育行业表现优异。
- 星火在电信与娱乐行业表现优异。
- 商汤在房地产和泛娱乐电商行业表现良好。
- 文心一言在泛娱乐和旅游业表现优秀。
- 通义和豆包在多个行业上表现均衡。
- 行业关联性:模型擅长的行业与其公司背景的行业关联性明显。
关键数据
- 信息检索层平均分:9.17分。
- 逻辑推理层平均分:8.69分。
- 评测模型数量:16个大模型,覆盖17个行业。
研究结论
- 大模型在报告撰写、逻辑推理和信息检索能力上表现各异,商汤、通义千问等模型综合能力突出。
- 不同模型在不同行业中的适应性存在显著差异,与公司背景行业关联性较高。
- 大模型在提升分析师工作效率和文本产出质量方面具有重要作用。