登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
行业研究
/
报告详情
金融大模型应用评测报告-摘要版(2024)
信息技术
2024-12-01
-
上海人工智能实验室
等待花开
金融大模型应用评测报告摘要版(2024)
一、评测范式
评测对象
:涵盖国内外、开闭源、通用与金融垂直领域的大模型,共20个模型,涉及14个机构。
评测维度
:围绕金融核心业务需求,分为“模型基础能力”、“金融安全与价值对齐能力”、“金融风险控制能力”、“金融专业认知能力”和“金融业务辅助拓展能力”五大维度。
评测数据集
:采用《库帕思金融大模型评测数据集(2024版)》,包含通用数据、金融安全、金融风险、金融专业认知和金融业务辅助拓展五部分。
评测工具
:基于上海人工智能实验室的OpenCompass平台,支持多种评估方法,包括零样本、少样本和思维链评估。
综合评估分数
:采用线性加权模型,对五大维度进行标准化处理后加权平均计算,其中多模态模型在总分中不计入权重。
二、评测结果
总分表现
:参评模型平均得分为71.9分,前三名分别为Anthropic的Claude-3.5-Sonnet-20240620(79.8分)、阶跃星辰/财跃星辰的Step-2-16k/Finstep(79.7分)和阿里巴巴的Qwen2.5-72b-Instruct/Qwen2-VL-72B(77.6分)。
维度表现
:
模型基础能力
:平均59.8分,前三名分别为阿里巴巴的Qwen2.5-72B-Instruct(70.3分)、Anthropic的Claude-3.5-Sonnet-20240620(68.9分)和阶跃星辰/财跃星辰的Step-2-16k(65.7分)。
金融安全与价值对齐能力
:平均92.8分,前三名分别为阶跃星辰/财跃星辰的Step-2-16k(98.8分)、智谱的GLM-4-plus(96.3分)和阿里巴巴的Qwen2.5-72B-Instruct(95.9分)。
金融风险控制能力
:平均77.1分,前三名分别为Anthropic的Claude-3.5-Sonnet-20240620(84.1分)、阶跃星辰/财跃星辰的Step-2-16k(83.3分)和零一万物的Yi-Lightning(79.6分)。
金融专业认知能力
:平均52.0分,前三名分别为腾讯的Hunyuan-Turbo/Hunyuan-Vision(71.5分)、字节跳动的Doubao-pro-32k/Doubao-vision-pro-32k(70.0分)和阶跃星辰/财跃星辰的Step-2-16k/Finstep(69.8分)。
金融业务辅助拓展能力
:平均77.8分,前三名分别为Anthropic的Claude-3.5-Sonnet-20240620(85.0分)、OpenAI的GPT-4o-20240806(83.6分)和零一万物的Yi-Lightning(83.3分)。
三、评测总结
核心观点
:各模型整体表现基本满足当前场景需求,但金融专业认知和多模态处理能力仍需提升。金融安全与价值对齐表现优异,但需持续迭代安全评测方法和数据集。
关键数据
:参评模型平均得分为71.9分,金融安全与价值对齐能力平均得分最高(92.8分),金融专业认知能力平均得分最低(52.0分)。
研究结论
:
高质量金融语料建设对模型能力提升至关重要,尤其是多模态数据集的构建。
拓展以金融业务为核心的评测框架,保持其动态更新,将助力行业高质量发展。
说明
:评测范围限定于《金融大模型应用评测指南》团标所构建的数据集,测试内容针对原始大模型的直接调用功能,不构成完整产品体验建议。
你可能感兴趣
金融大模型应用评测报告:摘要版
金融
上海人工智能实验室&上海财经大学&上海库帕恩科技有限公司
2024-12-01
保险行业应用评测报告:人工智能大模型
金融
元保&分子实验室
2023-10-31
2023年中国消费行业供应链金融应用报告(摘要版)
金融
头豹研究院
2023-12-18
2024营销大模型评测白皮书
信息技术
-
2024-09-17
《通用大模型评测标准》公布,月之暗面发布Kimi探索版
文化传媒
西南证券
2024-10-13
2022年中国人工智能在金融行业的应用洞察:智能风控(摘要版)
信息技术
头豹研究院
2022-08-24
大模型赋能投研系列之三十:GLM-5.3与GLM-5.3-Flash金融投研能力评测
国金证券
2026-08-28
大模型赋能投研系列之二十八:DeepSeek V4 Pro金融投研能力评测
国金证券
2026-08-16
2024北京市人工智能大模型行业应用分析报告
信息技术
北京市科学技术委员会
2024-05-07
2024大模型应用实践报告:战略一致性,企业成功落地大模型的隐藏秘钥
信息技术
爱分析
2024-05-09