登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
行业研究
/
报告详情
评测驱动代码大模型 “码力”提升 - 王一男
信息技术
2024-07-17
2024 第23届 GOPS 全球运维大会暨 XOps 技术创新峰会 · 北京站
浮云
LLM代码能力评测方法
LLM代码能力评测数据集
评测数据集
:HumanEval、HumanEval-0-Shot、T-HumanEval(164个Python问题,每个问题包含提示语、解决方案、单元测试等)
数据来源
:外部数据(最近3个月新增Case)、开源评测数据集(占比不超过20%)、GitHub、StackOverflow等
数据制作标准
:
人工评测:模拟真实用户Chat场景,指令清晰,避免互斥指令,使用新数据(最近3个月)
自动化评测:代码补全场景使用MBPP数据集(314个用例),测试生成场景使用HumanEval数据集
LLM代码能力评测反馈闭环实践
评测方法
:
模型评测:5档评分+权重计算总分,参考标准答案,1题3人评测计算Agreement
自动化评测:
代码补全:掩盖X%行代码后逐步补全,计算Pass@1
测试生成:计算单测正确率和覆盖率,要求覆盖率达80%以上
评测结果
:
混元模型代码能力vsGPT指标从1月89.49%提升至5月97.35%,为所有评测模型中进步最快
评测驱动模型改进:Vue版本较低时增训新版Vue数据,规范训练数据格式
评测体系框架
分类
:
22种任务分类,12个高优先级场景分类
用户/产品、场景/任务、领域/框架、开发语言四个评测维度
数据集制作流程
:
11类主要任务场景,5种主流编程语言,3个月内新数据,500题滚动更新
代码生成评测集:150题,覆盖5种语言,每题5+单元测试,人工审核
代码补全评测集:MBPP数据集314个用例,自动化评测,Pass@1
评测工作当前问题与不足
用户感受反映
:如何从模型评测到产品评测,真实反映用户感受(混元助手&工蜂Copilot)
出题速度
:如何更快出题,从现网badcase/goodcase数据直接生成
未来适应
:如何适应未来产品发展(CodeAgent/AutoDev),需支持长上下文、推理、记忆、多轮,参考SWE-benchmark、RepoBench、LiveCodeBench
你可能感兴趣
阿里巴巴-黎槟华-通义灵码-基于代码大模型的智能编码助手
信息技术
2023第十二届全球TOP100软件案例研究峰会
2024-08-21
大模型赋能投研之八:拥抱MCP,Trae代码能力与赋能投研评测
国金证券
2025-04-25
王瑞雪:大模型时代,智算网络性能评测挑战
信息技术
中国移动研究院
2024-03-20
拥抱MCPTrae代码能力与赋能投研评测20250428
未知机构
2025-04-28
量化漫谈系列之十六:Cursor的更强搭档:Claude 3.7 sonnet代码生成评测
国金证券
2025-03-01
中国移动“弈衡”大模型评测体系研究及技术发展趋势洞察
中国移动技术能力评测中心
2023-11-15
弈衡:多模态大模型评测体系白皮书
信息技术
中国移动
2024-10-12
『弈衡』人工智能大模型评测平台白皮书
信息技术
中国移动研究院
2024-06-07
大模型赋能投研之十五:国产大模型编程辅助投研方案全方位评测
国金证券
2025-12-30
大模型赋能投研系列之二十九:从模型走向智能化框架,DeepSeek Harness部署教程与投研全方位评测
国金证券
2026-08-20