人工智能与智慧运营中心演讲概要
主题与时间
- 演讲主题:人工智能与智慧运营中心演讲
- 演讲人:宁如虎
- 日期:2023年11月09日
技术发展历程
- 2017年:谷歌推出用于处理自然语言任务的Transformer神经网络架构。
- 2018年:OpenAI发布GPT-1。
- 2022年:OpenAI推出ChatGPT-3.5。
- 2023年:
- 微软基于ChatGPT发布New Bing。
- FaceBook发布LLaMA-13B。
- 谷歌发布Bard以应对ChatGPT。
- OpenAI发布ChatGPT-4并实现图像识别。
- 国产大模型如文心一言、通义千问、盘古NLP、天工3.5、星火等陆续发布。
项目团队介绍
- 金镝:42岁,中国移动研究院人工智能与智慧运营中心副总经理,负责项目整体规划和管理。
- 朱妍:36岁,项目组产品经理,负责产品主创设计、系统交互设计、评测标准制定。
- 宁如虎:36岁,系统架构设计、功能设计与实现、项目部署角色。
- 郝梓萁:32岁,负责prompt设计、数据标准化、数据集构建、自动化评测方案调研。
- 韩雪:28岁,中共党员,参与系统设计方案研讨,担任产品测试、项目支撑角色。
评测系统愿景与目标
- 愿景:促进产业、社会可持续发展。
- 核心目标:建立科学、公平、客观、安全可信的评测体系,评估大模型能力,为人工智能产业发展提供强大动力。
面临的挑战
- 客观性:模型对Prompt指令敏感,难以区分是模型问题还是指令问题。
- 准确性:大模型评测仍属于“黑盒”测试,无法深入探知模型内部处理过程。
- 公平性:依赖大量评测数据,可能存在数据偏差问题。
- 全面性:大模型能力多样,难以找到能力边界。
九天大模型评测方案
- 设计理念:多层次-多维度-多任务-多指标-多模式。
- 评测体系:包括行业模型、业务维度、政务大模型、客服大模型、通用模型评测。
- 评测指标:任务支持度、场景支持度、性能指标(准确性、鲁棒性、安全性、高效性)。
评测基准
- 四大维度:基础评测、专项评测、领域评测、体验评测。
- 四大类指标:准确性、鲁棒性、安全性、高效性。
- 评测任务:400+任务,600+场景。
- 数据集:海量开源数据集与自建数据集。
评测流程与系统特色
- 流程:简单化、标准化、多样化、自动化、可视化。
- 系统特色:涵盖基础评测、专项评测、领域评测、体验评测,支持多种评测场景与指标。
未来展望
- 多模态评测:持续构建数据动态评测。
- 安全风险评测:增加公众信任,推动技术革新。
- 行业规范与标准:加强产学合作,评估方法和工具完善,促进产业升级。
此演讲内容展示了人工智能领域的技术发展、项目团队构成、大模型评测系统的设计理念与挑战,以及对未来发展的展望,强调了技术进步与社会责任的重要性。