背景与动机
大模型创新技术发展需要同步探索大模型评测技术,以打造丈量“高山”的尺子,不断探索大模型能力的边界。模型评测体系及开放评测平台FlagEval天秤由智源研究院牵头研制,受科技部及工信部项目支持。
幻觉定义及检测方法
幻觉定义包括事实性幻觉(生成内容与可验证现实世界事实差异)和忠实性幻觉(生成内容与用户指令或上下文不一致)。检测方法分为基于模型内部行为、基于检索、基于Prompting等。
幻觉检测工具构建
- HalluDial:全球最大对话场景的大模型幻觉检测数据集,包含14.6万样本,覆盖自发式和诱发式幻觉。
- HalluJudge:用于幻觉评估的语言模型,支持幻觉定位和解释,检测精度达到SOTA,泛化性高。
实验分析
- 大语言模型普遍存在幻觉,GPT系列幻觉率较低,部分国内开源模型表现良好,幻觉率与模型规模无明显相关性。
- 不同模型常见幻觉话题不同。
总结与展望
- 构建了HalluDial和HalluJudge,用于对话级幻觉评估。
- 大模型评测需深入理解机理、把握发展趋势,研究创新评测方法。
- 智源评估邀请各方加入,共同推动大模型评测国际标准。