背景与问题
人工智能领域的大模型(如ChatGPT)存在多个问题,包括知识滞后性、推理不一致、数值计算能力有限以及容易产生“幻象”等。这些“幻象”表现为违背事实、前后矛盾或编造事实,严重影响大模型的输出真实性和准确性,并可能通过互联网语料扩散,干扰模型训练。
幻象类型与表现
幻象可分为传统自然语言生成任务中的内在和外在幻象,以及大模型中的开放域和封闭域幻象。大模型中的事实性幻象具体表现为实体错误、关系错误、事实不完整、时效错误、过度表达和无法验证等。
幻象产生原因
幻象的产生原因包括数据集合问题(如启发式数据收集导致source与target不对应)、任务本身鼓励幻象(如开放式对话)、模型原因(如曝光偏差、参数化知识偏差、表示学习不充分、解码方式不当)以及大模型时代的训练数据规模更大、领域更广等因素。
大模型幻象出现原因
大模型幻象的出现主要受限于语句补全模式、概率生成的本质、监督微调阶段的影响(如行为克隆导致模型难以表达受限或不确定知识、拒绝错误前提)以及标注数据和模型知识对齐问题。
幻象评估
HaluEval作为大模型幻象检测能力评测基准,包含自动生成和人工标注的评测样本,涵盖问答、对话和摘要等任务。HaluEval 2.0则是一个综合评测基准,基于GPT-4的幻象检测框架,评估指标包括宏观幻象率和微观幻象率。研究发现,增加模型规模并不能减轻幻象程度,且MaHR与MiHR并非强相关。
幻象发生原因分析
幻象的发生与预训练阶段的数据规模、数据来源(领域混合)、指令微调阶段的指令数据混合(任务型、日常对话型、合成指令)、指令数据增强(复杂化、多样化、规模化、难度平衡)、提示设计(可读性、规范性、具体程度)以及解码策略(事实性vs随机性)等因素相关。日常对话型指令幻象率更低,过于复杂的指令容易产生幻象。
幻象缓解方法
缓解幻象的方法包括:
- 微调对齐阶段:基于人类反馈的强化学习(RLHF),如GPT-4 reward训练数据集构建(开放域和封闭域)。
- 推理阶段:检索增强(较小模型效果更显著)和提示改进。
总结
“幻象”是大模型研究亟待解决的重要问题。幻象检测是基础,幻象溯源是根本,幻象消除是重中之重。通过评估基准(如HaluEval和HaluEval 2.0)和缓解方法(如RLHF、检索增强和提示改进),可以有效减轻大模型的幻象问题,提升其输出质量和可靠性。