核心观点
该研报提出了一个名为 SITAlign 的推理时对齐框架,旨在解决大型语言模型(LLMs)与人类偏好对齐的挑战。传统的对齐方法通常将问题视为多目标优化问题,而 SITAlign 则受到有限理性理论中满足策略的启发,认为人类决策者会优先优化关键目标,同时确保其他目标达到可接受的阈值。
关键数据
- SITAlign 在三个评估设置中进行了实验,包括帮助性与无害性、帮助性与幽默性以及摘要质量与忠诚度。
- 在 PKU-SafeRLHF 数据集上,SITAlign 在最大化帮助性的同时确保无害性阈值方面,比最先进的多目标解码策略 MOD 高出 22.3%。
- 在帮助性和幽默性的任务中,SITAlign 比 MOD 提高了幽默性的 GPT-4 胜率约 10%。
研究结论
- SITAlign 在平衡多个解码目标方面优于传统的解码策略,确保无害性的同时保持了帮助性。
- 设置一个合适的阈值,以确保生成的响应超过该值,通常比最大化目标奖励更有效。
- 满足策略原则为多方面 AI 对齐提供了一个新的方向,超越了传统多目标优化的局限性。