本论文研究了神经网络如何实现元学习和组合泛化能力。元学习是指通过接触多个具有共同结构的任务来改进学习过程本身的能力,而组合泛化是指将先前获得的技能重新组合以解决新任务的能力。
论文首先回顾了元学习和组合泛化的数学基础,并详细介绍了如何将元学习形式化为分层优化问题和序列建模问题。此外,论文还定义了什么是组合任务族,并使用该定义正式陈述了组合泛化的目标。
论文的核心贡献包括:
- 对比元学习规则:提出了一种简单的精确算法,通过双层优化进行元学习。该算法只需运行学习过程两次,并通过局部元可塑性规则对比两次学习结果,即可获得元梯度。
- 发现可泛化的模块化解决方案:研究了模块化架构如何通过元学习捕获任务族的组合结构,并证明超网络在满足特定条件下可以保证组合泛化。实验结果表明,模块化但非整体的架构在教师-学生设置之外的任务中也能实现组合泛化。
- 注意力作为超网络:将 Transformer 架构的注意力机制解释为超网络,并提出多头注意力机制可以通过隐式超网络的低维潜在代码重用和重组操作。实验结果表明,Transformer 在抽象推理任务中表现出功能结构化的潜在代码,可以预测网络在未知任务组合中使用的子任务。
论文的研究结论表明,神经网络具有元学习和组合泛化能力,这为理解人类智能和创建能够加速科学进步的人工系统提供了新的视角。