AI系列深度05期:模型如何学习表征并实现对齐
核心观点与机制分工
- 表征落地三机制:嵌入(工程形态)、自监督学习(规模化学习机制)、CLIP(跨模态对齐),分别解决表征的工程化表达、无标注数据中的形成以及不同模态表征的共享语义空间问题。
- 嵌入:本质是将文本、图像等对象映射为数字向量,使语义相近对象在向量空间中距离更近,是向量检索、推荐系统、RAG等应用的基础。
- 自监督学习:利用数据自身构造训练信号(如掩码预测、对比学习、下一个token预测),使模型从海量无标注数据中学习上下文、语义和结构关系,是预训练获得通用能力的关键。
- CLIP:通过图文配对的对比学习,将图像和文字对齐到同一表征空间,实现零样本识别,是多模态应用(文生图、VLM等)的基础。
关键技术详解
- 嵌入应用:检索、向量数据库、RAG等场景均基于向量空间中的近邻检索,解决语义相似度判断和知识检索问题。
- 自监督学习任务:
- 掩码预测:如BERT(文本)、MAE(图像),通过遮盖部分内容并恢复学习上下文、结构和语义。
- 对比学习:如SimCLR、JEPA,通过拉近正样本、推远负样本学习表征,无需类别标签。
- 下一个token预测:如GPT系列,根据上下文预测下一个token,学习语言表征。
- CLIP机制:通过对比学习将图文向量拉近或推远,使对应概念在向量空间中更接近,支持零样本识别和多模态泛化。
研究结论与风险提示
- 预训练核心:自监督学习是预训练的内核,通过大规模数据学习通用表征,再进行微调或指令对齐。
- 多模态基础:CLIP式图文对齐是多模态模型泛化能力的关键,影响文生图、VLM等应用的边界。
- 风险提示:
- 技术迭代不及预期
- 大模型厂商ARR增速放缓
- 云服务商资本开支不及预期
- 智能驾驶及机器人商业化落地不及预期