2024年AI大模型技术快速演进,发展方向逐步向应用落地方向倾斜,降低端侧模型部署门槛,缩短模型推理时延,提升模型交互能力。主要变化体现在以下领域:
一、语言大模型领域:后训练阶段规模定律显现,以强化学习优化内部思维链策略或成大模型发展新范式。OpenAI的o1推理大模型通过强化学习优化思维链推理逻辑,显著提升复杂逻辑推理能力,超越人类专家和GPT-4o。斯坦福团队的Q-STaR语言模型也利用强化学习优化中间图例过程,实现并行原理生产、混合原理预测、优化原理生成的能力,零样本测试准确率大幅提升。
二、多模态大模型领域:主流模型架构从跨模态向端到端演进,提高决策准确性的同时提升模型灵敏度,以满足无人驾驶、人形机器人应用场景下的需求。GPT-4o、Gemini等多模态大模型采用端到端架构,简化输入接口,减少模态间信息损失,提升响应时间。英伟达的GR00T人形机器人项目和特斯拉的FSD Beta V12无人驾驶系统均基于端到端架构,大幅提升任务处理精度、高效性和灵活性。
三、视频生成领域:DiTs核心架构的可拓展性优势显现,基于数据处理、视频标注、音频模型的微创新推动视频生成应用更加平价高效,为AI应用带来更大商业化空间。OpenAI的Sora和Meta的Movie Gen视频生成模型均基于DiTs架构,通过数据处理、视频标注和音频模型创新,提升视频生成效果。国内公司如Vidu、PixVerse、可灵等已面向C端采用订阅模式收费,年费标准版会员4-5s视频生成价格折合为0.025-0.1美元左右。
四、硬件部署实践方面:在端云结合架构下,模型压缩、安全控制、闪存运行以及推理优化降低大模型硬件部署门槛,为AI+硬件赋能筑基。苹果的Apple Intelligence采用端云结合方案,通过量化压缩、LoRA适配器、Responsible AI原则、LLM-in-a-flash技术和LazyLLM预填充动态剪枝技术,保障模型安全可控,提升端侧运行流畅度,大幅降低模型推理时延。
五、智能体实践方面:以面向UI交互与操作的垂类大模型核心,结合用户意图理解及应用逻辑推演,开始在Android、Windows等智能终端环境应用。Adept的Fuyu-8B和Fuyu-Heavy多模态模型,以及苹果的Ferret-UI多模态大模型,均具备UI界面理解和数字推理任务领域更好的表现能力,更适应智能体在智能终端复杂UI环境场景下落地应用。
六、大模型合成数据策略方面:以自我奖励语言模型生成合成数据,打破Scaling Law“数据墙”瓶颈。Meta发布的Llama 3.1 405B完全基于合成数据方式训练,使用自我奖励语言模型进行训练,在多项任务中与GPT-4、GPT-4o和Claude 3.5 Sonnet相媲美,总体表现优于GPT-4o和Claude3.5 Sonnet。