快意大模型及短视频场景应用
项目背景
- 时间线:2022年底,OpenAI的ChatGPT惊艳全球,预示着通往AGI的可能性。
- 模型发展:从GPT-1、GPT-2到GPT-4,再到快手的快意系列模型(快意-13B、快意-66B、快意-175B)。
模型介绍
- 快意大模型:2023年8/9月发布了13B和66B参数量的大模型,24年2月发布了175B参数量的大模型。
- 性能表现:在多项权威基准测试中,快意大模型表现优异,特别是在C-Eval、CMMLU、MMLU等评测中领先。
关键技术
- Temporal Scaling Law:通过细粒度建模,优化预训练过程中的loss预测。
- MiLeLoss:基于信息熵的加权损失优化,提升预训练效果。
- Scaffold-BPE:改进BPE算法,减少“伪高频”token,提升词表压缩率和训练效果。
- MoE路由错误自适应检测与Loss优化:优化路由模块,提升整体效果。
应用场景
- 短视频场景:快意大模型应用于短视频内容生成、推荐和理解,提升用户体验。
- 电商、直播、数字营销:增强内容理解和生成能力,提高商业化和本地生活服务的质量。
未来展望
- 多模态理解大模型:正在开发中,预计将进一步提升快手在多模态领域的竞争力。
总结
快手通过自主研发的大模型技术,不断提升其在AI领域的竞争力。特别是快意大模型在多个参数量级别的模型上表现出色,尤其是在预训练和推理过程中引入了一系列创新技术,如Temporal Scaling Law、MiLeLoss、Scaffold-BPE和MoE路由优化等,显著提升了模型的性能和应用效果。在未来,快手将继续探索多模态理解大模型的应用,进一步丰富其业务生态。