腾讯云传媒行业大模型落地实践
腾讯云智能AI能力
腾讯云智能在计算机视觉、智能语音、自然语言处理、机器学习等领域取得多项技术突破,拥有全球领先的AI研究和产业落地能力,下设多个顶级人工智能实验室,共拥有5000+AI相关专利,发表顶会论文800+篇。
大模型发展历程与技术路线
大模型发展经历了模型提升的三个技术路线:Prompt、RAG(Retrieval-Augmented Generation)、FT(Fine-tuning)。Prompt通过few-shot等手段提升模型输出遵循性;RAG通过检索增强生成,快速更新知识;FT通过少量个性知识提升模型能力。
腾讯大模型最新进展
腾讯大模型在国内外评测中表现优异,混元模型在多项评测中领先。腾讯大模型立足自身,实战打磨,赋能百业,拥有强大的算法、算力和中数数据优势,丰富的应用产品是其最好的试炼场。腾讯内部已有600+业务接入混元。
腾讯大模型技术布局
腾讯大模型实现了从基础设施到模型构建的全面布局,包括:
- 生文:率先探索万亿大模型,兼顾中小模型,布局1B、3B、7B、13B等不同参数量下的Dense和MoE模型。
- 生图:混元依托升级架构,测评结果国内领先,作为业内首个中文原生DiT架构,已全面开源。
- 生视频:基于ST-DiT研发下一代生视频工具,提供视频生成、视频转译、人脸融合等产品。
- 生3D:混元在效率与质量上业内领先。
大模型在传媒行业的落地实践
腾讯云传媒行业大模型落地实践基于三大引擎降低模型应用门槛:
- 大模型知识引擎:激活企业知识,焕新生产力。
- 基于大语言模型的知识应用开发平台。
- 基于大模型的AI图像生成与编辑能力。
大模型场景应用难点
大模型在场景应用中面临三大难题:
- 知识获取:垂直场景业务知识更新快,企业知识输入篇幅长、多样化,对行业细分场景理解难度高。
- 知识处理:文档类型复杂,包含事实性知识、概念性知识、程序性知识,格式多样,排版复杂。
- 知识应用:通用大模型缺少垂直场景企业级知识的理解,基于通用大模型Finetune成本高、时效性弱。
大模型知识引擎解决方案
大模型知识引擎通过以下方式解决上述难题:
- 文档解析:基于文档元素及位置信息,进行重组和排版,准确识别图、表等关键元素,解决图文并茂、排版复杂的问题。
- 多模态技术:结合OCR大模型解析,确保阅读顺序正确,提升模型阅读理解准确率。
案例分析
- 川剧非遗文化传播与保护:通过人与大模型对话,学习川剧相关知识,利用自然语言对话检索媒资库中匹配的川剧片段。
- 某日报基于大模型构建国际传播应用:图像创作引擎已比肩全球领先水平,混元文生图模型持续优化升级。
- 央视新闻《AI测测你最适合去哪春游》:用户只需回答三个问题,文生图将根据用户的选择画出专属春游目的地。
- 阅文集团作家创作辅助图像生成:文生图和文生文功能帮助用户生成角色形象图和根据网文描写生成插图。
- 北京广播电视台破圈创意活动“我的春天,看我的”:利用大模型进行视频创作,实现视频风格化、运动笔刷、画布拓展等功能。
研究结论
腾讯云大模型在传媒行业展现出强大的应用能力,通过三大引擎降低模型应用门槛,解决知识获取、处理和应用中的难题,助力企业知识激活和生产力焕新,已在多个场景实现落地应用,效果显著。