一、AI总结内容 一、核心技术与产业现状 1. 多模态与全模态定义:多模态为处理2种及以上信息(文本、图像、视频等),全模态是多模态升级版,侧重输入输出全链路交互,模型架构、训练范式、商业模式均有差异。 2. AI视频技术路线演变:2021年图文对齐(Clip、Line模型);2021-2022年图像生成(Stable Diffusion等);2022-2023年视觉语言理解(Qwen-VL等);2023-2025年视频生成爆发(Runway、Pika、谷歌View、字节C-dance1.0等);当前进入原生多模态与全模态交互阶段。 3. 技术迭代核心变化:从外挂视觉模块到原生多模态融合、从离线处理到实时交互、从专用任务模型到通用模型。 4. 主流模型格局:2025年6月全球图文视频榜单中,国内模型如C-dance2.0、华为Pika排名快速提升,海外仍有谷歌XAI等头部玩家,行业迭代快、分化明显,无绝对技术垄断,性价比成竞争关键。 二、重点标的与产品解析 1. MiniMax海诺H3:2025年8月发布的通用全模态生成模型,开源至HuggingFace,具备原生2K分辨率、24fps、4-15秒生成能力,支持12参考素材(9图3视3音),打破任务与模态边界,核心技术含全模态上下文表示、高压缩率VAE、异构训练Transformer、上下文重生成,2K视频生成成本低于行业1/3,性价比优势显著。 2. 字节C-dance2.5:实现时长、参考容量、数据闭环三维扩展,支持30秒视频、50个多模态参考,依托抖音、剪映高频创作场景迭代,对算力、内存提出更高要求,或形成新壁垒。三、行业需求与商业化潜力 1. AI视频用户端:分为C端(个人创作)、P端(专业自媒体)、B端(影视、游戏、广告),C/P端市场规模有限,B端空间广阔,全球影视内容制作规模超2000亿美元,若AI渗透率达20%-30%,对应空间约400-600亿美元。 2. AI短剧落地最快:2025年中国微短剧市场规模破1000亿,2026年预计达1200亿以上,是当前AI变现最成熟方向;AI真人短剧制作成本为传统真人短剧1/4,用户付费意愿强,市场空间更大,依赖技术迭代。 3. 产业链价值:AI降低内容生成门槛,提升整体内容下限,价值向上下游聚集,头部内容仍依赖人力,产业链涉及IP运营、算力、分发、版权等环节。四、投资启示 1. 技术领先无绝对优势,数据成为差异化来源,大厂依托自有场景迭代更精准(如字节依托抖音、快手依托可灵电商短剧场景)。 2. 商业化落地比技术排名更重要,AI短剧、AI真人短剧等变现路径清晰。 3. 关注方向:优质IP运营公司(如阅文、中文在线)、算力基础设施、分发剪辑工具、头部视频平台(抖音、Tiktok、快手等)。五、风险与关注 1. AI视频生成成本虽下降,但仍高于大模型,需持续优化推理效率。 2. 行业格局未完全稳定,技术迭代快,竞争激烈,需跟踪后续模型迭代与商业化落地情况。3. AI幻觉、一致性等技术问题虽缓解,仍可能影响内容质量与商业化落地。 二、音频原文(转写) 大家好,欢迎参加申万传媒多模态和ai短剧月季消费出海和ai产业链12奖。目前所有参会者均处于静音状态下面开始播报声明。请参会人员务必注意本次电话会议交流内容,仅限参会人员内部参考任何机构或个人不得以任何形式对电话会议任何内容进行泄露或外发。请勿以任何方式索要泄露散布转发电话会议纪要任何泄露电话会议纪要等。 信息的行为均为侵权行为申万红岩研究保留追究泄露转发者法律责任的权利。各位领导大家晚上好,我是申万传媒的分析师孟妮。那今天我们主要讨论就是ai板块,这2年相对来说最热的也是呃,大家可能有的时候呃比较容易混淆的一个概念啊,就是多模态。那么在讲整个模型路线之前,我们先去把这个多模态和全模态的一个边界。 啊,给划清楚那什么是多模态啊?简单说就是能够处理两种及以上信息的这种呃ai那就是多模态模型,比如说像是文本图像语音视频啊,然后表格文档传感器数据,那这些都算在内它的一些典型能力包括呃看图问答图文检索呃文档理解,还有像视频分析,呃语音对话还有这个图像生成啊,所以呃,这些都是这个比较典型的多模态能力啊,然后最近被反复提到的一个词全模态。呃,其实它是一个可以理解为多模态的升级版,因为多模态,它强调的是能理解多种输入,那么全模态更多的是进一步去强调多种输出。 呃,这个多种输入多种输出实时交互,所以这个背后可能是模型架构,然后包括训练范式和商业模式上都有一些比较。的差别,那如果按照这个技术路线的变更梳理的话,那可能大概分为几个阶段啊,最早是21年的时候是基于这个图文理解,比如说clip还有line模型啊,以他们为代表打开的这个图文对齐的一个赛道啊,那那个时候它主要应用于图片搜索,呃内容审核还有电商检索那21年到22年呢,这个是图像生成的大年啊,那当时大家可能也有印一些印象,比如说像是这个stable diffusion啊majory啊,那么他们在这个22年推动了这个呃扩散模型工具的普及,那当时也主要用于比如设计行业,还有广告呃广告和电商素材。 嗯,第三个阶段就是这个视觉语言理解。嗯,22年到二三年左右这个发明狗,他提出了视觉语言少样本学习啊,比如说像千问vr,还有这个v two这个模型,它主要是在223年的时候啊,他们去做了很多关于这个视觉语言助手发展的这样的一些工作,呃主要当时应该是用于一些。看图问答文档智能拍照解题啊搜题这样的一些方向,那二三到25年呢,大家就能看到视频生成的工具,有一个很明显的爆发。 呃呃占那个呃ranwe,那个产品在二三年当时是比较火嘛,它主要做的就是文本文本视频的一个工具化。然后包括像是这个openai早期它推出的这个sara啊,然后可灵的可灵啊,快手的可灵,还有谷歌的view啊,包括微度模型,那么就集中在24年的时候出现。呃c dance1.0是在25年的时候啊,那它提提高了整个这个视频的一个生成质量。那么到这个时候呢,它其实已经可以用于短视频广告电商,还有这个影视内容生产。 嗯,再往下发展的话就是我们现在这个原生多模态和全模态了。那二也是在二三年25年左右的这样的一个时间内,那gpt4v包括jimmina,嗯,他们是当时二三年的一个。原生多模态的一个代表,那clo ud3那个系列还有千问后续那个vl系列,嗯,他们可能在这个文档的还有图表,还有这个长视频的理解能力上做了一些优化。那刚刚发布的这个mix海螺啊嗯,它它这个h3是把它这个可以它,它的这个宣传是把呃全模态从理解侧推到了生成侧就是一个模型,它可以同时生成音画啊,这个我们放到下一页去展开啊,然后再往下的话就是全模态交互,那主要的模型就是g p嗯,它是这个文这个语音视觉和文本的交互啊,然后多模态agent的话就是嗯,结合一些工具调用啊,然后包括企业系统浏览器,还有这个办公软件客服系统,那它主要强调的是在这个工作流里面能够实时完成任务。 再往后就是具身智能啊,那具身智能,它的这个呃就包括vla然后机器人的基础模型,还有多模态机器人控制模型等等,那它的目标就是从理解世界能够走向操作世界啊。所以在过去技术路线上的变化呢?可能比较三个三个比较明显的变话我总结一下,一个是从这个外挂的一个视觉模块到原生多模态的融合,再到统一的生成,那早期可能是文本模型去外挂视觉模块啊,原生多模态阶段的话就是文本图像视频在训练初期进到同一个建模的过程里面,然后把它们都变成token进行训练。 那么到现在这一代,可能更多的是?它打破了理解和生成的边界,就一个模型,它可以读多模态的上下文,并且直接产出硬化一体的成品啊,这是第一个比较明显的变化,那第二个就是从离线到实时啊,从以gp.T这个4o为代表,那么它主要是可以实现实时语音视觉文本的一个并行处理啊,这对工业化落地来讲比较。比较重要啊,第三点就是从这个专用的任务模型到通用的任务模型。呃之前的这个视频管线是呃文本视频,它有一个模型,然后口型有一个模型或者配音,再有一个模型等等,那现在大家都被折叠到这样一个全模态模型里面所以这个是训练范式的一个比较大的变革,那么对应着应用范式也会发生很大的一个变化啊,我们到下一页,那么这个呃现在的上市公司里面啊,主要就是做全模态的,就是这个mini max啊,那它也推出了海诺h3在8月份去上的,嗯,都全模态对于mini max来讲一直是它一个非常重要的一个战略啊嗯,那这个7月份发的这个h3也是业界首个通用全模态的生成模型,那8月3号也做了开源。 呃,历史上我们刚刚提到就是多模态,其实有几种典型的做法,呃,一个是这个后街视觉模块,那么就是文本大语言模型的这个外挂一个视觉的encoder加1个projector啊,那它的好处是它迭代非常快,但是呃,它的问题就是在于呃跨模态融合发生在输出层面,所以它在复杂推理上它的能力是受限的,容易发生这个信息损失啊,然后还有一种做法,就是这个图文图文对齐,增强它是靠这个captionqa还有ocr数据的微调,呃,那这个问题就是它容易退化为看图回答它不是一个一体化的模型啊,然后原生多模态的话,早期啊,大家的主流做法是混合文本,图像视频跨模态语义发生,在这个版本做融合。 然后呃,这这个训练在表征层面,那这是呃语言模型它走的路那h3的话,它可能更进一步的能够能够去打破这样的一个任务。边界h3模型,它不再去区分文声图啊,图声视频主体参考动作,参考音色,参考这些专家模型,而是它,它强调能够把这个把所有的这些东西统一进一个模型里面去进行。预训练用自然语言去描述任务关系啊,所以h3的这个核心变化,用这个官方的语言去讲啊,叫做打破任务和模态的边界啊,它主要是四项技技术在后面,一个是这个上下文全模态的表示,所以传统的caption,它只能描述目标视频。 H3的caption还要描述这个上下文和目标视频之间的关系啊,甚至说上下文这个内部元素之间的这些关系mini max,它定制了一个专门的这种全模态理解管线那么大部分素材呃,这个呃,大部分素材消耗这个大概呃100k的token推理压缩成平均大概4k的token去进行描述,那么语言在这里是可以泛化可以stay scaling的一种任务连接器啊,这是它指列指令理解能力的一个来源。 那第二就是这个h3的这个v a e嗯,它跟原来的这种呃分子器就是token neither是不一样的,它相相对来说比较高的这个压缩率,它带来了比较长的一个序列的一个长度收益,能够相对比较好的去降低它训练和理解的一个成本啊。所以它这个默认输出的分辨率非常高,就是大概能做到。2k左右啊,第三个就是h3的这个transformer呃,这里面就其实min max,他是放弃了原来一个有显著架构优势的,就是海螺二的架构啊,就他认为可能跟他任务泛化的这个能力是相对冲突的新架构,采用的是理解和生成的异构训练。 那么根据官方的这个pr,它端到端的提升接近了30%的训练,存储好第四个就是这个intext generation啊regeneration嗯2k的输出一般是不走常规的专用这个超分模块的呃h3的基膜,它是对自己的这个低分辨率结果做了in context的这个重新生成能够去靠这个能够还原这种传统的超分,靠猜补不回来的这种比较小的一些细节。啊,所以技术上它是跟原来还是有一个比较明显的升级那么落到功能层面上。 呃h3可能就是主要升级的是几个能力啊,一个是说我们我们先看参数吧,就参数上的话,一个是呃,分辨率就是原生2k就是200呃2560乘以那个1440。啊,然后就是24 sps,然后生成四到15秒,可以延伸到30啊,然后最后就是可以上传上传12个参考九图三个视频三个音频啊,这个是参数上的一个提升,然后能力上的话啊,第一个音话同出音话,同出的话可能大部分也已经都能做到了,然后第二个就是全能参考。 嗯,那么嗯,他这个他在一条这个与与这个prompt里面,他可以参考啊视频图片,那这也是现在主流模型,比如说像可以去实现的,就是能够跨镜头去锁定角角色的一个一致性啊,去比较好的解决这