您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [未知机构]:视频类垂类模型为何下游空间≠“影视” - 发现报告

视频类垂类模型为何下游空间≠“影视”

2026-08-15 - 未知机构 周剑
报告封面

视频模型:从影视工具向动态世界数字基础设施的范式转移 摘要 ●视频模型本质是动态世界的数字生产基础设施,其核心价值在于模拟与预测,而非局限于影视制作,影视仅占其潜在应用范畴的约1/6。●大模型全模态技术预计2026年底成熟,2027年年中将成为AI应用商业化变现的考核节点,届时财务报表需兑现真实的消费端收入。●视频模型演进路径:画面生成->连续视频->交互场景->行动预测->现实执行,终极目标是在现实世界中实现正反馈执行。·下游应用覆盖六大领域:内容娱乐、营销交易、企业生产、高精度专业领域、交互模拟(如Vision Pro生态)、机器训练(自动驾驶/具身智能)。●机器训练是AIGC视频内容的需求大户,合成数据将替代高成本真人实拍,成为自动驾驶和机器人训练的主流生产资料。●投资标的筛选:优先关注深耕行业、具备稳固盈利模式的成熟企业,以及具备极强重运营能力和变现压力的初创型/上市子公司。 Q&A 为什么视频类垂直模型的下游应用空间不应等同于影视行业? 视频类垂直模型的下游应用空间不等于影视行业,主要基于以下两点核心认知:首先,影视内容仅属于AIGC(人工智能生成内容)三层内容体系中的第一层,即“表达型内容”。AIGC生成的内容还包括“生产型内容”和“决策型内容”。例如,研究报告这类由文字和表格构成的内容,其本质是辅助研究与投资决策,属于生产与决策环节。因此,视频模型生成的内容,除了表达型之外,同样可以应用于生产和决策领域。其次,视频模型生产的本质并非影视内容,而是对动态世界的一种数字表征。它通过模拟和理解时间、运动、空间、因果等物理规则,生成动态世界的数字化表达。这种能力使其成为一个数字生产的基础设施。表面上看,视频模型是用于制作广告片、短剧、动画、特效的降本增效工具,但其深层价值在于模拟并最终预测世界的变化。无论是表达型内容(如影响思想认知的电影)、生产型内容还是决策型内容,其最终都服务于模拟与预测。因此,将视频模型理解为动态世界的数字生产基础设施,才能准确把握其远超影视行业的应 用潜力。 在当前AI技术发展阶段,应如何看待AI应用,特别是AIGC应用的爆发节点和商业化进程? 当前讨论的AI应用,其技术路径默认指大模型。我们判断,大模型的技术路径基本将在2026年年底全模态技术突破后更新到位。技术路径的成熟意味着时间窗口将转向业务应用和商业变现。具体而言,技术更新到位后,所有项目和业务的边界最多有半年时间进行探索,此后唯一的衡量指标将是真实的业务推进、应用落地以及在消费端产生收入。基于此判断,预计到2027年年中,所有公司必须明确其AI业务的具体规划、重构方式以及创收模式。2027年的财务报告将是检验各上市公司AI业务新收入成果的关键节点。届时,需要看到具体的成功案例和最终兑现的消费端收入。 基于对AI应用商业化进程的判断,哪类上市公司更有可能在这一轮浪潮中脱颖而出? 有两类上市公司具备更强的潜力。第一类是经验丰富的成熟企业。这些公司的领导者在特定行业深耕二三十年,对行业有深刻的理解,并已形成稳固的盈利模式和利润率壁垒。这类公司在使用AI时,虽然速度可能不快,但凭借其深厚的行业知识,能够将AI技术稳健地应用于实际业务,并逐步见到成效。第二类是近年来新成立的创业型公司,特别是上市公司的子公司或孙公司。由于近两年的宏观环境对初创企业要求严苛,这些公司从成立之初就必须直面变现压力,并具备极强的重运营能力,因此其业务模式和团队素质非常扎实。相比之下,在互联网及移动互联网时代,依靠红利迅速崛起的公司可能存在运营能力偏弱的短板,这在当前强调落地和变现的AI应用阶段或将成为其核心挑战。 市场为何倾向于将视频模型等同于影视行业?其背后是否存在更深层次的原因? 市场倾向于将视频模型等同于影视行业,存在浅层与深层两方面原因。浅层原因在于,目前发展较快的视频模型应用确实集中在影视相关领域,如动画短剧和真人短剧,其产出的Demo具有强烈的视觉冲击力且易于传播。例如,过去需要耗费上千万元进行渲染的一分半钟特效,现在可以瞬间生成,这使得模型之间的能力易于进行横向比较。深层原因则在于影视行业自身的发展状况。在过去的PC和移动互联网时代,影视行业发展相对滞后,未能形成稳固的行业格局和强大的壁垒。正因如此,当AIGC这一新生产力出现时,该行业更容易受到冲击和重塑。相比之下,游戏行业在历经主机、端游、页游至手游的演进过程中发展良好,格局稳固,因此在AIGC诞生初期难以被颠覆。影视行业的相对弱势,反而为AIGC的快速渗透和迭代创造了条件,使得其应用效果显得尤为显著。 视频模型的应用潜力是否似限于影视领域?其更广阔的应用边界体现在哪些方面? 视频模型的应用潜力远不止干影视领域,将二者等同实际上限制了对其更大边界的认知。影视内容仅是人类表达型内容的一部分,而视频模型的应用范畴可扩展至六大板块:人类的表达型、生产型、决策型内容,以及AI的表达型、生产型、决策型内容。从这个框架看,影视仅占其中约六分之一。未来,影视甚至可能与游戏融合,演变为大型真人交互式沉浸内容形态,其占比会更小。视频本身也是一种工业和机器数据,其产出内容不仅可以供人消费,也可以作为AI理解世界的表达型、生产型和决策型资料。未来,视频模型产出的大部分内容可能并非面向人类观众,而是服务于AI系统,用于生成环境与行动模拟。因此,视频正从单纯的消费内容,逐渐转变为生产资料和行动语言。 AiGC技术如何通过降低成本来重塑视频内容的创作与创新? AIGC技术的核心影响在于其极大地降低了视频内容的生产成本,这与历史上照相机发明对绘画和图片领域的降本作用相似。视频内容相较于静态图片,增加了时间流、运动方向、行为以及持续交互的状态变化等维度,能够更完整地讲述包含时间、地点、人物、起因、经过和结果的故事。当前许多短视频的流行,正是利用了视频媒介在表达夸张反转、系列化叙事等方面的优势。成大的降低催生了大量内容创意和新的创作范式。例妇,通过为视频模型设定一个首帧和尾帧.模型能够自动生成中间的故事情节。一个具休的例子是,给定“学习”的首帧和“考取满分”的尾帧,模型可以创作出多样的故事,在补交媒体上,已出现用户基于固定素材(如筷子兄弟的《逍遥仙》)进行二次创作并形成多个版本的现象,这展示了AIGC在催生新业务模式、变现模式和社交模式方面的巨大潜力。尽管这些模式在实现稳定营收前仍在不断探索,但AIGC无疑为短视频和长视频领域的创新注入了巨大活力。 从技术能力路径和下游应用场景来看,视频模型的发展和应用可以划分为哪些层次? 视频模型的技术能力演进路径可分为五个层次:画面生成、连续视频、交互场景、行动预测和现实执行。世界模型的终极目标是在现实世界中实现有效且能产生正反馈的执行能力。基于此,视频模型的下游应用可按照动态世界的数字化程度进行划分,远超内容娱乐的范畴。具体可分为六大领域: 1.内容娱乐:包括影视、短剧、动画、游戏、CG、短视频和AR社交等。2.营销交易:涵盖广告、电商、本地生活、商品展示和数字人营销。目前,部分新闻播报己采用数字人播音员。3.企业生产:应用于员工培训课程、产品操作说明视频(替代传统说明书)、设计评审过程中的Demo生成以及工程领域的矢量化沟通。4.高精度专业领域:涉及金融、医疗、教学、税务、会计等要求精准无误的场景。 5.交互模拟:包括游戏世界构建、教育模拟、应急演练和数字孪生。例如,AppleVision Pro等设备的内容短板,正可以由AIGC低成本、大规模地生成动态模型和交互内容来弥补。预计随着AIGC内容生产力的成熟,AR眼镜等设备生态将迎来发展。 6.机器训练:为自动驾驶、机器人、工业视觉和具身智能提供合成数据。目前,虽然特斯拉等公司仍采用真人实拍视频进行训练,但这种方式成本高且场景单一,未来大规模采用合成数据进行模型训练是必然趋势,关键在于如何调控真实数据与合成数据的比例。 AIGC视频应用在不同领域的商业化前景和特点是怎样的? AIGC在内容娱乐领域的商业化最早,但受限于作品制和用户时长。影视作品需要备案登记,且时长有限,例如最长的影片也仅约四小时。AI可以降低镜头特效和资产成本,实现复用,并提供源源不断的个性化内容供给,催生实时互动内容。广告与电商领域会更早应用AIGC视频,尤其是在出海业务中,视频需求从作品数量转变为基于SKU、用户、场景描述和版本的组合需求。当前出海广告视频可能仅用一个版本配上多种语言,但更精细化的运营会要求针对不同地区制作不同版本。游戏领域与影视相比,因其交互性而更为高级,因此AI在游戏中发挥重大作用的进程会相对慢一些。企业级视频应用的核心目的并非追求播放量,而是为了降低沟通与培训成本,注重实际效果。工业视频领域虽然已有创新公司涉足,但成果落地时间尚不明确,不过由于汽车等行业本身规模巨大,其所有工业环节都可能成为AI介入的潜在目标,且工业生产的成果易于在实际操作中得到验证。 如何理解AI应用的核心价值以及当前阶段筛选相关投资标的的标准? AI应用当前最核心的价值在于“见效”,即能否真正发挥作用,这也是衡量一个公司AI应用质量的关键。基于当前大环境的要求,即首先要见效,其次要能变现,并且要高度重视运营,因此在2026年第四季度开始筛选投资标的时,重心应放在两类公司上:一类是已经深入理解并掌握信源方向的公司,另一类是这类公司的子公司或孙公司。这些公司由于其业务基础和对运营的重视,在推动AI应用落地并实现价值方面可能更具优势。 视频模型在工业和机器训练领域的应用前景如何,其产业边界将如何扩展? 工业视频是最容易被低估的领域。AT和各类机器正在成为新的视频消费者,尤其是在自动驾驶领域,其训练需要大量关于极端天气、事故及长尾道路场景的视频内容。同样,机器人、工业视觉、事件模型和具身智能的训练也对AIGC内容有大量、广泛且急迫的需求。这些机器训练场景是AIGC内容需求的“大户”。视频模型的产业边界因此从服务于人扩展到服务于机器。这种扩展意味着供给端 需要专注于打造自身内容的独特性和调性,而非试图迎合机器这个“黑箱”的偏好。 在AIGC时代,衡量视频内容质量的核心标准是什么,其最终目标指向何方? 在AIGC时代,视频内容的核心并非画质。许多应用场景,如短剧的消费者在通勤或碎片化时间观看,对画质没有高要求。视频模型的关键在于以下几个层面:首先是“理解”,即准确表达对现实世界的描述;其次是“生成”,即至少能完成叙事;再次是“控制”,根据工业生产、决策或表达等不同目的进行调整。最终,其核心价值在于服务于“交互”和“预测”。例如,用于电商的视频,其根本目标是促成交易达成,内容本身只是实现该目标的手段。因此,高品质画质仅是众多维度之一,而真正用于表达、生产、决策、交互和预测才是其命门所在。 全模态模型的发展是否会取代视频模型?未来视频模型的生态格局将如何演变? 全模态模型的发展不会消灭视频模型,而是会将其嵌入到更大的任务链条中,使其真正用于现实世界的交互与决策。未来的视频模型生态将远不止于当前的剪映、可灵、奇梦等影视制作工具。ToB和ToC的分发平台可以包含营销视频平台、游戏生成、工业仿真、机器人世界模型等多种细分模型。在AI应用的三层研究框架中,第二层(模型层)可以划分出众多细分方向,每个方向都有可能诞生三到五家公司。这种边界的拓展并非简单的功能相加,而是需要对工作流进行持续的重构和调试,因为供给端的变革要求不断适应新模型和新Agent。 视频模型未来的发展路线及其在AI体系中的最终定位是什么? 视频模型的发展路线将遵循从“可观看”走向“可生产”、“可交互”、“可模拟”并最终实现“可执行”的路径。其边界远不止于影视行业(影视仅占约三十六分之一),而是对整个动态现实世界进行数字化重构的一种方式。在AI体系中,如果说图片模型是学习世界的样子,那么视频模型就是学习世界的变化规律,而更高阶的世界模型则是基于此来预测世界下一步会如何演变。因此,视频大模型的下游应用空间涵盖了内容消费、企业生产、动态模拟、机器训练和现实执行等