快手可灵是一款由快手自主研发的AI视频生成大模型,于2024年6月6日正式发布。这款产品是快手AI团队基于多年的视频技术积累,采用类似于Sora的DiT技术路线,并融合了多项自研创新技术的结果,旨在对标Sora的性能。
快手可灵在技术层面表现出色,它采用了原生的文生视频技术路线,取代了图像生成与时序模块的组合,从而实现了生成时间长、帧率高、能准确处理复杂运动的能力。具体来说:
- 大幅度的合理运动:通过3D时空联合注意力机制,可灵能够精确模拟复杂时空运动,生成符合物理规律的大幅运动视频。
- 长达2分钟的视频生成:得益于高效的训练基础设施、极致的推理优化和可扩展的基础架构,可灵能够生成长达2分钟的视频,且帧率达到30fps。
- 模拟物理世界特性:利用自研模型架构和Scaling Law,可灵能够精准模拟真实世界的物理特性,生成符合物理规律的视频。
- 强大的概念组合能力:基于对文本-视频语义的深刻理解和Diffusion Transformer架构的强大能力,可灵能够将用户丰富的想象力转化为具体的画面,创造虚拟世界。
- 电影级的画面生成:通过自研的3D VAE技术,可灵能够生成1080p分辨率的电影级视频,无论是宏大场景还是细节特写,都能生动展现。
- 支持自由的输出视频宽高比:可灵采用了可变分辨率的训练策略,在推理阶段可以输出不同比例的视频,满足多样化应用场景的需求。
从行业角度来看,快手作为头部短视频公司,积极布局AI领域,其产品的推出不仅展示了快手在AI大模型技术方面的深厚实力,也体现了国产AI视频模型的技术水平。分析师预计,随着AI技术的持续迭代,中国厂商的技术追赶速度加快,AI视频应用的商业化进程有望加速,同时降低了内容创作的门槛。
然而,该产品面临的风险包括但不限于政策监管趋严、技术迭代进展不达预期、产品商业化进程不如预期等方面。
快手可灵的发布标志着快手在AI领域的深入探索,不仅展示了其技术实力,也为AI视频生成领域带来了新的可能性。