2024年传媒行业专题研究:Vidu~国内AI视频生成模型新突破
- 来源:华泰证券
- 发布时间:2024/05/10
- 浏览次数:355
- 举报
传媒行业专题研究:Vidu~国内AI视频生成模型新突破.pdf
传媒行业专题研究:Vidu~国内AI视频生成模型新突破。全球AI大模型持续迭代,持续看好视频等多模态发展前景今年以来,全球AI大模型端都持续迭代升级,包括海外的Sora、Llama3等,国内的Kimi、昆仑天工AI、阶跃星辰等。4月27日,北京生数科技有限公司联合清华大学发布了中国首个长时长、高一致性、高动态性视频大模型Vidu。行业的发展进度有望不断催化传媒相关板块的发展,我们看好:1)AI视频大模型依赖多样化训练数据,高质量视频素材库价值凸显;2)AI大模型助力应用场景发展。我们推荐:昆仑万维、光线传媒、捷成股份、值得买。其他产业链标的包括华策影视、中文在线、中广天择、掌阅科技等。Vidu...
Vidu:国内 AI 视频生成模型新突破
明星创业公司,中国视频大模型重大突破
1)2024 年 4 月 27 日,中关村论坛未来人工智能先锋论坛上,北京生数科技有限公司联合 清华大学发布了中国首个长时长、高一致性、高动态性视频大模型,其采用了团队原创的 Diffusion 与 Transformer 融合的架构 U-ViT,该架构不采用插帧的多步骤处理方式来生成视 频,而是通过单一步骤“端到端”直接生成内容,从文本到视频的转换是直接、连续的。 2)Vidu 能够一键生成长达 16 秒、分辨率达到 1080P 的高清视频内容,其拥有丰富的想象 力,可以模拟真实物理世界中细节复杂且符合物理规律的场景,例如合理的光影效果、细 腻的人物表情等,还可生成具有深度和复杂性的超现实主义内容(例如“戴珍珠耳环的猫”)。
团队核心成员来自清华团队,已实现三轮融资
2023 年 6 月,公司宣布完成近亿元人民币的天使轮融资,由蚂蚁集团领投,BV 百度风投、 卓源资本与卓源亚洲跟投;此后,公司在 2023 年 8 月完成了数千万元人民币的天使+轮融 资,该轮融资由锦秋基金独家投资;2024 年 3 月,公司已完成三轮融资,融资额达数亿元 人民币,投资方包括启明创投、智谱 AI、BV 百度风投、锦秋基金等机构。

核心团队来源于清华大学人工智能团队,首席科学家为清华人工智能研究院副院长朱军。 北京生数科技有限公司成立于 2023 年 3 月 6 日,核心成员主要来自清华大学人工智能学院, 其首席科学家朱军为 IEEE Fellow、清华大学计算机系教授与人工智能研究院副院长、清华 智能技术与系统国家重点实验室主任。此外,公司的 CEO 唐家渝是 THUNLP 组成员,CTO 鲍凡长期关注扩散模型领域研究并主导了 U-ViT 和 UniDiffuser,其均为人工智能和扩散模 型领域有着深厚研究的专家,此外还汇集了来自阿里、腾讯、字节等知名科技公司的顶尖 人才。 公司团队致力于贝叶斯机器学习的理论和算法研究,是国际上较早研究深度概率生成模型 的团队之一。工作主要面向针对深度生成式模型的骨干网络、高速采样、可控生成、大模 型训练等全栈底层原创研发。生数科技团队在 ICML、NeurIPS、ICLR 等计算机顶刊发了 20 多篇相关论文,扩散模型是团队的主要发力阵地。先后提出的采样算法 Analytic-DPM、 DPM-Solver 等成果,被 DALL·E、Stable Diffusion 等应用。
多模态布局,涵盖图片、视频、3D 等领域
公司的多模态大模型为全栈自研,能够融合文本、图像、3D、视频等多模态信息。除文生 视频外,公司在文生图、3D 生成上均有所造诣,其主要得益于 ViT 结构打通了 CV 与 NLP, 使得多模态成为可能。
视频模型横向比较:Vidu 快速进化,与 Sora 差距不断缩小
整体来看, Vidu 生成结果的动作幅度、画面一致性均处于国内领先水准。Vidu 目前已经 开始内测,表明其并非概念型工具,侧面反映 Vidu 的技术水准较为成熟。与国内文生视频 模型对比, Vidu 的特点表现在:1.动作幅度、画面一致性领先; 2.采用 U -ViT 模型架构。
Vidu 的视频生成时长仅次于 Sora,且可生成时长进步速度较快。时长方面,Runway 推出 的 Gen 模型目前已经更新至 Gen2,其最长可生成 16 秒视频,与 Vidu 一并位列第二,仅 次于 Sora 的 60 秒钟。2024 年 1 月,生数团队实现 4 秒视频的生成,已可以达到 Pika、 Runway 的效果,至 3 月底达到 8 秒,4 月达到 16 秒、进步快速。且据 4 月 27 日中关村 论坛中生数领军人朱军的发言 Vidu 会以更快的速度迭代,与 Sora 差距将越来越小。商业 化方面,目前主流文生视频的价格均按月收费,海外收费为 8-95 美元/月不等。
相比于 Runway,Vidu 生成视频的运动幅度更大。除 Sora 外,目前文/图生视频较难做到 让人物做出复杂动作,因此为了保证画面畸变最小,视频生成的策略为选择小幅度的运动, 较难设计复杂动作,难以处理场景和人物的一致性问题。目前 Sora在视频生成中领先较多, 在除 Sora 外,Vidu 在保证了时空一致性的前提下运动幅度较大。
分辨率赶上第一梯队,但仍为固定比例尺寸。目前除 Sora 可以在 1920X1080 至 1080X1920 间以任意尺寸进行生成,其余头部文生视频模型均为固定比例生成。就分辨率而言,Vidu 使用了支持 1080p 输出的端到端模型,在同业中处于第一梯队。
Vidu 一致性较强,多镜头中画面依旧连贯。AI 生成视频的一大困难是时间的连贯性,目前 龙头 Sora 能记住视频中的人和物体,在其被暂时挡住或移出画面后依然能按照物理逻辑地 让视频保持连贯性。而 Vidu 此次公布的演示视频中具有多镜头的视频,其展示了较高的连 贯一致性。
Vidu 模型:U-ViT,多模态、效果好、成本低
理论端:自 ViT 诞生后,CV 与 NLP 再无阻隔
ViT(VisionTransformers)为谷歌团队 2020 年提出,是视觉领域中首个完全基于 Transformer 的模型,其模型效果与 CNN 相当、打通了视觉领域(CV)与自然语言处理 (NLP)两大领域。 ViT 是一种基于 Transformer 架构的深度学习模型,由 GoogleBrain 团队于 2020 年发表在 Arxiv 的论文“AnImageisWorth16x16Words:TransformersforImageRecognitionatScale” 中提出,主要用于视觉任务。在 ViT 被提出前,注意力机制或与 CNN 结合使用,或用来取 代 CNN 的某些组件,CNN 结构并未被彻底颠覆。因此,ViT 的创新在于其完全抛弃了 CNN, 直接将标准的 Transformer 模型应用于图像分类等视觉任务,将 CV 与 NLP 连接起来。 经过大量数据预训练的 ViT 取得了与 CNN 媲美甚至更好的性能,而所需计算资源大大下降; 若未预训练,Transformer 会缺乏需要大量学习才能得到的先验知识——归纳偏置,如相邻 区域特征相似和平移等变性等,导致结果不如 CNN 理想。ViT 的提出,表明经过大量数据 预训练后的 Transformer 模型能够直接应用于视觉处理任务,使得 CV 与 NLP 领域的壁垒 被打通,以 Transformer 为底层架构的模型在多模态领域中的障碍越发减少。
应用端:U-ViT 架构受 U-Net 启发,为图像生成而来
结构:向 U-NeT 拜师学艺,换下 CNN、换上 Transformer,为图像生成而来
在 U-ViT 前,Diffusion 模型中的主流主干(backbone)一直为基于 CNN 的 U-Net。U-net 是 2015 年的论文《U-Net:ConvolutionalNetworksforBiomedicalImageSegmentation》中首 次提出的,其在生物医学图像分割领域取得了显著的效果,并因此被广泛应用于各种图像 分割任务中。由于网络图形似英文字母“U”,故称为 U-Net。具体来看,基于 CNN 的 U-Net 具有一组下采样(downsampling)块和一组上采样(upsampling)块,且以长跳跃连接 (longskipconnection)贯穿整个网络。其中,长跳跃连接有助于解决 CNN 在处理图像分 割等任务时可能出现的信息丢失问题,也是随后 U-Net 重点借鉴的部分。

U-ViT 是生数团队设计的一种简单通用的、基于 ViT 的架构,用于使用 Diffusion生成图像。 打响扩散模型中 CNN 被 Transformer 取代的重要一枪。生数科技团队自主研发并于 2022 年 9 月提出了 U-ViT,其早于 Sora 采用的 DiT(DiffusionTransformer),是全球首个将 Diffusion 与 Transformer 融合的知名架构。U-ViT 通过将广泛应用的 U-Net 模型中的 CNN 部分替换为 Transformer 架构,得以同时结合了两者的优势,为图像和视频生成提供了一种 新的方法论。
模型首先对输入图像进行分割处理(分割为 patch),与时间和条件一道表示为 token 后通 过 Embedding 层,随后经过 TransformerBlock 后输出为 token,并通过一个线性层转 为图块,最后通过一个可选的 3X3 卷积层输出为最终结果: 1)遵循 Transformers 的设计理念,U-ViT 将包括时间、条件和噪声图像在内的所有输入 都视作为 token。U-ViT 延续了 ViT 的方法,将带噪图片划分为多个区块之后,与时间 t、 条件 c 和图像块一起转为 token 输入到 TransformerBlock。 2)借鉴 U-Net,U-ViT 在 Transformer 的浅层和深层之间采用长跳转连接,总数量为 (#Blocks-1)/2。长跳跃连接允许模型在处理数据时跳过某些层,从而帮助模型在深层网络 中更有效地传递信息、避免了在训练深层网络时可能出现的梯度消失或爆炸问题。通过长 跳转连接,模型可以保持对输入数据的高层次理解,同时也能够利用浅层网络的细节信息。 此外,U-ViT 也证明了在基于扩散的图像建模中,CNN 中的下采样和上采样并非必须。 3)最后添加 3×3 卷积块用以增加图片输出质量。U-ViT 在输出之前添加了一个可选、而 非必须的 3×3 卷积块以获得更好的视觉质量。
结果:质量与 U-Net 不分伯仲,成本优势大幅领先
U-ViT 在大部分测试中与 U-Net 旗鼓相当,但其成本优势大幅领先: 1)对于无条件学习(unconditionallearning):团队使用包含 50K 训练图像的 CIFAR10 和 包含 162770 张人脸训练图像的 CelebA64×64 数据集,发现同等参数的 U-ViT 与 U-Net 相当,同时性能远优于 GenViT。 2)对于类条件学习(class-conditionallearning):团队使用了 ImageNet 中分辨率为 64× 64、256×256 和 512×512 分辨率的数据集,包含来自 1K 个不同类的 1281167 个训练图 像,同等参数的 U-ViT 结果与 U-Net 也无较大差异、甚至在 256×256 中取得了最低 FID。
3)对于文生图领域:团队使用了分辨率为 256×256 的数据集 MS-COCO,其中包含 82783 个训练图像和 40504 个验证图像,每张图片都有 5 个图像标注。U-ViT 在 ms-coco 的 256x256 数据集中的表现超越 U-Net,并随着模型层数增加、FID 值越发减少。
4)成本优势:大幅领先于 U-Net
在参数量和训练成本相似的情况下,U-ViT 的表现较佳。在无分类器引导的情况下,U-ViT 在不同的训练迭代中始终优于 U-Net。在无分类器引导的情况下,U-ViT 的 FID 为 6.58, U-Net 的 FID 为 10.69。在无分类器引导比例为 0.4 的情况下,U-ViT 的 FID 为 2.29,U-Net 的 FID 为 2.66,双双优于 U-Net。换言之,为达成同等 FID 值,U-ViT 的训练成本较 U-Net 大幅下降,其主要得益于 ViT 架构的训练成本较低。
编辑:火腿肠-
标签
- 传媒
- 热门文档
- 热门文章
- 本年热门
- 本季热门
- 本月热门
- 1 关于2025年国民经济和社会发展计划执行情况与2026年国民经济和社会发展计划草案的报告——2026年3月5日在第十四届全国人民.pdf
- 2 中国网络视听协会:中国网络视听发展研究报告(2026) .pdf
- 3 市场监管局:2025直播电商行业发展白皮书.pdf
- 4 房地产行业第8_9周周报(2026年2月14日_2026年2月27日):26年春节新房成交量低于23_25年,二手房成交量高于23_25年;上海优化限购、公积金和房产税政策.pdf
- 5 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 6 中国股票策略:中国最佳商业模式研究(第二版).pdf
- 7 互联网行业:第57次中国互联网络发展状况统计报告.pdf
- 8 2026年政府工作报告.pdf
- 9 中国2026年展望:探索新动能.pdf
- 10 2025中国新就业形态报告.pdf
- 1 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 2 腾讯研究院-从超级个体到超级团队:AI时代组织变革的涌现路径.pdf
- 3 兰花科创-600123-优质无烟煤龙头,煤化一体静待周期反转与技改红利释放.pdf
- 4 机械设备行业:拥抱科技,重视AI为主线的设备及硬件等投资机会.pdf
- 5 TGV玻璃基板行业动态报告:玻璃基板崛起,赋能先进封装.pdf
- 6 电力设备行业跟踪周报:锂电储能业绩亮眼、拓展AI第二增长曲线.pdf
- 7 玻璃基封装行业专题:玻璃基板有望成为先进封装新平台.pdf
- 8 投资策略-激光通信行业深度:行业现状、终端结构、市场规模及相关公司深度梳理.pdf
- 9 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 10 纺服行业周报:运动品牌Q2流水放缓,安踏、361度表现韧性强.pdf
- 1 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 2 房地产行业专题报告:城市更新推动高质量发展.pdf
- 3 千瓜数据-消费行业:2026年上半年热门行业数据简报.pdf
- 4 AI医疗行业2026年6月月报:AI诊断与药研资本化提速,医疗智能体加速落地.pdf
- 5 厄尔尼诺如何影响资产价格:气候风险传导、历史复盘与2026年展望.pdf
- 6 投资策略:这一次,是金银的拐点吗?.pdf
- 7 风电行业2026年中期策略报告:短期招标承压,看好“十五五”两海成长空间.pdf
- 8 宏观专题:俄乌冲突最新进展如何?.pdf
- 9 腾讯研究院-FDE模式行业观察与实践:前线共创,双向赋能.pdf
- 10 银行业理财登记托管中心-中国银行业理财市场半年报告(2026年上).pdf
- 本年热门
- 本季热门
- 本月热门
- 1 2026年莱特光电公司深度报告:“一核双擎”打造中国电子材料领军企业
- 2 2025年医药行业2026年度策略报告:创新药产业链景气度持续提升
- 3 2026年大族激光公司研究报告:PCB消费电子利好有望助力2025_27年盈利持续增长
- 4 2026年分众传媒公司深度报告:基本盘稳固,格局优化+“碰一碰”开启成长新周期
- 5 2026年春季港股及海外中资股投资策略:分化与回归
- 6 2026年航空行业夏航季民航时刻计划详解:稳中求进,国内控总量、国际促复苏
- 7 2026年春季A股投资策略:为第二阶段上涨蓄力,时代资产不退场
- 8 2026年中银香港公司研究报告:高股息护航,财富与出海共促成长
- 9 2026年固收增厚产品系列报告之一:可转债基金的再定位与再解析
- 10 2026年春季北交所化工新材料行业投资策略:周期迎拐点,成长正当时
- 1 2026年6月人形机器人行业月报:资本化提速与量产渐近
- 2 2026年全球人工智能技术、政策、产业与投融资趋势全景洞察
- 3 2026年6月A股市场研判:AI引领向上,聚焦算力与景气延伸
- 4 2026 AI重塑影视产业:漫剧爆发与产业链重构深度解析
- 5 2026年7月A股量化择时:AI识图聚焦半导体与芯片赛道
- 6 氧化锆断供与HBM瓶颈:全球产业趋势跟踪周报(2026年6月29日)
- 7 2026 ASCO年会国产创新药双抗ADC临床数据梳理
- 8 2026年中期医药生物行业投资策略:AI新药加速推进
- 9 A股2026年6月策略:景气强化与震荡上行配置建议
- 10 宁德时代发布钠电储能方案,7月中国电池排产环比增长
