2024年计算机行业专题报告:Meta Movie Gen的论文告诉我们什么?
- 来源:财通证券
- 发布时间:2024/10/21
- 浏览次数:714
- 举报
计算机行业专题报告:Meta Movie Gen的论文告诉我们什么?.pdf
计算机行业专题报告:MetaMovieGen的论文告诉我们什么?MovieGen:音视频两手抓,模型效果亮眼。2024年10月4日,Meta团计算机20%10%-1%-12%-23%-34%沪深300上证指数分析师杨烨SAC证书编号:S0160522050001yangye01@ctsec.com分析师李宇轩SAC证书编号:S0160524080001liyx02@ctsec.com相关报告1.《智驾月报:补贴政策见效,网联化推进》2024-10-172.《十大不容忽视的数据要素新政细节》2024-10-163.《特斯拉发布Cybercab,预期三年内量产》2024-10-13队发布论文《Mo...
1 Movie Gen:音视频两手抓,模型效果亮眼
2024 年 10 月 4 日,Meta 团队发布论文《Movie Gen: A Cast of Media Foundation Models》,介绍了一系列基础模型 Movie Gen,该模型在文本到视频合成、视频个 性化、视频编辑、视频到音频生成等多个任务上取得了显著成果,标志着 Meta 正 式进入视频生成赛道,与 Sora、Pika、Runway 等进行竞争。Meta 通过扩大训练 数据、计算资源和模型参数,使用 Flow Matching(流匹配)方法训练的 Transformer 模型,打造 Movie Gen 的 2 种基础模型:Movie Gen Video(300 亿参数)和 Movie Gen Audio(130 亿参数),生成高质量的视频或音频。基于 Movie Gen Video 基础 模型进一步训练与微调后,得到可以生成可个性化视频的 Personalized Movie Gen Video 模型和可精确编辑视频的 Movie Gen Edit。
Movie Gen Video(视频生成模型):基础文生视频功能
这是一个 300 亿参数的基础模型,用于联合文本到图像、文本到视频的生成,输入 prompt 可以生成长达 16 秒(每秒 16 帧)且符合文本提示的高质量视频。它基于 Transformer 架构,采用了 LLaMa3 的骨干结构,并进行了一些适应性调整。该模 型在约 1 亿个视频和 10 亿张图像上进行预训练,预训练模型可以推理物体运动、 主体-客体交互、几何、相机运动和物理学,并学习各种概念的合理运动,自然地 生成多种宽高比、可变分辨率、不同时长的高质量图像和视频。
Movie Gen Audio(音频生成模型):生成匹配视频环境的音频
这是一个 130 亿参数的基础模型,用于视频和文本到音频的生成,遵循输入的文 本提示,可以生成 48kHz 高质量的电影音效并实现和视频画面同步的音乐。它采 用了扩散 Transformer(DiT)架构,并基于 Flow Matching(流匹配)进行训练。 该模型在约 100 万小时的音频上预训练,通过音频延伸技术可以为长达几分钟的 视频生成连贯的长音频。它不仅学习了物理关联,还学习了视觉和音频世界之间 的心理关联,可以生成与视觉场景匹配的环境音,以及与视觉动作同步的声音效 果。
Video Personalization(个性化视频):演你所想,人人都是主角
视频个性化根据文本和用户的形象生成以用户为主角的视频。生成的个性化视频 保持了用户的身份,同时遵循文本提示。模型训练使用包含人类的视频子集,自 动构建图像与文本输入和视频输出对。训练过程包括预训练和后训练阶段,预训 练在原始的 Movie Gen Video 模型基础上进行,后训练则针对个性化视频生成进 行优化。
Instruction-Guided Precise Video Editing(指令引导下的精确视频编辑):视 频版 PS 时代到来
视频精准编辑功能允许用户使用文本指令对原视频或生成视频进行精确编辑,包 括风格和细节。由于在视频编辑方面缺乏大规模监督数据,Movie Gen 团队采用 多阶段的训练方法,将视频生成与先进的图像编辑功能结合起来,既能进行局部 编辑也能全局更改,比如添加、移除或替换元素,以及背景或风格修改。传统编 辑工具对使用者要求较高,且生成结果缺乏精度,而 Movie Gen 在进行局部或全 局更改时,能够保留原始内容,仅针对相关像素进行操作。
2 Meta 四个模型的原理与训练方法
2.1 视频生成模型:创新模型架构实现高效训练
Movie Gen Video 训练过程分为三个主要步骤:
低分辨率 T2I(Text to Image 文本到图像)预训练:在低分辨率(256px)图 像数据集上进行预训练,让模型学会基本的文本到图像的生成能力,并形成 对基础视觉元素的理解。
联合低分辨率图像和视频预训练:通过同时训练文本到图像和文本到视频的 任务,模型可以在相同的框架中生成图像和视频,从而共享视觉和时间建模 能力,有助于模型在处理时间维度时,更好地捕获视频的运动特征。
高分辨率微调:模型在高质量的视频数据集上进行微调,以提高视频生成的 质量。模型逐步提高视频的空间分辨率(从 256px 提升到 768px),并进行针 对性的优化,有助于提高生成视频的细节水平和视觉质量,使生成的视频更 加逼真、连贯。

创新模型训练架构,TAE+Flow Matching+Transformer 提升训练和推理效率。 Meta 训练了一个单一的时间自动编码器模型(TAE,Temporal Autoencoder)来将 图像和视频映射到时空压缩的潜在空间(spatiotemporally compressed latent space) 中,使用预训练的文本编码器对输入文本进行编码,以获得文本提示嵌入。Meta 使用流匹配(FM,Flow Matching)训练方法,以采样噪声和用户文本作为输入, 最终通过 TAE 解码器将其映射回像素空间并生成图像或视频。过去的主干网络以 DiT(扩散 Transformer)为主,而 Meta 使用了 LLaMa3(Transformer)结构。训 练过程对文本提示的处理分为三个部分:
UL2(统一语言学习范式,Unifying Language Learning Paradigms):可构建一 种独立于模型架构以及下游任务类型的预训练策略(自监督目标),可以灵活 地适配不同类型的下游任务。使用大量纯文本数据进行训练,提供了强大的 文本推理能力。
Long-prompt MetaCLIP:通过对较长文本标题的 MetaCLIP 文本编码器进行微 调,将输入文本 token 长度从 77 增加到 256。提供了与视觉对齐的文本表示, 有利于跨模态生成。
ByT5(Byte-to-byte Text-to-Text Transfer Transformer):基于 T5 架构的预训练 字节级 Transformer(不再处理 token,而直接作用于文本字节或字符),对噪 声的鲁棒性更强,对拼写和发音敏感的任务上表现更好。
硬件与基础设施:使用多达 6144 个 H100 GPU 来训练多模态模型,每个 GPU 都运行在 700W TDP,配备 80GB HBM3,使用 Meta 的 Grand Teton AI 服务 器平台进行训练。每个服务器内有 8 个 GPU,通过 NVSwitches 均匀连接。 服务器之间的 GPU 通过 400Gbps RoCE RDMA NICs 连接。训练任务由 Meta 的全球规模训练调度程序 MAST 进行调度。
与大语言模型的比较:与大型语言模型(LLM)使用结构化因果注意力掩码 来强制 token 的因果性不同,Movie Gen Video 使用的全双向注意力(full bidirectional attention),其核心优势在于其能够双向交互,增强模型对上下文的 理解深度。这种机制不仅允许模型在编码器和解码器之间双向流动,而且还 能够更精确地聚焦于问题相关的文段部分,从而显著提升了机器理解自然语 言的能力。此外,LLaMa3 使用分组查询注意力(GQA)代替多头注意力 (MHA),这减少了 K-头和 V-头的数量,从而减少了键(Key)和值(Value) 投影的总维度。这不仅减少了 FLOPs 和张量内存大小,还提高了内存带宽利 用率。
模型并行方法:LLaMa3 训练分为不同上下文长度的阶段。由于模型规模大、 上下文长度极长,需要使用多种并行性来实现高效训练。Meta 采用 3D 并行 性来支持模型在参数量、输入 token 和数据集大小三个维度上的扩展,同时 允许水平扩展到更多的 GPU。Meta 利用了完全分片的数据并行性、张量并行 性、序列并行性和上下文并行性。
TAE 用于将 RGB 像素空间的视频和图像编码,进入时空压缩的潜在空间中学习, 通过优化目标函数,提高生成质量和效率。TAE 基于变分自动编码器(VAE,采 用变分推断的用于降维、数据压缩和生成的神经网络),通过在 2D 空间卷积后加 入 1D 时间卷积,使得模型能够更好地处理视频的时间维度。TAE 将输入的各个 时空维度(T 时间、H 高度、W 宽度)压缩 8 倍,从而减少 Transformer 核心网络 的整体序列长度,使其能够生成长时间和高分辨率的视频。TAE 的目标函数在标 准的重建损失之外增加了一个惩罚项,用于对远离均值的潜在值进行惩罚,从而 限制模型生成高范数潜在点(high-norm latent dots),防止模型过度依赖局部高范 数(范数用于衡量矩阵的“距离”、“长度”或者“大小”)信息而影响全局的学习, 以解决生成视频时出现的“斑点”伪影问题。这种设计使得生成的视频在视觉上更 加自然和一致,从而显著提高了重建质量和生成效果。
原始视频和通过 TAE 编解码后的重构样本对比,发现 TAE 可以在保留视觉细节 的情况下重建视频帧。对于图像和视频帧中的高频空间细节,以及视频中的快速 运动,TAE 的重建质量会下降。将经过 8 倍时间压缩的 TAE 模型与未经过时间压 缩的帧自动编码器(Frame-wise AutoEncoder)比较,视频数据在结构相似度(SSIM)、 峰值信噪比(PSNR)、初始距离(FID)表现相当,图像数据方面 TAE 优于帧自 动编码器。
Movie Gen 采用流匹配(Flow Matching)作为训练目标,避免了传统扩散模型中 的逐步去噪过程,而是通过找到生成空间中从初始状态到目标状态的最优传输路 径(OT,Optimal Transport),从而以更少的计算步骤达到高质量生成。流匹配 是一种训练连续归一化流(CNF,Continuous Normalizing Flows)的方法,它通过 学习与概率路径相关的向量场来训练模型,并使用 ODE(常微分方程)求解器来 生成新样本。连续归一化流的核心思想是通过一系列可逆的变换将一个简单的分 布逐步转换为复杂的目标数据分布,这种模型框架在概率密度函数变换方法的基 础上,通过神经网络参数化这些变换,使得模型能够学习到输入数据的概率分布 。对应到图像生成领域,图片数据与高斯噪声可以理解为不同的数据分布,CNF 即为让模型学习从噪声到图像的变换方法,FM 流匹配 +OT 最优传输路径即为相 比去噪扩散概率模型(DDPM,扩散模型的基石)更具一般性、高效的变换方法。 如图 10 显示,从噪声到棋盘的生成过程中,OT 路径更早地引入了棋盘模式,而FM 则实现了更稳定的训练。使用 FM+OT 使得采样步骤较少时就形成了棋盘的 初始形态。

Movie Gen Video 的各个模块架构在最终实现综合质量和文本对齐方面,与其他 同类架构具备显著优势。根据 FM 与 Diffusion、视频与图片标题、类 LLaMa3 与 DiT 相比的净胜率,FM、图片标题、类 LLaMa3 的架构表现出更高的净胜率。
Movie Gen Video 生成质量在当前视频大模型当前为最优。Movie Gen 在整体质 量、一致性、真实度、美学方面方面显著优于 Runway Gen3 和 LumaLabs。在文 字对齐和真实性方面优于 Sora,在真实性和美学方面优于快手的 Kling1.5,仅在 动作完整度方面明显弱于 Kling1.5。根据 Prompt“一只带腿的鼠标在跑步机上跑 步”,Movie Gen Video 生成的视频逻辑上更合理,画面更清晰流畅,Runway Gen3 在对齐方面有欠缺(生成了老鼠而不是鼠标),LumaLabs 在逻辑上不合理(沿着 垂直于跑步机带的方向运动),Kling1.5 生成画面较为杂乱,缺乏美感。
2.2 音频生成模型:生成与画面和情绪匹配的动效声、环境声
Movie Gen Audio 旨在为视频剪辑和短片生成几秒至几分钟不等的配乐,还原电 影级音效,高度匹配画面与环境。模型考虑的原声包括环境声、音效和乐器声, 但不包括语音或人声。该模型实现环境音效与视觉环境相匹配,音效与动作在时 间上保持一致,并与视觉对象保持一致,表达出视频的情绪和情感,并与场景融合统一。要生成长音频,用户需要先输入长视频(例如,58s)和音频文本标题, 进而长视频被拆解为几个视频块(例如,20s)。从第二个块开始,模型不仅需要 视频块和文本标题,还需要之前生成的音频片段(例如,最后 5 秒),以便生成与 前一个保持风格统一的新音频片段。
Meta 采用了基于流匹配的生成模型和扩散 Transformer 的模型架构,并增加了 额外的调节模块以提供控制。在流程图中,黄色块表示输入,蓝色块表示预训练 和冻结的模块,灰色块表示没有可学习参数的操作,绿色块表示可学习的模块, 粉色块表示输出的已学习的流场(通过 Flow Matching 学到的去噪方法)。Meta 选 择流匹配而不是扩散,是因为与扩散模型(DDPM)相比,流匹配具有更好的训练 效率、推理效率和性能。

逐帧添加视觉和音频特征可以改善视频-音频对齐,进而实现视频画面与音频同步。 从 MetaCLIP 中微调的长提示 MetaCLIP 用于提取视频中每帧的 1024 维嵌入。由 于视频的帧率可能与音频的帧率不匹配,Meta 对每个音频帧取最接近的视觉帧。 然后用门控线性投影层将重新采样的序列投影到 DiT 模型维度,并逐帧添加到音 频特征中。与沿着时间维度拼接特征相比,逐帧添加视觉和音频特征可以改善视 频-音频对齐。Meta 发现,长提示 MetaCLIP 特征编码更高级的语义信息,使学习 更容易,同时保留足够的细节来捕捉每个运动的时间,以便模型产生与运动一致 的声音效果。 训练数据选择方面,模型将学习音频和条件输入之间不同层次的关系:
屏幕上的叙事声音在视频和音频之间有很强的对应关系。这种情况下,声音 与画面同步度较高,这要求模型具有更强的视频理解能力和密集动作识别能 力。难度取决于事件的密集程度和结构,一般声音总体上比音乐或语音更容 易(例如,生成高尔夫球杆击球比生成一个人弹吉他匹配和弦更容易)。
生成叙事化的屏幕外音频需要理解什么声音可能出现在什么环境中(例如,在 森林场景中可能出现鸟鸣)和事件之间的逻辑顺序(例如,人群欢呼可能发生 在一个人表演一个困难的把戏之后,而不是之前)。因此,与屏幕上的声音相 比,它需要更强的推理能力。
非叙事音频在语义层面上与视频相关。例如,背景音乐需要与气氛相匹配, 而升调通常用来创造一种紧张或期待的感觉。这需要超越理解世界物理的最 深层次的理解,需要推理和模拟人类的情感。 训练结果:在不同数据集上,Movie Gen Audio 的净胜率(范围[-100%,100%])在 总体质量(图中的 Ovr.)、自然度(Nat.)、专业度(Pro.)、叙事正确性(Corr.)、 叙事同步性(Sync.)等指标均优于对比模型。
2.3 个性化视频模型:用于生成特定人像的微调模型
基于 30B 的 Movie Gen Video 模型,Meta 将参考人像、个性化文本作为输入,实 现了个性化视频(PT2V)输出。Meta 从已训练好的 T2V Movie Gen Video 参数作 为初始化权重,在微调当中使用视觉标记串联,使其集成到一个统一的框架中, 从而允许扩展模型大小。使用可训练的长提示 MetaCLIP 视觉编码器从人脸图像 中提取身份特征,然后使用投影层将其与文本特征维度对齐,进而输入到 Transformer 的交叉注意力模块进行训练。黄色模块表示冻结层,采用已训练好的 参数,绿色表示可训练模块。训练策略包括 PT2V 预训练阶段,然后是 PT2V 高 质量的微调。
PT2V 生成人物身份正确性和各帧的面部一致性优于此前 SOTA 模型。Meta 在对 PT2V 预训练和高质量监督微调之后,与 ID-Animator、单独 PT2V 预训练、单独 PT2V 微调对比,比较发现 Meta 个性化模型在最佳相似帧、最差相似帧和跨帧的 面部一致性三个方面取得优异的结果,尤其在面部一致性方面显著胜出。另外, 其微调模型与 ID-Animator 相比,在总体质量、一致性、动作自然度、动作复杂 度、文本对齐方面全部胜出。而 PT2V 预训练在动作自然度、动作复杂度、文本 对齐方面略逊色于 T2V 预训练,我们认为可能是 PT2V 模型注意力集中于输入人 物形象,对基础动作和环境的学习略有减弱。
2.4 可编辑视频模型:无需大量监督视频数据实现模型训练
专业视频编辑软件门槛高、操作复杂,Meta 发布基于自然语言指令的视频编辑模 型,可提升普通人或半专业群体的视频编辑效率。当前由于缺乏大量的监督视频 编辑数据,开发高效的视频编辑模型仍有较大挑战。为了解决数据不足的问题, Movie Gen Edit 创新地采用了一系列训练策略,使得无需依赖大量监督数据,也 能实现出色的视频编辑效果。其基础架构基于视频生成模型进行了若干改动:
视频输入:模型通过在 Patch Embedder 中添加额外的输入通道来实现视频输 入的条件化。将输入视频的隐向量和噪声/输出的隐向量沿通道维度进行拼接, 再传递给模型。
任务嵌入向量:参考 Emu Edit,在模型中加入了用于特定编辑任务的嵌入向 量,每种不同的任务都有一个可学习的任务嵌入向量。
权重初始化:为了保证视频生成的能力,所有新添加的权重被初始化为 0,其 余的权重则从预训练好的 Movie Gen 模型中继承。 视频训练分为三个阶段:第一阶段利用图像编辑来模拟单帧视频编辑,第二阶段 通过合成多帧编辑任务来减少模糊问题,第三阶段则通过反向翻译增强了输出视 频的自然感。该训练方法克服了由于缺乏监督数据而产生的“训练—测试”不一 致性问题。
第一阶段:单帧视频编辑。由于缺乏监督视频编辑数据,Movie Gen Edit 利用 图像编辑数据,将其视为单帧视频编辑来进行训练。具体地,图像编辑数据 由三元组组成,表示输入图像、编辑指令和输出图像。高质量的视频编辑不 仅需要精确编辑单个帧,还需要确保输出视频保持时间一致性,以及新元素的合理性。因此,模型被同时训练进行图像编辑和文本到视频生成,以保持 时间一致性和生成质量。
第二阶段:多帧视频编辑。虽然第一阶段的模型已经具备了编辑单帧图像和 生成高质量视频的能力,但在进行视频编辑时仍然会产生模糊的结果。为了 减少这类问题,第二阶段的训练通过创建两个包含多帧视频输入和输出的合 成数据集来进行改进,数据集包括:(1)动画帧编辑:利用视频-字幕数据对 生成编辑指令,并对随机帧进行编辑,然后通过仿射变换将这些帧进行动画 化,从而生成多帧编辑的示例。(2)生成式指令引导视频分割:要求模型根 据指令用高亮颜色标记视频中的特定对象,以补充动画帧编辑中缺乏自然运 动的问题。
第三阶段:基于反向翻译(back translation)的视频编辑。虽然第二阶段训 练的模型减轻了模糊问题,但新生成的元素仍然缺乏足够的运动感,且有时 会过度饱和。因此,Meta 通过创建包含真实输出视频的视频编辑数据集来解 决这些问题,并引入了反向翻译技术。模型首先生成一个编辑后的视频,然 后通过反向指令将其还原至原视频,从而实现“去噪”获得真实视频。这种 方法构建了一个弱监督的视频编辑数据集,使模型能够在带有噪声的视频和 编辑指令的条件下进行“去噪”。
Movie Gen Edit 编辑效果显著优于其他视频编辑模型。前期相关工作包括:随机 差分编辑(SDEdit)通过向输入视频添加噪声,然后用描述性文本进行微调的同 时进行去噪来执行图像编辑,这种方法可能会导致重要细节的丢失,例如主体身 份和纹理,从而降低了精确编辑的效果;目前表现最优的视频编辑方法,是利用 事先训练好同时克服了视频编辑缺乏监督数据集的问题,例如 InsV2V 将 InstructPix2Pix 的一般方法扩展到视频编辑,可以使用合成数据创建和训练视频编 辑模型;EVE 采用无监督训练,通过使用来自两个专家模型的知识蒸馏,一个用 于图像编辑,另一个用于文本到视频的生成。Meta 在 TGVE+(Text Guided Video Editing,文本引导视频编辑)和在 Movie Gen Edit Bench 基准上,与所有模型进行 比较,人类评估分数取自[0,100],50 代表模型水平相当。下图数据显示,Meta 模 型在文本、结构、质量、综合评分明显优于 InsV2V、Runway Gen3 V2V、SDEdit 等。

3 Meta 论文发布带来的四点启示
Movie Gen 系列模型打开 AI 应用落地的新的想象空间。(1)创意生成市场 是 AIGC 技术开辟的新市场,Meta 模型能够生成时长达到 16 秒的视频和最 长 45 秒的音频,个人用户可结合个性化功能用于社交媒体娱乐展示、教学视 频、数字人形象。企业可用于广告宣传、场景特效资源积累、中小规模影视 作品制作,以及游戏开发和虚拟现实,由于音频与画面高度匹配,能给观众 带来更具沉浸感的体验。(2)创意编辑市场,当前已有以 Adobe 为代表的成 熟的视频、图像、音频编辑工具软件,Meta 大模型(通过文本控制编辑内容 的方式)一定程度上将会降低编辑视频图像的壁垒与专业度,但大模型对编 辑内容的精确度与效率目前仍低于 UI 界面,即文本描述对视频/图像中具体 对象和位置的处理效率低于 UI 交互的过程。因此我们认为,视频图像类编辑 软件的形态将持续存在,但大模型在其中贡献的价值比重将持续提升,“文本+UI”的控制方式未来或将成为主流。若未来巨头拒绝开源多模态大模型,没 有训练基础模型的编辑软件企业将选择 API 接入的方法提供文本生成与编辑 的功能,此时平台的知名度、易用性、稳定性、适配度,以及资源素材的丰 富程度将成为创意软件竞争的焦点。
模型架构创新尚无止境,“流匹配+最优传输+纯 Transformer”生成效率、质 量均优于 DiT。Movie Gen 的生成效果在多个领域超过了现有的模型,包括 分辨率、生成视频的连贯性、音视频同步的准确性以及生成效率等方面。模 型架构方面,Meta 没有选择此前业界主流采用的 DiT 架构,明显与 Sora、 Kling、Gen-3、Minima 等一系列海内外的视频生成模型不同,表明模型架构 的创新尚无止境。我们看到 Transformer 架构在多模态生成领域极为强大的适 用性(从 NLP 拓展到 CV,再拓展到音频生成),对这一模型架构的挖掘远未 结束。FLUX.1、Stable Diffusion 3 等近期发布的视频大模型也采用了 FM 的 方法。当然,FM+OT(流匹配+最优传输)的方法并不意味着完全舍弃扩散 模型加噪去噪的方法,FM 方法通过学习从真实数据分布到噪声数据分布的 梯度(流)变化过程,只是扩散模型的更为一般和高效的形式。
对于多模态大模型训练,高质量的数据及处理起到决定性作用。从论文中我 们可以看到 Meta 团队对高质量数据的追求,从论文的数据判断,经过整个预 训练数据处理,数据留存率可能仅为 1%左右。Meta 选择从基础开始逐步建 立数据集评估、筛选、标注系统,特别是在文本与视频对齐领域,选择综合 多个 text-encoder 模型的组合,实现在文本对齐的效果上做到 SOTA。Meta 遵 从三阶段训练模型,从 256px 的 T2I 模型到 768px 的 T2I+T2V,再到各种微 调模型,我们发现即使是用于粗略学习的 256px 的 T2I 模型,Meta 也是投喂 高质量数据,这可能意味着数据质量在训练初始阶段就已经对模型的最终效 果产生深刻影响。
大力出奇迹的“Scaling Law”依然成立,技术和方法的创新也同样重要,两 者并不矛盾。Meta 在论文开篇提出“We find that scaling the training data, compute, and model parameters of a simple Transformer-based model trained with Flow Matching yields high quality generative models for video or audio.”直接强 调了扩大训练数据、计算规模、模型参数的重要性,我们认为 Meta 的 30B 大 模型在视频生成模型的规模上已经是第一梯队。同时,为使大模型训练能够 从 Scaling 当中获益、提升模型最终效果,Meta 在架构、潜在空间、训练目 标、数据管理、评估协议、并行化技术和推理优化方面等进行了多种技术创 新和简化。Meta 即使可调配 6144 张 H100 进行训练,在面对长达 73k token 的视频序列也必须要考虑并行优化的方法,而且在并行处理上尽可能的挖掘GPU 集群的上限。未来在模型训练方面,获得更多的算力基础依然是必不可 少的,而架构等技术创新有望持续提升训练效率和生成质量,两者并不矛盾。
编辑:火腿肠-
标签
- 计算机
- 热门文档
- 热门文章
- 本年热门
- 本季热门
- 本月热门
- 1 关于2025年国民经济和社会发展计划执行情况与2026年国民经济和社会发展计划草案的报告——2026年3月5日在第十四届全国人民.pdf
- 2 中国网络视听协会:中国网络视听发展研究报告(2026) .pdf
- 3 市场监管局:2025直播电商行业发展白皮书.pdf
- 4 房地产行业第8_9周周报(2026年2月14日_2026年2月27日):26年春节新房成交量低于23_25年,二手房成交量高于23_25年;上海优化限购、公积金和房产税政策.pdf
- 5 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 6 中国股票策略:中国最佳商业模式研究(第二版).pdf
- 7 互联网行业:第57次中国互联网络发展状况统计报告.pdf
- 8 2026年政府工作报告.pdf
- 9 中国2026年展望:探索新动能.pdf
- 10 2025中国新就业形态报告.pdf
- 1 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 2 腾讯研究院-从超级个体到超级团队:AI时代组织变革的涌现路径.pdf
- 3 兰花科创-600123-优质无烟煤龙头,煤化一体静待周期反转与技改红利释放.pdf
- 4 机械设备行业:拥抱科技,重视AI为主线的设备及硬件等投资机会.pdf
- 5 TGV玻璃基板行业动态报告:玻璃基板崛起,赋能先进封装.pdf
- 6 电力设备行业跟踪周报:锂电储能业绩亮眼、拓展AI第二增长曲线.pdf
- 7 玻璃基封装行业专题:玻璃基板有望成为先进封装新平台.pdf
- 8 投资策略-激光通信行业深度:行业现状、终端结构、市场规模及相关公司深度梳理.pdf
- 9 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 10 纺服行业周报:运动品牌Q2流水放缓,安踏、361度表现韧性强.pdf
- 1 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 2 房地产行业专题报告:城市更新推动高质量发展.pdf
- 3 千瓜数据-消费行业:2026年上半年热门行业数据简报.pdf
- 4 AI医疗行业2026年6月月报:AI诊断与药研资本化提速,医疗智能体加速落地.pdf
- 5 厄尔尼诺如何影响资产价格:气候风险传导、历史复盘与2026年展望.pdf
- 6 投资策略:这一次,是金银的拐点吗?.pdf
- 7 风电行业2026年中期策略报告:短期招标承压,看好“十五五”两海成长空间.pdf
- 8 宏观专题:俄乌冲突最新进展如何?.pdf
- 9 腾讯研究院-FDE模式行业观察与实践:前线共创,双向赋能.pdf
- 10 银行业理财登记托管中心-中国银行业理财市场半年报告(2026年上).pdf
- 本年热门
- 本季热门
- 本月热门
- 1 2026年莱特光电公司深度报告:“一核双擎”打造中国电子材料领军企业
- 2 2025年医药行业2026年度策略报告:创新药产业链景气度持续提升
- 3 2026年大族激光公司研究报告:PCB消费电子利好有望助力2025_27年盈利持续增长
- 4 2026年分众传媒公司深度报告:基本盘稳固,格局优化+“碰一碰”开启成长新周期
- 5 2026年春季港股及海外中资股投资策略:分化与回归
- 6 2026年航空行业夏航季民航时刻计划详解:稳中求进,国内控总量、国际促复苏
- 7 2026年春季A股投资策略:为第二阶段上涨蓄力,时代资产不退场
- 8 2026年中银香港公司研究报告:高股息护航,财富与出海共促成长
- 9 2026年固收增厚产品系列报告之一:可转债基金的再定位与再解析
- 10 2026年春季北交所化工新材料行业投资策略:周期迎拐点,成长正当时
- 1 2026年6月人形机器人行业月报:资本化提速与量产渐近
- 2 2026年全球人工智能技术、政策、产业与投融资趋势全景洞察
- 3 2026年6月A股市场研判:AI引领向上,聚焦算力与景气延伸
- 4 2026 AI重塑影视产业:漫剧爆发与产业链重构深度解析
- 5 2026年7月A股量化择时:AI识图聚焦半导体与芯片赛道
- 6 氧化锆断供与HBM瓶颈:全球产业趋势跟踪周报(2026年6月29日)
- 7 2026 ASCO年会国产创新药双抗ADC临床数据梳理
- 8 2026年中期医药生物行业投资策略:AI新药加速推进
- 9 A股2026年6月策略:景气强化与震荡上行配置建议
- 10 宁德时代发布钠电储能方案,7月中国电池排产环比增长
