2025年扩散大语言模型(dLLM)开启并行新范式:大模型领域的重要技术路线试水
- 来源:国泰海通证券
- 发布时间:2025/07/07
- 浏览次数:1396
- 举报
扩散大语言模型(dLLM)开启并行新范式:大模型领域的重要技术路线试水.pdf
扩散大语言模型(dLLM)开启并行新范式:大模型领域的重要技术路线试水。扩散大语言模型(dLLM)采用并行生成新范式,其迭代求精与全局规划的独特机制,驱动下一阶段AI在代码生成、可控编辑等领域实现能力跃迁:面对日益增长的推理成本与速度要求,dLLM通过并行解码从根本上改变了当下流行的AR模型顺序解码token-by-token生成文本的模式,在同等生成质量的前提下,实现生成速度数倍提升。2025年以来,dLLM已从理论探索迅速走向产业实践:开源大模型领域,LLaDA率先在数十亿参数规模上验证了其与AR模型竞争的潜力,MMaDA则以统一架构展现了其在多模态领域的强大融合能力。商业化大模型领域,I...
1. 非自回归模型的探索,为 dLLM 的诞生奠定了理论与实践 基础
在扩散大语言模型(dLLM, Diffusion LLM)快速发展之前,业界的主流技术路 径由自回归(Autoregressive,AR)模型牢牢占据。这类模型以其逐字(token-bytoken)生成的顺序解码机制,精准地模拟了人类的语言习惯,我们熟知的 GPT 系列等大语言模型便是这一路线的典范。然而,随着模型规模与应用需求的爆炸 式增长,这种序列化生成方式固有的速度瓶颈与高昂成本问题日益凸显。在此背 景下,学术界对非自回归(Non-Autoregressive,NAR)模型的探索应运而生,其 核心动机正是为了打破 AR 模型的序列化桎梏,以期实现大幅的推理速度提升。
1.1. 突破序列化生成瓶颈,是驱动非自回归模型探索的核心动机
早期的代表性工作为条件掩码语言模型(Conditional Masked Language Model, CMLM)及其解码算法 Mask-Predict。Ghazvininejad 等人于 2019 年提出了 MaskPredict 算法,通过引入条件掩码语言模型实现并行译文生成。训练阶段,模型学 习在源文本和部分掩码的目标文本条件下预测被掩盖的词语。在推理阶段,MaskPredict 首先一次性生成完整序列,实现所有词同时生成,然后反复掩盖低置信度 的词并重新生成,迭代若干次直至输出稳定。这种迭代细化策略被称为“半自回 归”(Semi-Autoregressive),因为它在有限轮次中完成了多步推理。实验证明,在 常数轮次(如 10 次以内)迭代后,Mask-Predict 能够接近 AR 模型的翻译质量, 其 BLEU 值仅差约 1 分,而推理速度却快得多。图 1 直观地展示了这一“预测-掩 码-再预测”的迭代过程。

1.2. NAR 模型的四大缺陷桎梏性能,未能撼动 AR 统治地位
尽管早期的 NAR 探索验证了并行解码的巨大潜力,但未能撼动 AR 模型的统治 地位,其背后存在着几个难以克服的缺陷。 首先,致命的理论缺陷在于推理阶段迭代过程中产生的显著错误会继续参与后续 计算,进而会放大整个推理过程中信息损失偏差。以典型的条件掩码语言模型为 例,其在训练阶段学习的是对真实参考文本进行随机掩码后的填补任务,输入分 布源自一个完整、干净的目标序列。然而在推理阶段,模型必须依赖自身迭代生 成的、可能包含有显著错误的中间结果作为后续输入,导致输入分布与训练阶段 发生严重偏移。从理论上讲,模型训练时优化的只是一个代理分布?(? ∣ ?, ?),而 非真实的条件概率?(? ∣ ?),两者间存在无法避免的信息损失下界。这种固有的分 布差异,从根本上削弱了模型建模 token 间复杂依赖的能力,并导致误差在推理 过程中被放大,最终损害了生成质量。 其次,并行解码天然缺乏对目标端上下文的依赖,引发了棘手的“多模态难题” (Multimodality Problem)。模型在生成某个 token 时无法利用其左侧已生成的上 下文作为条件,这被认为是早期 NAR 模型性能不足的根源。在翻译等任务中,一个源输入往往对应多个合理的输出,例如,“谢谢”可对应“Thanks”或“Thank you”,缺乏显式依赖的并行生成机制难以处理这种不确定性,模型往往会输出多 个合理翻译的平均或混合结果,导致不连贯、重复甚至遗漏词等现象,从而难以 预测正确的句子长度以及保持语法的一致性。
第三,为弥补 NAR 建模能力的先天不足,早期方法普遍依赖知识蒸馏(Knowledge Distillation),但这引入了新的成本与认知局限。研究者通常需要先训练一个性能 强大的 AR 教师模型,再用其生成的伪参考(Pseudo Target)来训练 NAR 学生模 型。这一策略虽能通过提供更平滑、规范的训练目标来规避多模态难题,并在翻 译任务中显著提升 BLEU 等评测分数,但其负面影响同样深刻:一方面,额外引 入教师模型和伪标签生成过程显著增加了训练的复杂度与成本;另一方面,蒸馏 后的干净目标序列掩盖了原始数据中的多样性与复杂性,使得模型在评估中获得 的性能提高。这种进步部分来自于教师模型的归一化处理,而非学生模型自身建 模能力的根本提升。这种依赖性阻碍了对 NAR 结构优劣的客观评估,也激发了后 续对“去蒸馏化”训练策略的探索。 最后,多轮迭代精炼(Refine)的内在需求,在实践中严重抵消了并行解码带来的 理论速度优势。以 Mask-Predict 为代表的模型,在生成初步输出后,仍需通过多 次修正才能达到可接受的质量。尽管少量迭代能够兼顾速度与效果,但过多的迭 代次数会急剧增加推理开销,使其“并行”的优势名存实亡。虽然已有研究(如 SMART)试图通过更精巧的训练策略缓解这一问题,但即便如此,NAR 路线在通 用大模型时代到来之前,仍未能在开放领域大规模通用模型上取得显著突破。与 此同时,尽管 BERT 等双向掩码模型在语言理解任务上表现卓越,但其“为理解 而生”的掩码机制无法定义一个完备的序列生成过程,也无法进行从左到右式递 归采样,因此始终不适用于直接进行开放式文本生成,这进一步凸显了业界对一 种全新并行生成范式的渴求。 早期探索的实践经验最终表明,并行解码是实现高速生成的必要条件,但远非充 分条件。仅仅做到并行预测是远远不够的,其背后必须辅以一个强大且理论完备 的框架来有效管理全局依赖关系。早期 NAR 模型(如 CMLM)的迭代精炼过程, 更像是一种缺乏顶层设计的“打补丁”式修正,它缺少一个从已知的、统一的噪 声分布平滑过渡到目标数据分布的数学原理作为支撑,这恰恰为 dLLM 的登场埋 下了伏笔。dLLM 的诞生完成了一个深刻的挑战:如何在并行解码的框架下,构 建一个能同时兼顾生成质量、灵活性与理论完备性的统一模型。
2. 开源 dLLM 相继问世,标志着并行生成范式从理论探索走 向大模型技术快速实践
2.1. LLaDA 作为首个大规模开源实践,奠定了 dLLM 发展的里程碑
LLaDA(Large Language Diffusion with mAsking)是由中国人民大学 GSAI-ML 研究组与蚂蚁集团联合团队在 2025 年 2 月提出的一款纯扩散式大型语言模型, 其命名中的“mAsking”揭示了其核心机制:掩码扩散。 LLaDA 于 2025 年 2 月开源,是首个在数十亿参数规模上成功实现从头训练、且 在关键 NLP 任务上展现出卓越性能的开源扩散语言模型。在 8B 参数规模上, LLaDA 的预训练效果可媲美 Meta LLaMA3-8B 等 AR 模型。在零样本上下文学习 (In-context Learning)能力上,LLaDA-8B 与同规模的 LLaMA3-8B 不相上下。经 过有监督微调(SFT)后,其展现出的优秀指令遵循和多轮对话能力,足以胜任复 杂的对话与推理任务。特别是 LLaDA 在某些挑战性任务上(如需要反向推理的中 文古诗词补全)甚至展现出超越 GPT-4o 等强大 AR 模型的独特优势。这些成果首 次确立了扩散模型作为大型语言模型一条可行且充满潜力的技术路径。
从架构上看,LLaDA 采用的是标准 Transformer 模型,但与 GPT 等 AR Transformer 架构最关键的区别在于不使用因果注意力掩码(causal attention mask)。LLaDA 的自注意力既可以看见左侧上下文,也可以看见右侧未来的单词, 即拥有类似 BERT 的真正的双向注意力(Bidirectional Attention)结构。为了在不 使用分组查询注意力(Grouped-Query Attention)等优化技巧的前提下,保持与同 规模 AR 模型相似的参数量,LLaDA 在架构上做出了精巧的权衡,通过适当减少 前馈网络(FFN)的维度来补偿注意力层增加的参数。LLaDA 的训练过程遵循离 散扩散模型(Discrete Diffusion)的范式:首先定义一个前向掩码过程,即以一定 概率逐步将序列中的词替换为特殊掩码符([MASK])。当前向过程进行到极限(扩 散终态)时,整个序列将被 100%掩码。训练目标是在给定任意掩码比例?的前向 状态下,学习一个去噪模型来预测原始干净文本。LLaDA 以随机掩码比例? ∼ ?(0,1)对训练语料进行掩盖,得到带有一定比例缺失词的输入序列,然后让 Transformer 同时预测出所有掩码位置的原始词语。其本质,是在一个统一的框架 内对任意掩码率下的序列分布进行建模,从而有效覆盖了从完整文本(t=0)到纯 粹噪声(t=1)的全部状态空间。
在推理(采样)阶段,LLaDA 模拟的是上述扩散过程的逆过程。从一个完全被掩 码的序列(相当于 t=1 的状态)开始,通过一系列迭代步骤逐步去噪,直至生成 完整的文本输出。在每个扩散逆过程的时间步,模型都会对当前序列中尚未确定 的掩码位置同时做出预测。为了逐步逼近最终结果,LLaDA 引入了多种重掩码策 略,其核心策略之一是低置信度重掩码(low-confidence remasking):在每个迭代 步骤,模型会并行预测所有掩码位置的候选 token 及其置信度;然后,根据一个预 设的比例,直接将置信度最低的一部分预测结果重新掩码,而其余置信度较高的 预测则被视为定稿并保留,以为后续迭代中的不确定部分提供修正依据。此外, 模型还可以采用分块生成(semi-autoregressive remasking)的策略,即从左到右 逐块进行并行采样。这一迭代式并行解码的整体思想,与图像生成领域的 MaskGIT 算法高度相似,都是通过多轮精炼逐步揭示新内容。经过若干步迭代(具体步数 依任务复杂度而定,可从十几步到上千步不等),序列中所有掩码都被填充,输出 完整文本。这种解码方式并非从左到右,而是通过多轮并行填空来完成句子生成。 它充分利用了模型的双向注意力,使其能够在生成过程中根据全局上下文反复调 整先前预测,从而实现对最优输出的逐步逼近,并天然支持错误修正。
LLaDA 新颖的架构和并行解码机制,使其不仅在理论上可行,更在实践中展现出 一系列开创性的技术贡献。 1) 证明了扩散范式在大模型时代的扩展性与可行性。LLaDA 是首个在数十亿 (8B)参数规模上从头训练,并证明其性能足以与同规模中小型 SOTA 级 AR 模型(如 LLaMA3-8B)旗鼓相当的开源的掩码扩散模型(Masked Diffusion Model,MDM)。这一成果直接回应了业界对非自回归路线扩展能力的长期质 疑,确立了扩散模型作为大型语言模型一条极具潜力的新路径。 2) 开创性地提出了 VRPO 算法,解决了扩散模型的对齐难题。LLaDA 1.5 版本 中提出的 VRPO(Variance-Reduced Preference Optimization)算法框架深入分 析并解决了在对齐过程中由证据下界(ELBO)估计引入的高方差问题,通过 理论推导和包括对偶采样(Antithetic Sampling)在内的方差缩减技术,成功实 现了稳定高效的类 DPO(Direct Preference Optimization)偏好对齐。此举是将 扩散模型从“能生成”推向“更听话”的关键一步。 3) 展示了强大的指令遵循与对齐后能力。在完成预训练后,LLaDA 通过监督微 调(SFT)已具备了类 ChatGPT 的对话能力。而在 LLaDA 1.5 中,经过 VRPO 对齐,其在数学(GSM8K +4.7)、代码(HumanEval +3.0)和对齐基准(ArenaHard +4.3)上性能更是获得巨大飞跃。得益于其固有的双向注意力机制, LLaDA 能有效解决困扰 AR 模型的“逆转诅咒”(Reversal Curse)问题,展现 了其在特定推理任务上的独特优势。证明了 dLLM 并非仅是理论探索,而是 已具备在复杂下游任务中担当重任的潜力。 4) 开源了完整的技术栈,填补了社区空白并激发后续研究。LLaDA 项目不仅开 源了从预训练到 SFT 的模型权重与代码,其后续的 LLaDA 1.5 也公开了 VRPO 对齐算法的细节,为社区提供了首个可复现的大规模扩散 LLM 全流程方案。 该项目的开源极大激发了学术界和产业界的兴趣,为后续的扩散模型优化(如 改进推理、扩展多模态等)奠定了坚实基础,在扩散 LLM 发展史上具有里程 碑式的意义。
尽管 LLaDA 取得了突破性进展,但也揭示了 dLLM 路线固有的一些局限与挑战, 为后续研究指明了方向。 1) 生成长度的灵活控制仍是突出短板。虽然 LLaDA 引入了终止符来处理 变长文本,但其后续研究(LLaDA 1.5)揭示了该机制尚不鲁棒。研究者发现, 模型倾向于过早生成导致输出截断,需要通过人为干预采样过程(如手动降低置信度)这类启发式技巧来修正。这表明,相较于 AR 模型通过 概率分布自然地决定何时终止,dLLM 在学习“于何处停止”这一能力上仍有 待加强,其对可变长度的灵活控制远不如 AR 模型直接和稳健。 2) 采样策略的启发式性质与理论完备性存在权衡。LLaDA 的并行解码依赖于“低 置信度重掩码”等启发式规则来决定每步揭露多少 token,这一过程虽有效, 但缺乏严格的理论最优性,属于一种近似采样方法。某种程度上,这与连续扩 散模型中由 SDE/ODE 驱动的、数学上更优美的采样理论形成了对比,使得解 码过程更偏向于工程技巧驱动。因此,如何设计兼具高效与理论保障的并行解 码策略,避免 dLLM 退化为单纯的“迭代式掩码填充”,是其未来发展的核心 挑战之一。 3) 模型规模与高阶能力的上限有待验证。目前 LLaDA 项目的最大规模为 80 亿 (8B),与业界拥有数千亿乃至万亿级参数的 AR 模型相比,在参数规模上仍 有数量级差距。尽管 LLaDA 展示了良好的扩展潜力,但一些更高阶的语言能 力(如更深层次的常识、复杂规划等)有赖于更大规模的模型支撑,dLLM 在 此维度的能力上限,尚未得到充分验证。 4) 推理效率与总计算成本之间存在内在矛盾。扩散模型通过并行计算,在 Wallclock Time 上相比 AR 模型具备颠覆性优势,这也是其核心吸引力所在。然而, 其总计算量(FLOPs)同样不容忽视:N 轮迭代生成意味着对整个序列进行了 N 次 Transformer 前向计算。要真正释放 dLLM 的效率潜力,就必须在采样算 法(旨在减少迭代次数)与工程实现(如高效缓存策略)上进行深度优化,以 有效降低总计算成本。
2.2. MMaDA 以统一扩散架构探索多模态,展现“一统多能”的巨大潜 力
MMaDA(Multimodal Large Diffusion Language Models)是由普林斯顿大学、北 京大学、清华大学与字节跳动在 2025 年 5 月合作提出的一款多模态扩散式基础 模型。与专注文本的 LLaDA 不同,其目标是统一处理自然语言、图像乃至图像 生成等多种数据模态。该模型同样采用了离散扩散框架,但在设计上强调“模态 无关”的统一架构。具体而言,MMaDA 使用一个共享的 Transformer 网络来同时 建模文本和视觉信息,摒弃了为不同模态设计专门模块的传统思路。例如,在多 模态输入时,图像通过一个预训练的图像量化器(image quantizer)处理,被直接 转换成与文本同构的离散 token 序列,随后与文本序列一起共同送入统一的扩散 Transformer 进行掩码预测。这种在架构上对不同模态一视同仁的设计,实现了图 文信息的无缝融合与交互,为处理复杂的跨模态任务奠定了基础。
MMaDA 的成功,得益于其在模型架构、训练策略及对齐算法上的一系列协同创 新。 其首要创新在于统一的、模态无关的扩散架构。MMaDA 抛弃了传统多模态模型 中“视觉编码器+文本解码器”各司其职的做法,转而采用共享扩散 Transformer 处理所有模态数据。这一设计不仅大幅简化了模型结构,更为不同模态间的深层 知识迁移创造了条件,例如,语言模态的推理能力可以潜移默化地赋能视觉模态 的理解。 其次,在训练策略上,MMaDA 引入了混合长思维链微调的创新方法以增强其跨 模态推理能力。该策略将不同模态下的思维链(Chain-of-Thought,CoT)以统一 的格式进行训练,无论是文本推理还是视觉问答,都采用类似的步骤链格式,使 模型能在微调阶段学习在统一逻辑下进行跨模态推理。这种统一的 CoT 助于解决 模型在多模态推理中可能遇到的模态迁移困难,并显著提升了复杂任务的性能; 并为后续成本高昂的强化学习(Reinforcement Learning,RL)对齐阶段提供了高质量的冷启动基础,使得模型在进入RL阶段前就已具备了良好的逻辑推理框架。 最后,在对齐层面,MMaDA 提出了统一的策略梯度优化(UniGRPO)算法,为 dLLM 的强化学习开辟了新范式。该算法面向扩散模型设计,通过结合多样化的 奖励模型,实现了对推理和生成两类任务性能的统一优化,让模型能够在回答问 题、描述图像、生成图像等不同任务中都获得性能提升。此举成功突破了传统基 于人类反馈的强化学习(Reinforcement Learning from Human Feedback,RLHF) 主要适用于 AR 模型的局限,为 dLLM 的对齐优化提供了更通用的解决范式。

凭借上述架构与训练层面的创新,MMaDA 在多个基准测试中取得了极具竞争力 的结果,充分印证了其“一统多能”的设计潜力。MMaDA 论文显示,MMaDA8B 在统一模型下实现了跨领域的领先性能。在纯文本推理任务上,它超越了 LLaMA-3-7B 和 Qwen-2-7B 等同等或更大规模的强基线模型;在图文多模态理解 上,击败了 Show-1 和 SEED-X 等当时主流模型;尤为值得一提的是,在文本生成 图像任务上,其效果甚至优于业界著名的 Stable Diffusion XL(SDXL)。这些数据 表明一个仅 80 亿参数量级的统一扩散模型,在文字推理、图文问答、文本生成图 像三大类别任务上都达到了甚至超越了各领域专门模型的水平。这种“一统多能” 的表现充分显示了扩散模型在融合多模态和多任务方面的巨大潜力。这一优势部 分来源于扩散模型灵活的生成机制,例如,在图像描述到图像生成的任务中, MMaDA 可以固定提示中的关键内容或布局,以确保生成图像满足特定条件。这 是扩散模型常用于图像编辑和控制的特性,而 AR 架构通常难以如此直接地控制 局部内容。MMaDA 用实践证明了通过扩散框架训练一个统一的大模型来同时驾 驭文本和视觉任务的可行性。 作为多模态 dLLM 的开创性探索,MMaDA 在展现巨大潜力的同时,也面临着在 训练复杂度、规模上限、架构依赖及部署成本等方面的挑战。 1) 其多阶段的复杂训练流程,包括无监督预训练、有监督思维链微调、RL 后优 化等多个阶段,对数据和算力要求极高,使得模型训练成本不菲,因此其可复 现性和可扩展性有待考量。2) 虽然 MMaDA-8B 表现优异,但其参数规模与当前最大规模的多模态 AR 模型, 如数千亿参数的 Qwen3 旗舰级多模态大模型,相比仍显不足,dLLM 在更大 规模下的多模态能力上限尚未得到验证。 3) MMaDA 在架构选择上进行了一次大胆权衡,其统一扩散 Transformer 的设计 虽然实现了优雅的模态融合,但潜在代价是放弃了在主干网络中进行更精细 的、针对视觉的空间特征提取。尽管 MMaDA 通过极其复杂的后续训练弥补 了这一点,但这使得其性能的归因变得难以剥离,其卓越表现究竟有多少源自 统一架构的普适性,又有多少应归功于其极其复杂的训练策略,这本身就构成 了一种潜在的局限性。 4) 从应用角度看,MMaDA 庞大的模型体积和多步迭代的推理过程,与单模态模 型相比,为其在实际场景中的部署带来更多挑战。但是 MMaDA 项目的开源 为社区优化其推理速度、进行模型压缩等工作提供了可能。综合而言,MMaDA 作为探索多模态 dLLM 的先锋,在证明该路线可行性的同时,也为后续研究 指明了改进方向。
3. 技术路线尚处于争论之中,dLLM 不只是继承掩码生成思想, 以概率框架催生质变并与 AR 范式共存
dLLM 的出现引发了业界对于技术路线的热烈讨论。一方面,它被寄望为打破 AR 模型垄断的潜力路径;但另一方面,也有声音质疑其内核的创新性。
3.1. 观点一:dLLM 是掩码生成模型的自然演进
持此观点的研究者认为,dLLM 并非凭空出现的新范式,其核心思想与双向掩码 模型一脉相承。他们主张,dLLM 本质上是掩码生成(Masked Generation)范式在 大模型时代的自然演进与规模化升级,是一次成功的“新瓶装旧酒”。
3.1.1. dLLM 的生成思想一脉相承,其根基是 BERT 的掩码预测与 MaskGIT 的迭 代求精
这一技术路线的源头可追溯至 2018 年 Google 发布的 BERT 模型。BERT 开创性 地提出了掩码语言建模(Masked Language Model,MLM)任务,通过随机遮盖输 入文本中 15%的 token,并利用其左右双向的全部上下文信息来预测被遮盖的内 容。这一机制使得模型能学习到深度的双向语境表示,但其设计初衷是服务于自 然语言理解任务,而非直接的文本生成。 将“掩码预测”思想真正推向生成任务的,是同样来自 Google 的图像生成模型 MaskGIT。它所采用的“并行解码、置信度筛选、迭代求精”的生成范式,在理念 上与后来的 dLLM 高度一致。可以说,dLLM 在文本领域的成功,正是 MaskGIT 范式的一次高效复现与规模化应用。 与此同时,对 dLLM 理论内核的探索并未停留在简单的应用层面,其与掩码模型 的内在联系很快催生了对其理论内核的建设性简化。在另一项同期工作 RADD (Reparameterized Absorbing Discrete Diffusion)中,同样来自中国人民大学的 GSAI-ML 组从理论上证明了,掩码扩散模型中的时间变量可以被解析地分离出来, 其核心预测任务等价于一个与时间无关的、对干净数据的条件概率建模。基于这 一发现,RADD 顺势提出了一个更简洁、且能通过缓存机制大幅提升采样效率的 优化框架。这一系列工作表明,dLLM 的本质可以被理解为一个经过概率化包装 的、可迭代优化的掩码模型,而其扩散外衣下的时间依赖性在理论上是可以被剥 离的。
3.1.2. 部分研究从理论、性能和实用性三大维度,对 dLLM 的创新性提出了三大质 疑
对 dLLM 更深层次的质疑,来自英伟达团队在 ICLR 2025 上发表的一篇题为 《Masked Diffusion Models are Secretly Time-Agnostic Masked Models and Exploit Inaccurate Categorical Sampling》的论文。论文的观点即为论文标题,掩码扩散模 型本质上是时间无关的掩码模型,其性能优势则利用了不准确的分类采样机制。 该研究从理论和实践层面,对 dLLM 的技术内核提出了三大质疑。 1) dLLM 的扩散理论的根基受到挑战,被证明在数学上等价于一个更简单的、 与时间无关的掩码模型。该研究从理论上严谨地证明,作为扩散模型“关键标 志”的时间变量(Time Variable),在掩码扩散模型(MDM)的训练和采样中 并非必要。论文指出,MDM 的训练目标在数学上等价于一个与时间无关的、 更简单的掩码模型的目标。其设计的首达采样器(First-Hitting Sampler,FHS) 也证明了,dLLM 看似复杂的迭代采样过程,在理论上等价于一个更高效的、 类似掩码模型的逐 token 解码过程。这直接挑战了 dLLM 自称“扩散”模型的 理论根基,暗示其更像是一个包装精良的掩码模型。 2) dLLM 宣称的性能优势被揭示可能源于数值精度 BUG,是以牺牲多样性为代 价换来的。该论文进一步揭露,先前研究声称 dLLM 在生成困惑度(Perplexity, PPL)上超越 AR 模型的结论,很可能源于一个普遍存在但被忽视的数值精度 BUG。在常用的 32 位浮点数下,Gumbel 采样会出现数值“截断”,这无意中 起到了降低采样温度的效果,导致模型倾向于选择更高概率的 token,从而牺 牲了生成多样性来换取异常低的困惑度分数。当英伟达团队将采样精度修正 为 64 位后,dLLM 的困惑度大幅反弹,显著落后于同等规模的 AR 模型。这 一发现表明,dLLM 此前宣称的性能优势可能并非来自模型或架构的优越性, 而是一个由数值问题导致的虚假繁荣。 3) dLLM 的双向注意力架构被指存在重大缺陷,无法兼容主流 AR 模型的 KV 缓存技术,对长文本推理的扩展性构成根本性制约。KV 缓存是当今所有主流 AR 大模型在处理长文本、实现高效推理时不可或缺的核心技术。无法使用 KV 缓存,意味着 dLLM 在处理长上下文任务时,其推理成本将远高于 AR 模型, 这为其在长文本任务上的实用化与规模化扩展,构成了根本性的制约。论文甚 至犀利地指出,这一点“在大多数关于扩散语言模型的研究中被忽视或被有意 淡化了”。 这一派观点认为,dLLM 并非一个全新的范式革新。其核心思想根植于 BERT 的 掩码建模,生成策略与 MaskGIT 同源。其所披的扩散外衣,在被深入解构后,显 示出时间无关的掩码模型本质。同时,其宣称的性能优势被证明可能源于数值陷 阱,而其架构本身则存在着难以兼容 KV 缓存的实用性缺陷。因此,这更像是一 次成功的“新瓶装旧酒”,但其双向注意力的设计可能天然不适合大规模长文本推 理的场景。
3.2. 观点二:dLLM 是并行生成时代的新范式
将 dLLM 简单归为“新瓶装旧酒”,忽视了其在理论完备性、实践规模化、高级 能力对齐和技术生态融合等方面的一系列根本性突破。支持者认为,扩散大型语 言模型(dLLM)的崛起,是生成式 AI 在并行计算时代一次意义重大的范式革新。 它不仅为长期停滞的非自回归生成路线注入了全新的理论合法性,更在短时间内 展现了从理论到实践、再到高级对齐和生态融合的快速演进速度。它代表了一条 充满活力且正在高速迭代的新技术路线。
3.2.1. dLLM 以完备的概率生成理论为基石,实现了从表示学习到可度量生成的根 本跨越
支持者认为,将 dLLM 简单归因于 BERT 的复兴,是混淆了表示学习与概率生成 两个根本不同的目标。BERT 通过掩码语言建模(MLM)学习深度双向语境表示, 在自然语言理解任务上取得了巨大成功。然而,BERT 的原始设计使其难以定义 一个完整序列的联合概率分布,因此也无法像真正的生成模型那样从中直接采样 出一条全新的、连贯的句子。这一根本性的“生成能力缺位”,解释了为何业界拥 有多年 BERT 的深厚积累,但最终仍需要 AR 模型或像 Gemini Diffusion 这样的新 架构来实现高质量生成。这正是 dLLM 与 BERT 的本质区别:前者是一个完整的 生成模型,而后者是一个卓越的编码器与理解模型。 以斯坦福大学 Stefano Ermon 等人提出的 SEDD(Score Entropy Discrete Diffusion) 为代表的理论工作,通过引入得分熵损失函数,为离散的掩码生成过程提供了可 计算的证据下界(ELBO)。这一理论突破是决定性的,它意味着 dLLM 的训练拥 有了和 AR 模型一样的度量衡,即对数似然。这使得 dLLM 彻底摆脱了之前的模 型无法评估生成质量好坏的困境,成为一个可以在语言模型困惑度等金标准上与 AR 模型直接比较的、理论完备的概率生成模型。
3.2.2. dLLM 的出现激发了与 AR 生态的融合探索,为高效模型构建开辟了混合范 式新路径
除了自身迭代,dLLM 的出现也激发了学界对于“混合范式”的全新思考。近期, 来自香港大学和 UIUC 合作团队的工作,探索了如何利用一个已经预训练好的强 大 AR 模型(如 LLaMA/GPT-2)的权重,来高效地初始化一个高性能的扩散模型 (DiffuLLaMA/DiffuGPT)。它表明 dLLM 与 AR 模型并非只能是“你死我活”的 竞争关系,二者完全可以互相借鉴、融合。dLLM 的出现,不仅开辟了一条并行的技术路线,更激发了盘活现有 AR 模型资产、探索更高效模型构建方式的新思 路,为整个生成式 AI 生态带来了新的可能性。 展望未来,dLLM 与 AR 模型最可能的关系是分工与互补,而非替代与颠覆。AR 模型凭借其成熟的生态和 KV 缓存等优势,将继续在通用长文本任务中占据核心 地位;而 dLLM 则以其极致的生成速度和可控性,在代码生成、创意辅助、文本 内嵌编辑等场景中,成为不可或缺的效率引擎和专用工具,共同构成一个更多元、 更繁荣的 AI 技术生态。
4. Mercury 与 Gemini Diffusion 率先验证 dLLM 应用价值
自 2023 年底至 2025 年中,dLLM 在产业界的落地开始提速,其中最引人注目的 莫过于 Inception Labs 推出的 Mercury 系列和 Google DeepMind 发布的 Gemini Diffusion。
4.1. Mercury 以极致速度和出色代码生成能力,率先验证 dLLM 的商业 化可行性
AI 公司 Inception Labs,携其商业级 dLLM 系列 Mercury,精准切入由 AR 模型推 理延迟所主导的核心痛点,旨在以 dLLM 路线重塑 AI 应用的效率边界。该公司 的创始团队由斯坦福大学的 Stefano Ermon 教授、康奈尔大学的 Volodymyr Kuleshov 教授等人工智能领域的学者组成,拥有深厚的学术背景与理论根基。与 业界主流追求更大模型参数的竞赛不同,Inception Labs 的战略目标从一开始就异 常清晰:瞄准并解决限制 AI 应用普及的核心瓶颈:AR 模型的推理延迟。 Inception Labs 选择了 dLLM 作为核心技术路线,旨在利用其并行生成特性,以及 其在精细控制、多模态处理等方面的理论优势,为行业提供兼具高质量和极致速 度的 AI 模型。其首款产品 Mercury Coder 则精准地切入了对低延迟需求最为迫切 的代码生成领域。因为无论是代码自动补全、实时编辑,还是日益复杂的 AI 智能 体(Agentic)工作流,生成速度都直接决定了开发者的生产力与体验,是验证 dLLM 商业价值的理想场景。
在技术层面,Mercury 并未颠覆底层的 Transformer 架构,而是通过革新生成范 式来实现效率的突破。其核心技术优势体现在以下三个方面: 1) Mercury 的基础架构依然是业界主流的 Transformer,这使其能够无缝兼容和 受益于过去数年为 Transformer 开发的大量系统级优化。其真正的创新在于 训练和推理范式:模型被训练用来并行预测和修正多个 token,而非 AR 模型 逐个输出的方式。这一范式上的改变使其完全兼容现有的对齐生态,无论是 RLHF 还是 DPO,只需将损失函数替换为去噪扩散损失,即可无缝进行微调 和对齐。 2) Mercury 的生成过程是一个“从粗到细”(Coarse-to-fine)的迭代式解码。它 首先一次性生成所有 token 的草稿,然后通过多轮迭代,并行地修正和完善整 个序列 。这种方式能够更充分地利用现代 GPU 的大规模并行计算能力,实 现远高于 AR 模型的算术强度(Arithmetic Intensity),从而在硬件层面获得效 率的巨大提升。 3) 为了将理论优势转化为实际速度,Inception Labs 为 Mercury 开发了一套专 有的、高度优化的推理引擎。该引擎集成了动态批处理采样(Dynamically Batched Sampling)技术,能够根据生产负载自动平衡速度与质量的权衡。同 时,引擎内置了一系列为并行推理定制的计算核(Custom Kernels),这是其实 现超高吞吐量的关键工程保障。从用户角度出发,Mercury 提供了与 OpenAI标准兼容的 API。这种对现有生态的向后兼容性,使得开发者可以将其作为 AR 模型的直接替代品,轻松迁移现有应用,极大地降低了采纳门槛。

Mercury Coder 的性能表现,尤其是在速度与质量的权衡上,已达到了业界领先 水平。 1) 在生成速度上,其表现堪称极致。根据第三方评测机构 Artificial Analysis 的数 据,在 NVIDIA H100 GPU 上,Mercury Coder Mini 和 Small 两个版本的吞吐 量分别达到了惊人的 1109 tokens/秒和 737 tokens/秒,比市面上其他速度优化 (如 GP-4o Mini)的前沿模型平均快了数倍。
2) 在生成质量上,高速推理并未以牺牲质量为代价。在多个标准代码基准测试 中,Mercury Coder Small 的性能与前述商业模型相当。例如,在 HumanEval 基准上,Mercury Coder Small 得分(90.0)甚至高于 GPT-4o Mini(88.0)和 Claude 3.5 Haiku(86.0)。在多语言代码能力(MultiPL-E)和更复杂的 LiveCodeBench 等代码测试中,其表现也同样具有竞争力。
3) 在功能优势上,其架构的天然长板得以充分发挥。dLLM 的双向注意力机制使 其在代码填充(Fill-in-the-Middle,FIM)任务上具有天然优势,评测数据显示 Mercury Coder 在该任务上的表现全面超越了所有被评估的基线模型,,充分 证明了其架构在代码补全和编辑场景下的优越性。
4) 在真人实战中,其综合体验获得高度认可。在代码助手的真人对战平台 Copilot Arena 上,Mercury Coder Mini 取得了质量第二、延迟最低(平均 25 毫秒)的 优异综合排名,Elo 评分与顶级的 Claude 3.5 Sonnet 和 DeepSeek V2.5 处在同 一梯队。
在商业化路径上,Mercury 通过开放平台与战略合作双管齐下,旨在快速构建其 应用生态。一方面,Mercury Coder 已正式登陆 Poe by Quora 平台,让全球数百万 开发者能不仅可以不仅可以通过聊天界面直接体验其极速代码生成,而且更可以 通过 Poe API 将其强大的能力低门槛地集成到自己的应用或工作流中。通过 Poe, Mercury 获得了处理图像、文档等多模态输入的能力,极大地拓宽了其应用边界。 另一方面,Inception Labs 已成为微软 NLWeb 项目的创始合作伙伴之一。NLWeb 旨在通过自然语言界面重塑网站的交互方式,而 Mercury 超低延迟的特性,使其 成为驱动下一代企业级实时 AI 交互应用的理想选择。这项合作标志着 dLLM 技 术已获得顶级云厂商的认可,并进入了企业级实时 AI 交互应用的核心视野。
Mercury 的商业化实践不仅是 dLLM 技术从学术走向商业的里程碑,它凭借在代码生成这一关键领域的降本增效表现,成功地向市场证明了 dLLM 路线的商业价 值和技术竞争力。
4.2. Google Gemini Diffusion 是以实践验证 dLLM 独特优势来解决 AR 模型延迟瓶颈而进行的一次重要技术试水
如果说 Mercury 代表了初创公司将 dLLM 技术快速产品化的敏锐嗅觉,那么由 Google DeepMind 在 Google I/O 大会上发布的 Gemini Diffusion,则彰显了 Google 对这一技术路线的战略性投入和前沿探索。根据 Google 博客的定义,Gemini Diffusion 是一个领先的、研究性的文字扩散模型。其战略定位并非直接面向市场 的商业产品,而是 Google 在“探索构建有用 AI 的每一种途径”的宏大战略下, 为解决 AR 模型延迟瓶颈而进行的一次重要技术试水。其核心是将已在图像和视 频生成领域取得巨大成功的扩散技术,创造性地应用于文本和代码生成,目标非 常明确:在保持生成质量的同时,实现推理速度的量级提升。目前,该模型通过 AI Studio 的候补名单向部分开发者提供有限的体验权限,以收集反馈并验证其潜 力。 Gemini Diffusion 最引人注目的,是其在性能上取得的巨大突破,成功在实现极 致生成速度的同时,保持了不妥协的生成质量。在速度上,Google 博客宣称其“显 著快于我们迄今为止最快的模型”,其基准页面则揭示了高达 1479 tokens/秒的惊 人采样速度(Sampling Speed),以及一个 0.84 秒的固定启动开销(Overhead)。在 质量上,Google 特别强调速度的提升并未以牺牲质量为代价。性能基准页面将其 与速度优化模型 Gemini 2.0 Flash-Lite 直接对标,数据显示,在核心的代码生成基 准(如 HumanEval,BigCodeBench 等)上,两者均取得了极为近似的成绩;而在 LiveCodeBench 和数学能力测试(AIME 2025)上,Gemini Diffusion 甚至略微领 先。这有力地证明,Gemini Diffusion 成功地在实现数量级速度提升的同时,保持 了代码生成质量,并且显示了其在数学方面的巨大潜力。当然,Gemini Diffusion 在科学知识(GPQA Diamond)和复杂推理(BIG-Bench Extra Hard)等领域仍留 有进步空间。

Gemini Diffusion 的出现,首次由 Google 验证了 dLLM 路线相较于传统 AR 模型 的独特功能优势,尤其体现在其并行的、全局的生成机制上: 1) Gemini Diffusion 展示了迭代求精与自我修正能力。模型在生成的最初几步可 能会输出错误的中间答案,但在随后的迭代中,能够基于对问题的全局理解进 行自我修正,快速收敛到正确的逻辑和最终答案。这种动态的、非单向的反思 和修正能力,是严格从左到右的 AR 模型所不具备的,这使其在处理需要严密 逻辑推理的任务时可能更加鲁棒。 2) Gemini Diffusion 演示了全局规划与结构化文本生成能力。在生成完整的网页代码时,模型同样展现了强大的“迭代求精”能力。它并非一次性输出完美结 果,而是先并行地构建出整个 HTML/CSS 文件的宏观结构骨架,尽管其中仍 包含噪声或错误字符,然后在后续迭代中不断打磨和修正细节,直至最终呈现 出语法正确、功能完备的代码。这种“先搭框架,后填细节”的全局生成方式, 是其能够产出高质量结构化文本的关键。这与 AR 模型无法回头修改的串行 生成模式形成了鲜明对比。 这些已被验证的能力,预示着 dLLM 的应用潜力远不止于简单的代码补全,它更 像一个结构化问题解决器,能够胜任更高级的软件工程任务,例如: 1) 智能重构与现代化:根据抽象指令(如“将此函数重写为异步版本”、“将 Python 2 代码升级到 Python 3”或“将这个方法的逻辑用更具可读性的方式重构”等), 通过理解整个代码块的逻辑,按要求完成任务。 2) 自动化文档与测试:基于对已有代码的全局理解,为其生成符合规范的文档字 符串(Docstring)或单元测试用例。 3) 多语言代码翻译:实现跨语言的代码逻辑迁移,如“将这段 Java 代码逻辑用 Go 语言实现”。 这些应用都依赖于模型对全局上下文的深刻理解和在任意位置进行精确操作的 能力,这可能是其在未来专业开发辅助工具市场中,与传统 AR 模型形成差异化 竞争的关键。
5. dLLM 的技术演进正在训练策略、推理效率和对齐技术等 多个层面协同推进,以实现性能、效率与可靠性的全面提升
尽管 dLLM 展现了巨大的潜力,但要使其真正成长为可与 AR 模型并驾齐驱的主 流范式,仍需克服在训练、推理和对齐等方面的固有挑战。学术界和工业界正围 绕这些挑战,从训练策略、推理效率和对齐技术等多个维度,探索其核心优化路 径,推动 dLLM 技术快速演进。
5.1. 训练策略优化通过精细化掩码策略提升训练质量
研究人员通过更精细的训练目标与掩码策略,从根本上提升 dLLM 的学习效率。 例如,香港大学团队研发的 DREAM 7B 模型引入了上下文自适应噪声调度,根据 每个 token 的上下文信息丰富度,动态地为其分配不同的掩码难度,从而提供更 有效的学习信号。而在多模态领域,UCLA、松下 AI 研究院与 Salesforce 研究院 联合开发的 LaViDa 则提出了互补掩码(complementary masking)技术,通过为每 个样本生成两个互不重叠的掩码版本,确保所有 token 都能参与训练,提升了模 型对稀有概念的学习效率(见图 11)。 如何设计噪声引入的节奏,即掩码比例随时间变化的函数,也是一个重要的优化 方向。不同的调度方案(如线性、几何、余弦等)会直接影响训练的稳定性与最 终的生成质量。
5.2. 推理效率优化通过近似 KV 缓存和智能解码策略,攻克并行生成的 核心瓶颈
Wall-clock Time 快是 dLLM 的魅力所在,但其背后总计算量高和长文本效率低的 挑战也极为严峻。2025 年的研究正从多个根本性角度着手解决这些问题,尤其是 在攻克 KV 缓存难题上取得了突破性进展。我们已知,dLLM 的双向注意力机制 使其无法兼容 AR 模型中至关重要的 KV 缓存。然而,英伟达和香港大学团队合 作的 Fast-dLLM 提出了一种无需重新训练的块状近似 KV 缓存机制,通过缓存并 复用已确定块的 KV 状态,在性能损失极小的情况下,带来高达 27.6 倍的吞吐量 提升。英伟达和康奈尔大学团队研发的 Eso-LMs 则更进一步,通过设计全新的混 合注意力机制,首次实现了在并行扩散阶段的 KV 缓存,在长文本推理上实现了 比标准 MDM 高达 65 倍的速度提升。 同时,更智能的并行解码与重掩码机制,也为在速度和质量间取得更优平衡提供 了新途径。简单地在每步并行解码固定数量的 token,会因破坏 token 间的依赖关 系而导致生成质量下降。Fast-dLLM的研究发现,问题的关键在于对低置信度token 的错误解码。因此,它提出了置信度感知并行解码策略,在每步中,不再解码固 定数量的 token,而是只解码那些预测置信度超过某一阈值的 token,在保持高质 量的同时,能安全地实现 13.3 倍的推理加速。 苹果公司与香港大学推出的 DiffuCoder 则为推理优化提供了新的思路,通过采样 温度调控生成模式。该研究提出了自回归度(AR-ness)指标来量化 dLLM 生成过 程的顺序性,并发现提高采样温度不仅能增加 token 选择的多样性,还能显著降 低模型的自回归度,使其生成顺序更趋向并行和非线性。这为推理优化提供了一 个简单而有效的调控杠杆。 此外,重掩码(Remasking)技术则允许模型在后续迭代中重新掩盖已生成的、置 信度不高的 token,给予模型反悔和修正的机会,这能显著提升生成质量,为在速 度和质量之间取得更精细的平衡提供了新的可能。

5.3. 生成效果与对齐优化采用先进对齐框架,引导 dLLM 从“说得快” 走向“说得好、说得对”
在提升生成效果方面,研究者借鉴了图像扩散模型的成功经验,将无分类器引导 (Classifier-Free Guidance)等技术引入 dLLM,通过在推理时动态调整预测的 logit 分布,可以有效地增强生成内容的多样性和对用户提示的遵循度。 而在更核心的人类偏好对齐方面,由于 dLLM 的对数似然难以精确计算,直接套 用为 AR 模型设计的 DPO 等算法会面临梯度估计高方差的问题。针对这一难题, LLaDA 1.5 团队开创性地提出了方差缩减偏好优化(VRPO)框架,通过一系列理 论创新和方差缩减技术,首次成功实现了单模态文本扩散模型的类 DPO 偏好对 齐。而在更复杂的多模态领域,MMaDA 团队则提出了 UniGRPO 算法,实现了对 跨模态任务的统一强化学习对齐。 在 RL 对齐的探索上,DiffuCoder 项目则提出了一个更偏向工程实践、且效果显著 的 coupled-GRPO 算法(见图 15)。该算法专为代码生成任务优化,其核心是通过 一种新颖的互补掩码采样(complementary mask sampling)机制,为同一个序列生 成两个互补的掩码版本进行训练。这一设计在理论上被证明能有效降低策略梯度 估计的方差,在不依赖半自回归解码的前提下,显著提升了模型在代码基准上的 性能(EvalPlus +4.4%),是 dLLM 原生强化学习方向上的一个重要进展。
6. dLLM 正以其效率与功能优势,在代码生成等赛道率先开 启商业化
6.1. dLLM 的并行范式,正推动评估标准从传统指标向任务导向与新能 力衡量偏移
dLLM 的出现,不仅带来了新的技术范式,也对传统的语言模型评测体系提出了 挑战。如何科学、公正地衡量一个并行迭代模型的优劣,是一个重要议题。 传统的语言建模核心指标,困惑度(Perplexity,PPL),在评估 dLLM 时面临着 理论与实践的双重困境。理论上,dLLM 的训练目标是优化一个证据下界(ELBO), 而非精确的对数似然,因此其计算出的 PPL 是一个理论上的上限,这使得 dLLM 与 AR 模型在 PPL 上的直接数值比较并非完全公平。实践中,正如英伟达团队的 研究所揭示的,32 位浮点数下的 Gumbel 采样存在“数值陷阱”,会无意中降低生 成多样性从而人为地压低困惑度分数,这进一步说明单纯依赖困惑度可能会对 dLLM 的真实能力产生误判。 鉴于 PPL 的局限性,业界正日益转向以任务为导向的基准测试和人类偏好评估, 以衡量 dLLM 的真实应用价值。一方面,下游任务基准(如 HumanEval、MBPP 等)通过实际的代码编译和单元测试来评判生成结果的正确性,标准客观,更能 反映模型的真实能力。另一方面,人类偏好对战平台(如 Copilot Arena)则通过 真人盲测和偏好投票,为 dLLM 提供了与主流 AR 速度优化模型进行实战检验的 机会,这类评估超越了自动化指标,直接衡量了模型生成结果对人类用户的实际 价值。 传统评测体系难以捕捉 dLLM 展现出的许多独特优势,呼唤着全新评测标准的建 立。例如,如何量化评估一次代码重构的优劣、如何衡量模型在数学推理中的自 我修正能力、以及如何为受控生成(如风格迁移、内容填充)的精准度打分,这 些都是当前评测体系中的空白。为这些新能力设计全新的、有针对性的评测标准, 是一个重要的研究方向。
6.2. dLLM 的性能质量在中小规模下可与同等参数 AR 模型媲美,但绝 对高度尚待验证
在生成结果的质量和准确性方面,dLLM 经过近期的发展,已经展现出与 AR 模 型在同等规模下竞争的实力。在学术基准上,LLaDA-8B 在多个零样本/少样本任 务中的性能,已被证明足以与强大的开源 AR 模型 LLaMA3-8B 旗鼓相当;在更 严格的概率指标上,以 SEDD 为代表的理论模型,其语言模型困惑度也已能达到 GPT-2 的同级水平,这说明 dLLM 已攻克了此前非自回归路线在核心精度上的瓶 颈。在工业评测中,Mercury Coder 在保持极高速度的同时,代码生成质量可与 GPT-4o Mini、Claude 3.5 Haiku 等模型媲美;而 Google 的 Gemini Diffusion 同样 在代码基准上实现了与自家速度优化模型 Gemini 2.0 Flash-Lite 相当的性能;来自 苹果公司的开源研究模型 DiffuCoder,同样在多个代码基准上展现了与开源 AR 代码模型(如 Qwen2.5-Coder)相当的性能。这些事实共同传递出一个信息,dLLM 已经走出质量不如人的初级阶段,进入了可以正面比拼的竞赛场。 在绝对性能的上限上,dLLM 与业界主流大规模 AR 模型之间仍存在显著差距。 例如,在通用常识问答、开放创意写作等复杂任务上,像 Qwen3 或 DeepSeek-V3 这样经 RLHF 调校、拥有数千亿乃至万亿级参数的 AR 模型展现出难以企及的综 合能力。相较之下,当前公开的 dLLM 最大参数规模仍停留在百亿以下,其在超 大规模下的能力上限,以及能否通过大规模类 RLHF 等方法实现同等级别的对齐, 仍有待验证。这部分差距不仅是模型规模和数据量的差异,也可能源于 AR 模型 在 RLHF 对齐技术生态上的高成熟度。经过多年的发展,针对 AR 模型的对齐技 术(如 DPO 等)已相当成熟,而针对 dLLM 的对齐算法(如 VRPO)仍处于早期 探索阶段。
若跳出传统评估维度,dLLM 在某些特定任务上已展现出独特质量优势。 1) 逻辑与结构化任务:由于 dLLM 具备双向注意力,能看到全局上下文,这使 其在需要瞻前顾后的任务中表现更佳。例如,LLaDA 能有效应对“逆转诅咒”,在中文古诗词反向补全任务中表现优于 GPT-4o。同样,Gemini Diffusion 在演 示中展现的数学解题能力,也得益于其能够对解题步骤进行迭代求精和自我 修正,这是严格单向的 AR 模型难以做到的。然而,这种“并行修正”的机制, 是否能真正复现主流 AR 模型那种线性展开、自我辩驳的复杂推理过程,仍是 一个开放性问题。 2) 可控生成与编辑:dLLM 的掩码-预测机制天然适合需要精确控制的生成任务。 例如,Mercury Coder在代码填充任务中展现了超越同类AR模型的卓越性能, 模型能够根据代码的前文和后文精准生成中间部分,这是 AR 模型难以高效 实现的。 3) 多模态融合能力:MMaDA 的统一扩散架构,通过在同一个概率空间中对文本 和图像进行建模,在需要深度图文融合的推理和生成任务上,取得了超越众多 专用模型的表现。 因此,当我们谈论模型质量时,除了传统的流畅度与准确性,dLLM 在可控生成、 结构化推理和多模态融合等维度上,正开辟出 AR 模型难以企及的新优势。 综合来看,目前 dLLM 的性能质量已经达到够用乃至称职的水准。随着技术演进 和规模提升,其有望在更高参数规模上继续缩小与最强 AR 模型的差距。在此过 程中,更关键的是发挥其独特优势,与 AR 模型形成互补,共同服务于更多元的 AI 应用场景。
6.3. 并行解码在颠覆推理延迟的同时,也带来了总计算量与长文本处理 的新挑战
推理效率和计算成本是 dLLM 相较于 AR 模型最核心的战略价值所在,但其优势 背后也伴随着新的技术挑战。 dLLM 最直观的长处,在于从根本上打破了 AR 模型的串行生成瓶颈。传统 AR 模型必须逐个 token 生成,其推理延迟与输出长度大致成线性关系,在追求实时 交互的应用中是不可接受的。dLLM 则将生成过程解耦为固定(且通常很少)轮 次的并行迭代,无论目标文本多长,理论上都可以在一个固定的迭代步数内完成。 这使得 dLLM 能够充分利用现代 GPU 的并行计算能力,将端到端的 Wall-clock Time 缩短一个数量级。例如,Mercury Coder 在 H100 上实现了超过 1000 tokens/ 秒的吞吐量 ,而 Google 的 Gemini Diffusion 同样宣称能达到 1479 tokens/秒的生 成速度,这对于 AR 模型而言是难以企及的。这种速度上的跃迁,直接转化为推 理成本和能耗的显著降低,为 dLLM 在代码助手、实时内容创作等对延迟敏感的 场景中赋予了决定性的竞争优势。然而,这种效率优势并非在所有场景下都成立。 dLLM 的生成时间由一个基本恒定的启动开销(即固定的迭代步数)主导,而 AR 模型则是严格的线性增长。这意味着在生成极短文本(如聊天中的一两个词)时, AR 模型可能凭借更低的总计算延迟拔得头筹。 dLLM 还提供了一种 AR 模型不具备的灵活的计算与质量动态权衡能力。开发者 可以根据应用场景,自由调整扩散模型的采样迭代步数。在需要快速响应的场景, 可使用较少步数(如 8-16 步)快速获得足够好的结果;而在追求最高质量的离线 任务中,则可增加迭代步数来进一步精炼输出。如 SEDD 等研究明确展示,dLLM 的生成质量(以困惑度衡量)与其迭代步数(即计算量)之间存在着平滑、可预 测的权衡曲线。这种“丰俭由人”的特性,为开发者在实际部署中优化成本和用 户体验提供了宝贵的控制手段。

dLLM 同样面临着不容忽视的总计算量与工程挑战。 1) 总计算量(FLOPs)的挑战:并行解码的代价是,在每一轮迭代中,模型都需 要对整个序列进行一次完整的 Transformer 前向计算。这意味着 N 轮迭代的总 计算量(FLOPs)约等于完整序列计算量的 N 倍。因此,dLLM 虽然快,但并 不省算力,其效率优势高度依赖更先进的采样算法(如 RADD 的缓存机制和 英伟达团队的 FHS 采样器)来降低总计算次数。 2) KV 缓存不兼容的致命伤:正如英伟达团队的研究所指出的,dLLM 所依赖的 双向注意力机制,从根本上无法兼容 KV 缓存这一 AR 模型的关键优化。这意 味着在处理长上下文时,dLLM 每一步迭代的计算成本不会像 AR 模型那样得 益于 KV 缓存而大幅降低,这为其在超长文本任务上的扩展性带来了巨大挑 战。 3) 对高效工程实现的依赖:无论是 Mercury 的专有推理引擎,还是 Gemini Diffusion 背后的优化,都表明 dLLM 的高效并非唾手可得,它高度依赖于包 括动态批处理、自定义计算核、高效缓存等在内的复杂系统工程优化。
6.4. 在功能和可用性层面,dLLM 与 AR 模型各具特色,体现出互补关 系
AR 模型经过多年的发展,在连贯性和渐进式生成方面有天然的强项,而 dLLM 则在可控性和全局一致性上展现出新优势。 在连贯性与顺序逻辑上,AR 模型具备天然优势。AR 模型按自然语言的顺序逐字 生成,仿佛人类说话一样,这使它非常善于保持上下文的连贯和逐步展开复杂逻 辑。这种顺序生成符合人类思维的线性过程,因此在讲故事、写文章等需要一步 步铺陈的任务中,AR 模型更容易生成结构合理、衔接紧密的内容。而 dLLM 因 为并行填充,输出的局部顺序并非严格由左至右依赖,其生成过程中缺少一个“从 头到尾”的构思过程。因此,有人担心 dLLM 会否在非常复杂的长篇章叙事上出 现整体结构不如 AR 严谨的情况。目前尚无证据表明 dLLM 在这方面存在明显问 题,但在极端长上下文或者需要渐次引入前提的推理任务中,AR 的逐步生成可能 更符合逻辑链条。 在可控性与编辑能力上,dLLM 则展现出颠覆性优势。由于 dLLM 使用掩码机制, 它天然支持在上下文中进行局部编辑和定制。具体体现在:
1) 填空式生成(In-filling):dLLM 可以在一个已有段落的中间插入合理的文本, 只需将插入位置用[MASK]标记,模型即可基于双向上下文进行填充。无论是 LLaDA 的演示,还是 Mercury Coder 在代码填充基准测试中的卓越表现,都 证明了这一强大能力。 2) 受控文本约束:如果希望生成结果包含某个词语或满足某种格式,dLLM 可以 将这些元素作为已确定部分输入,仅对剩余部分进行扩散生成,确保要求的元 素不变,这是 AR 模型难以实现的硬约束。 3) 纠错与重写:dLLM 非常适合对已有文本做改写或纠错,例如 Gemini Diffusion 演示的模型能够通过迭代求精自我修正数学解题步骤中的错误。AR 模型虽然 也能通过读入全文再重写来做到,但效率和一致性都不如 dLLM 直接对局部 进行操作来得自然。
在全局一致性上,dLLM 的并行机制有助于避免长程依赖问题。dLLM 的并行生 成意味着模型每一步都看到全局上下文,这有助于确保输出的整体一致性,例如 在长文中保持术语统一,或者在对话中保持风格一致。AR 模型有时会因长程依赖 衰减而自相矛盾,而 dLLM 通过多轮全局优化,可以减少这种不一致。例如,LLaDA 模型能够有效解决困扰许多 AR 模型的“逆转诅咒”问题,正是在需要全局、非 顺序性理解的任务中,其双向注意力机制优势的体现。可以说,dLLM 的架构没 有生成到此即定型的特性,在最后一步完成前,它始终拥有“回头看”并调整全 局的机会。 在流式生成与交互体验上,AR 模型目前更胜一筹。AR 模型可以像打字一样逐字 输出,让用户流式地看到内容生成过程,这在聊天互动中体验很好。dLLM 目前 通常是一次性输出整段,在出结果前用户需要等待所有步骤完成。虽然其总速度 快可以部分弥补,但缺少中间逐字的反馈可能在交互上稍逊一筹。 在训练与对齐生态的成熟度上,AR 模型暂时领先。从开发者角度看,AR 模型的 训练及对齐流程已非常成熟。而 dLLM 在对齐人类偏好上仍处于探索阶段。例如, LLaDA 1.5 和 MMaDA 等模型,不得不开创性地提出 VRPO 和 UniGRPO 等全新 算法,来解决 dLLM 在强化学习中的独特挑战,这本身就证明了该领域的对齐生 态远未成熟。 AR 和 dLLM 各有长短板。AR 模型胜在顺序逻辑清晰、已有丰富的对齐优化, 适合需要一步步推理的开放式任务;dLLM 强在并行全局规划、易于控制编辑, 适合需要满足特定约束的任务和需要快速多方案生成的场景。未来的 AI 应用生 态,很可能是两者根据任务需求协同工作,而非一方完全取代另一方。
6.5. dLLM 正以其独特优势,在代码生成、生命科学等多个领域展现出 巨大潜力
dLLM 独特的技术特性,并行解码、全局注意力和可控生成,决定了其应用潜力 远不止于通用的文本续写。它在多个对效率、精度和可控性有特殊要求的垂直赛 道中,正展现出独特的、有时甚至是超越 AR 模型的价值。 1) 代码生成、文本编辑与结构化写作:这是 dLLM 最先大放异彩的领域,其核 心优势在于对结构和约束的深刻理解与精准控制。在代码生成与重构方面, dLLM 的并行性显著提升了代码自动补全的效率(如 Mercury Coder),其代码 填充和编辑能力,则天然适用于代码重构、调试和添加新功能等复杂的软件工 程任务。在文本编辑与摘要领域,dLLM 的掩码-重写机制使其成为强大的文 本编辑器,例如 EdiText 框架可实现对文本风格、情感等属性的精准调整;而 TermDiffuSum 等模型则能利用其全局注意力,生成专业性更强的领域摘要。 在风格化与约束性写作中,PoetryDiffusion 等项目已证明其可联合控制诗歌的 语义和格律,生成满足特定要求的创意内容。 2) 知识理解与复杂推理:dLLM 的迭代求精机制,被认为是一种潜在的反思过 程,这使其在复杂推理任务中展现出新的可能性。例如,Diffusion-of-Thought (DoT)等研究表明,可将 dLLM 的迭代步骤与思维链的推理步骤相对应,模 型通过对初步推理路径的全局修正与完善,模拟动态的、可修正的思考过程。 而在知识图谱等领域,DiffuCOMET 等工作也已开始利用 dLLM 从文本中生 成和推理常识知识图谱。dLLM 的并行性允许模型一次性考虑多个相关实体 及其关系,可能比 AR 模型更适合处理图状的知识结构。 3) 多模态与物理世界交互:得益于其处理并行数据的能力,dLLM 在多模态和与物理世界交互的任务中潜力巨大。一方面,如 MMaDA 所示,dLLM 可以通 过统一的扩散框架处理文本、图像等多种模态,在图文理解和文生图等任务上 取得 SOTA 级表现。另一方面,DiffVLA 等研究将 dLLM 应用于自动驾驶的 规划任务,而 VPDD 则将其用于机器人的动作策略生成。dLLM 的并行性和 全局视野正好契合了智能体根据全局环境信息进行并行规划的需求。 4) 药物发现与分子设计:这是 dLLM 最具前瞻性的应用领域之一,有望极大加 速新药研发的进程。在新药研制中,dLLM 可以处理 SMILES 串等分子序列, 通过掩码扩散来生成大量新颖的分子变体,并且可以整体上调整分子的功能 基团,使其同时满足亲和力、毒性、溶解度等多个性质约束。GenMol 和 PepTune 等项目已在多属性分子优化和治疗性肽设计等方向上展示了dLLM的有效性。 在更复杂的蛋白质工程中,DPLM-2 等模型正致力于实现蛋白质序列和 3D 结 构的联合生成与理解,未来有望根据自然语言描述的功能需求,直接设计出全 新的蛋白质序列及其 3D 构型。 5) 情感分析与数据增强:除了复杂的生成和推理任务,dLLM 在传统 NLP 任务 中也展现了作为数据增强引擎的独特价值。例如,CDA²框架利用 dLLM 的编 辑能力生成反事实样本(如将正面评论中的关键词替换为负面词汇并生成通 顺的负面评论),为跨领域情感分析提供高质量的增强数据;而 DiffusionCLS 则直接利用 dLLM 为情感分类任务生成大量带有明确情感倾向的伪样本,有 效提升了小样本场景下的模型性能。这些研究表明,dLLM 的可控生成能力使 其成为一种强大的数据增强工具,有望在金融、电商、舆情分析等领域发挥重 要作用。
dLLM 凭借其独特的技术优势,正在从代码和文本编辑等领域开始,逐步渗透到 推理、多模态交互乃至生命科学等更深、更广阔的垂直赛道,其应用前景充满想 象力。
编辑:火腿肠-
标签
- 范式
- 相关标签
- 热门文档
- 热门文章
- 本年热门
- 本季热门
- 本月热门
- 1 关于2025年国民经济和社会发展计划执行情况与2026年国民经济和社会发展计划草案的报告——2026年3月5日在第十四届全国人民.pdf
- 2 中国网络视听协会:中国网络视听发展研究报告(2026) .pdf
- 3 市场监管局:2025直播电商行业发展白皮书.pdf
- 4 房地产行业第8_9周周报(2026年2月14日_2026年2月27日):26年春节新房成交量低于23_25年,二手房成交量高于23_25年;上海优化限购、公积金和房产税政策.pdf
- 5 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 6 中国股票策略:中国最佳商业模式研究(第二版).pdf
- 1 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 2 腾讯研究院-从超级个体到超级团队:AI时代组织变革的涌现路径.pdf
- 3 兰花科创-600123-优质无烟煤龙头,煤化一体静待周期反转与技改红利释放.pdf
- 4 机械设备行业:拥抱科技,重视AI为主线的设备及硬件等投资机会.pdf
- 5 TGV玻璃基板行业动态报告:玻璃基板崛起,赋能先进封装.pdf
- 6 电力设备行业跟踪周报:锂电储能业绩亮眼、拓展AI第二增长曲线.pdf
- 7 玻璃基封装行业专题:玻璃基板有望成为先进封装新平台.pdf
- 8 投资策略-激光通信行业深度:行业现状、终端结构、市场规模及相关公司深度梳理.pdf
- 9 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 10 纺服行业周报:运动品牌Q2流水放缓,安踏、361度表现韧性强.pdf
- 1 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 2 纺服行业周报:运动品牌Q2流水放缓,安踏、361度表现韧性强.pdf
- 3 产业深度:生根与重构——2026年全球人工智能技术、政策、产业与投融资趋势全景洞察报告.pdf
- 4 房地产行业专题报告:城市更新推动高质量发展.pdf
- 5 千瓜数据-消费行业:2026年上半年热门行业数据简报.pdf
- 6 AI医疗行业2026年6月月报:AI诊断与药研资本化提速,医疗智能体加速落地.pdf
- 7 厄尔尼诺如何影响资产价格:气候风险传导、历史复盘与2026年展望.pdf
- 8 投资策略:这一次,是金银的拐点吗?.pdf
- 9 风电行业2026年中期策略报告:短期招标承压,看好“十五五”两海成长空间.pdf
- 10 宏观专题:俄乌冲突最新进展如何?.pdf
- 本年热门
- 本季热门
- 本月热门
- 1 2026年莱特光电公司深度报告:“一核双擎”打造中国电子材料领军企业
- 2 2025年医药行业2026年度策略报告:创新药产业链景气度持续提升
- 3 2026年大族激光公司研究报告:PCB消费电子利好有望助力2025_27年盈利持续增长
- 4 2026年分众传媒公司深度报告:基本盘稳固,格局优化+“碰一碰”开启成长新周期
- 5 2026年春季港股及海外中资股投资策略:分化与回归
- 6 2026年航空行业夏航季民航时刻计划详解:稳中求进,国内控总量、国际促复苏
- 7 2026年春季A股投资策略:为第二阶段上涨蓄力,时代资产不退场
- 8 2026年中银香港公司研究报告:高股息护航,财富与出海共促成长
- 9 2026年春季北交所化工新材料行业投资策略:周期迎拐点,成长正当时
- 10 2026年固收增厚产品系列报告之一:可转债基金的再定位与再解析
- 1 2026年6月人形机器人行业月报:资本化提速与量产渐近
- 2 2026年全球人工智能技术、政策、产业与投融资趋势全景洞察
- 3 2026年6月A股市场研判:AI引领向上,聚焦算力与景气延伸
- 4 2026 AI重塑影视产业:漫剧爆发与产业链重构深度解析
- 5 2026年7月A股量化择时:AI识图聚焦半导体与芯片赛道
- 6 氧化锆断供与HBM瓶颈:全球产业趋势跟踪周报(2026年6月29日)
- 7 2026 ASCO年会国产创新药双抗ADC临床数据梳理
- 8 A股2026年6月策略:景气强化与震荡上行配置建议
- 9 2026年中期医药生物行业投资策略:AI新药加速推进
- 10 宁德时代发布钠电储能方案,7月中国电池排产环比增长
- 1 2026年上半年小红书六大热门行业消费趋势洞察
- 2 2026年7月A股回调归因与底部布局策略分析
- 3 2026年8月A股策略:否极泰来蓄势进攻,科技修复与业绩高增方向并重
- 4 2026上半年小红书六大热门行业消费数据洞察
- 5 2026年A股中报业绩预告点评:全A盈利延续改善,结构性景气主导
- 6 2026年8月A股静态指标:资产联动回撤与市场情绪降温下的反攻酝酿
- 7 2026年8月煤炭行业:旺季需求带动去库,煤价上行动力渐强
- 8 2026上半年国内AI剧漫剧行业数据报告
- 9 2026年8月投资组合报告:从极致抱团到均衡修复
- 10 2026年7月费城半导体回撤超20%:2024年调整周期复盘与跨市场启示
