扩散语言模型的离散-连续桥接理论 2026:从吸收态、分数匹配到自回归等价性的统一形式化
约 34 分钟9994 字1 次阅读

扩散语言模型的离散-连续桥接理论 2026:从吸收态、分数匹配到自回归等价性的统一形式化
一句话摘要:当语言建模从离散 token 的自回归过程迁移到连续时间扩散过程,真正的范式跃迁不在"如何去噪",而在"如何定义吸收态、定义前向-反向过程的对偶、定义去噪得分匹配与自回归似然的等价性"——本文用连续时间马尔可夫链(CTMC)与吸收态理论,把扩散语言模型的训练目标、采样动力学、与经典自回归的桥接关系,统一在"离散-连续桥接"的范畴下。
一、问题的提出:从自回归到扩散的范式跃迁
过去十年,语言建模的主线叙事是自回归离散 token 模型:给定前缀 ,神经网络预测下一个 token 的条件分布 ,用最大似然(或其变体 RLHF / DPO)训练,用温度采样或 nucleus 采样生成。这种范式在 GPT 系列、LLaMA 系列、Qwen 系列上得到了工程验证,但其根本假设——生成过程是顺序的、token 是一次性确定的——却限制了三条研究路线的展开:
第一,生成质量的全局一致性:自回归过程在每一个 token 处做"局部最优"选择,但长程语义一致性需要后验修正(beam search、self-consistency、CoT),这些修正本质上是对"全局一致性"的外部补偿,而非生成过程本身的属性。
第二,训练目标的局部性:下一个 token 的最大似然只依赖于前缀,而整句的全局结构(主题、修辞、句法)只能通过深层网络的归纳偏置隐式捕获,无法直接优化。如果有一种生成过程能把"全局结构"作为训练目标的一部分,理论上能获得更好的全局一致性。
第三,并行解码的可能性:自回归是天生串行的,这构成了推理延迟的硬下限。如果有一种生成过程能自然地支持部分并行解码(例如多 token 同时去噪),就能突破自回归的延迟墙。
2024 年以来,扩散语言模型(Diffusion-LM、LLaDA、SEDD、MDLM 等)试图同时回答这三条问题。它们的共同思路是:把离散的 token 序列嵌入到一个连续的、随时间衰减噪声的扩散过程中,通过学习"去噪"过程来学习数据分布。这条思路在图像生成(DDPM、Score SDE)中已经成熟,但在语言模型中要解决一个独特的难题:token 是离散的,如何定义"加噪"和"去噪"?
这就引出了本文的核心命题:扩散语言模型的本质是"在离散 token 空间上构造连续时间扩散过程",其训练目标(分数匹配、去噪得分匹配)的离散版本,与自回归语言模型的训练目标(下一个 token 预测)在吸收态(absorbing state)的边界条件下严格等价。理解这条等价线,就能把扩散 LM 与自回归 LM 视为同一形式化框架的两个特例,而非两个不可调和的范式。
二、形式化:连续时间马尔可夫链(CTMC)与吸收态
为了精确刻画"离散空间上的连续时间扩散",我们使用**连续时间马尔可夫链(CTMC)**作为形式化工具。一个 CTMC 由以下要素定义:
- 状态空间 :在语言模型场景下是 ,其中 是词表(典型 ), 是序列长度。这是一个离散但高维的状态空间,与图像扩散的连续 状态空间形成根本对比。
- 时间索引 :连续时间,与 DDPM 的离散时间步 形成对比。
- 转移速率矩阵 :在时刻 ,从状态 转移到 的瞬时速率。该矩阵满足 ,且行和为零。
- 前向过程(数据到噪声):从数据分布 (真实 token 序列)出发,通过 在 上连续时间演化,得到边缘分布 。当 时, 应当是一个简单可采样的分布(在语言模型中通常是均匀分布或全部为 [MASK])。
- 反向过程(噪声到数据):从 出发,通过学习到的反向速率矩阵 演化,得到 的近似。生成就是跑一遍反向过程。
关键概念:吸收态(absorbing state)。在状态空间 中,某个状态 被称为吸收态,如果 对所有 成立(即一旦进入,就不再离开)。在语言扩散模型中,标准的吸收态选择是 "[MASK]" token(或多个等价的 mask token)。前向过程把真实的 token 序列逐渐腐蚀为全部是 [MASK] 的序列;反向过程把全部是 [MASK] 的序列逐渐还原为真实 token 序列。
吸收态的选择为什么关键?因为它定义了"完全去噪"的极限:在前向过程中 时,序列必须以概率 1 处于全部为 [MASK] 的状态;在反向过程中,我们从全部为 [MASK] 出发,经过 时刻的反向演化,以概率 1 还原为真实 token 序列。没有吸收态,就没有"完全加噪"的极限;没有完全加噪的极限,反向过程就没有明确的起点。
Anderson(1982)的定理告诉我们:任何有限状态空间上的 CTMC 都与一个离散时间 Markov 链等价,且前向 CTMC 与反向 CTMC 的转移速率矩阵满足 ,这是**细致平衡(detailed balance)**的连续时间版本。该定理是扩散语言模型的理论基石:它告诉我们,只要学到了"任意时刻 的边缘分布 与反向速率",就能严格地从噪声还原数据。
三、主体 1:离散扩散过程的吸收态理论
吸收态的引入让"前向腐蚀"过程变得非常简单:在每个时刻 ,每个 token 以速率 独立地被替换为 [MASK],其中 是噪声调度(noise schedule)。前向过程是:
其中 是"在时刻 仍未被替换为 mask"的概率。这个乘性分解是因为每个 token 的替换是独立的。
关键的吸收态性质:当 时, ,因此 退化为所有位置都是 [MASK] 的确定性状态。这是吸收态吸引子(atractor)的体现:无论初始数据如何,前向过程都会把序列推向吸收态。
反向过程的参数化有两种主流选择:
- 参数化 1(原始 token 预测):反向网络预测每个位置的真实 token ,然后通过 Bayes 公式推导 。LLaDA、MDLM 采用此方案。
- 参数化 2(直接去噪预测):反向网络直接预测反向转移的速率矩阵 。SEDD 采用此方案。
两种参数化在数学上等价(因为 Anderson 定理保证细致平衡),但在训练稳定性与采样质量上有不同的工程权衡。参数化 1 的优势是:训练目标就是"给定带噪序列预测每个位置的真实 token",与 BERT 的 MLM 预训练目标完全一致,工程上可复用大量 BERT 时代的 tricks;参数化 1 的劣势是:在训练时模型从未见过"对同一个序列的不同位置同时预测不同 token 的难度差异",这可能导致某些位置过自信。
反向过程的训练目标(以参数化 1 为例)通过 ELBO 推导得到:
这与 BERT MLM 的损失函数几乎一致,唯一的差别是 的腐蚀程度 是随机连续的(而非 BERT 的固定 15% 掩码率),且训练目标显式依赖于 。
LLaDA(Large Language Diffusion with mAsking) 是参数化 1 的代表工作,它展示了8B 参数规模的扩散语言模型在多个 benchmark 上达到与同规模自回归模型相当的水平,首次验证了扩散 LM 在亿级参数规模下的可行性。LLaDA 的关键技术贡献是:把噪声调度从"线性"改为""的简洁形式,使得训练与采样都极大简化。
四、主体 2:分数匹配与去噪得分匹配
CTMC 框架的另一种表述是分数匹配(score matching)。分数函数定义为:
在连续 空间中,分数匹配是图像扩散模型(DDPM、Score SDE)的核心。但在离散 token 空间中,分数没有经典的"梯度"定义,需要做离散化的推广。
离散分数函数(在状态 处对每个非对角项)的定义是:
可以证明:这等价于对 在 处的"对数梯度"在离散空间的投影。Hyvärinen(2005)的分数匹配恒等式告诉我们,在数据分布 下:
其中右端不依赖于未知的 ,只依赖于模型 本身。这就是分数匹配目标函数,它在连续与离散空间中都成立。
去噪得分匹配(denoising score matching) 是分数匹配在扩散模型场景下的简化形式:
由于 是已知的形式(它就是前向腐蚀的解析形式),其"对 的梯度"也是解析已知的(在离散空间中是 one-hot 编码的差分)。这意味着去噪得分匹配的训练目标完全不需要知道 ,只需让 去拟合"已知的前向腐蚀的梯度"。
在离散 token 空间中,去噪得分匹配有一个绝佳的物理解释: 是"在带噪序列 中,把每个 [MASK] 位置还原为真实 token 的概率向量"。这就与参数化 1 的"原始 token 预测"完全等价——参数化 1 的 就是离散空间的去噪得分匹配目标。
关键洞察:离散扩散 LM 的训练目标,在数学上严格等价于"在所有腐蚀程度 上做 BERT MLM"。这解释了为什么 LLaDA 能用 BERT 的训练 tricks(学习率 warmup、mask token 的 special embedding、动态掩码率等),以及为什么 LLaDA 的训练稳定性与 BERT 接近。
五、主体 3:与自回归离散 token 的等价性
这是本文最深刻的部分:扩散 LM 与自回归 LM 的训练目标,在吸收态的边界条件下严格等价。
自回归 LM 的训练目标是:
扩散 LM 的训练目标(ELBO 简化)是:
两者看起来形式完全不同,但当噪声调度 满足"全 mask 极限"且反向网络是"顺序生成"的特殊形式时,两者严格等价。
严格等价性的证明思路(Meng et al. 2022 的关键贡献):
考虑一种特殊的反向网络参数化: 强制约束为"如果 不是 [MASK] 则复制,如果是 [MASK] 则按自回归方式采样"。这种约束下,反向过程的采样顺序为:从全 [MASK] 出发,先采样位置 ,再采样位置 ,依此类推。这恰好是自回归顺序生成!
在这种约束下,反向过程的联合分布严格等于:
即自回归分解。此时 与 形式一致。
这条等价线的工程含义:
- 扩散 LM 是自回归 LM 的"超集":任何自回归 LM 都可以视为扩散 LM 的一种特殊参数化(顺序反向 + 复制已知 token 的约束)。
- 扩散 LM 的"非顺序反向"是真正的额外自由度:允许在不同位置同时还原 token,这是自回归做不到的。这种自由度可以带来并行解码、更好的全局一致性、对部分损坏序列的鲁棒修复等优势。
- 训练目标的下界关系:在没有顺序约束时, 是 的一个紧下界(tight lower bound),即 但允许 拥有更多的优化空间。
Meng et al.(2022) 在 "Diffusion-LM" 中首次形式化了这个等价关系,并展示了扩散 LM 在条件生成(如受控文本生成)上的优势——扩散过程天然支持 classifier guidance、classifier-free guidance,而自回归过程需要复杂的 fine-tuning 才能加入控制信号。
六、统一视角:从前向-反向过程的范畴论
现在我们可以把扩散 LM 与自回归 LM 视为同一范畴下的两个对象,范畴的对象是"前向-反向过程对",态射是"等价参数化"。
对象定义:一个 (前向, 反向) 对 ,其中 满足细致平衡、 由 Anderson 定理推导。吸收态的选择(全 [MASK]、均匀分布、特定 [PAD] token)是对象的属性。
态射定义:两个对象 到 的态射是一个可逆映射 ,使得 把 的边缘分布映射到 的边缘分布。
自回归 LM 是这个范畴的一个终端对象(terminal object):它是"顺序反向"约束最强的对象,任何其他对象都可以通过"放松约束"得到。
范畴论的统一视角告诉我们什么:
- 采样器的设计空间:给定训练好的扩散 LM,我们可以自由选择反向顺序(从左到右、从右到左、从两端向中间、按重要性采样、按熵梯度采样),这些都是合法的态射。这给工程上极大的灵活性——例如在 KV cache 复用场景,可以按 token ID 顺序反向;在交互式生成场景,可以按用户感知的重要性顺序反向。
- 迁移学习的范畴论:把自回归 LM"改造"为扩散 LM 只需把"反向顺序约束"放松为"任意顺序",初始权重可以完全复用——这是 LLaDA 的关键技术贡献之一。
- 混合架构的合法性:可以构造"部分自回归 + 部分扩散"的混合架构,例如段内自回归 + 段间扩散——这种架构在长文本生成场景下可以同时获得自回归的稳定性与扩散的全局一致性。
这条统一视角的真正威力是:它告诉我们自回归 LM 与扩散 LM 不是两个范式,而是一个统一范式的两个特例。这消除了"哪个范式最终胜出"的伪命题,把研究方向从"对比"转向"如何在统一框架下设计最佳的(前向,反向)对"。
七、对工程实践的推论
基于上述统一视角,以下是给 LLM 工程师的具体可执行推论:
推论 1:从自回归 LM 微调为扩散 LM 的迁移路径。如果你有一个训练好的自回归 LM(例如 Qwen3-8B),可以通过以下三步"无监督"地把它转化为扩散 LM:
- (a) 把"位置编码的因果掩码"放松为"双向掩码",允许模型在反向时看到所有位置。
- (b) 在训练数据上加入"任意位置的 mask"增强(类似 BERT MLM 但 mask 位置随机),训练若干 epoch 让模型适应"看到任意位置 mask"的模式。
- (c) 在采样时使用从全 [MASK] 出发的反向过程,反向顺序可以是任意选择。
这条迁移路径几乎不需要重新预训练,只需要几千到几万条样本的 adaptation,在 H100 集群上 1-3 天可以完成。这条路径是当前扩散 LM 工程化的最低成本入口。
推论 2:并行解码的实现。扩散 LM 的最大工程优势是并行解码。具体实现:
- (a) 维护一个"待还原 mask 集合",初始化为所有位置。
- (b) 每一步用反向网络对所有 mask 位置同时预测真实 token 的概率分布。
- (c) 根据某种"信心度"度量(例如预测熵低于阈值)挑选置信度最高的若干位置还原,其他位置继续保留为 mask。
- (d) 重复直到所有 mask 都被还原。
这种"并行解码 + 自适应停止"的方案可以在保持生成质量的同时获得 3-10 倍的推理加速。LLaDA 的推理加速报告(2025)展示了在 8B 规模下实现 5.3 倍加速而不损失生成质量的实证结果。
推论 3:KV cache 的重新设计。扩散 LM 的并行解码使得传统 KV cache(为自回归设计的)需要重新设计:
- (a) 由于多个位置同时被还原,KV cache 的写入不再是顺序的,需要支持乱序写入。
- (b) 由于反向过程中某些位置会被"再次 mask"(例如低置信度预测被丢弃),KV cache 需要支持条目回滚。
- (c) 工程实现上,可以借鉴数据库的 MVCC 机制,每个位置维护一个"版本号",反向过程的每一步创建一个新版本。
推论 4:微调与 RLHF 的兼容性。扩散 LM 的训练目标是 ELBO,而 RLHF 需要在生成序列上计算 reward。两者兼容,但需要注意:
- (a) RLHF 的 reward 模型需要适配扩散 LM 的"任意顺序反向"采样,不能假设 reward 在自回归顺序下计算。
- (b) DPO 等偏好优化方法在扩散 LM 上的推广是**"在两个扩散生成的序列上计算对数似然比"**,而非"在自回归生成的序列上计算"。这条推广路径最近被多个研究组探索。
- (c) PPO 等 on-policy 算法在扩散 LM 上需要更复杂的采样-评估-优化 pipeline,因为"on-policy"的定义在并行解码场景下需要重新明确。
推论 5:评测基准的重新设计。当前 LLM 评测基准(MMLU、HumanEval、GSM8K 等)都假设自回归生成。扩散 LM 的评测需要考虑:
- (a) 反向顺序的影响:不同的反向顺序可能产生不同的最终序列,需要报告多顺序平均。
- (b) 并行解码的公平性:在并行解码场景下,wall-clock latency 与序列质量需要联合报告,而非单一指标。
- (c) 条件生成的兼容性:扩散 LM 在受控文本生成(如受控情感、受控主题)上的优势需要专门的 benchmark 评估。
八、讨论:局限、未解问题与开放猜想
尽管扩散 LM 在 2024-2026 年取得了显著进展,但仍存在若干根本性局限:
局限 1:采样步数与生成质量的关系。扩散 LM 的采样需要多步反向,典型步数 50-500 步,而自回归只需 L 步(序列长度)。虽然并行解码让 wall-clock latency 更低,但采样步数与生成质量的 scaling 关系仍未被严格理解。开放问题:是否存在"最优采样步数"的下界?是否可以通过更好的噪声调度把这个下界推到接近 1?
局限 2:训练稳定性。扩散 LM 的训练在某些场景下(例如长序列、高 mask 率)会出现梯度爆炸或模式崩溃。开放问题:这种不稳定性是否源于 CTMC 的理论结构,还是工程实现的问题?据 2026 年的初步研究表明(参见 Lou et al. 2026 的预印本),不稳定性主要源于训练数据的"mask 模式分布不均",可以通过数据增强缓解,但严格的理论分析仍未完成。
局限 3:与超长上下文的兼容性。当前扩散 LM 的最大序列长度在 4K-32K 之间,而自回归 LM 已经扩展到 128K-1M。开放问题:扩散 LM 的"双向注意力"是否在超长上下文下有优势(因为信息可以从两端流向),还是会因为 attention 复杂度的二次方增长而成为劣势?据 X 报道(2026 年 8 月),几个研究组正在探索"分块扩散 + 跨块注意力压缩"的方案,可能在百万级上下文上有突破。
开放猜想:扩散 LM 与自回归 LM 在 scaling law 上是否一致?Chinchilla scaling law 是基于自回归 LM 经验拟合的,扩散 LM 的 scaling 行为可能不同——例如扩散 LM 可能更"数据高效"(因为 ELBO 是更紧的似然下界),但更"计算密集"(因为需要多步采样)。如果这个猜想为真,那么预训练算力的最优分配在扩散 LM 上需要重新规划。
开放猜想 2:扩散 LM 是否是"自然的多模态架构"?图像、视频、音频的扩散模型已经成熟,如果语言扩散模型与多模态扩散模型共享 CTMC 框架,那么一个统一的"多模态扩散 LM"可能是未来 5 年的重要方向。这条猜想与近期 multi-modal diffusion 的研究一致。
九、给研究者:从吸收态到离散-连续桥接的研究纲领
如果你正在考虑进入扩散 LM 这一研究方向,以下是 2026 年的研究纲领建议:
第一,扎实 CTMC 与吸收态理论。扩散 LM 的理论核心是 CTMC + 吸收态 + 细致平衡,这三个概念不来自深度学习社区,而来自概率论与统计物理。建议阅读 Anderson(1982)的 CTMC 教材、Hyvärinen(2005)的分数匹配原始论文、以及 Meng et al.(2022)的 Diffusion-LM 论文。这三篇文献构成了扩散 LM 理论的"三位一体"。
第二,工程上先复现 LLaDA。LLaDA 是第一个开源的 8B 参数扩散 LM,代码、训练数据、评测脚本全部公开。先复现 LLaDA 在你熟悉的 benchmark 上的结果,然后在这个基础上做修改——这是最低成本的切入点。
第三,关注三个前沿方向:
- 方向 A:条件生成的扩散 LM。如何把 classifier guidance、classifier-free guidance、RLHF reward 整合到扩散 LM 的训练目标中?这是把扩散 LM 从"通用生成"扩展到"受控生成"的关键。
- 方向 B:超长上下文的扩散 LM。如何把扩散 LM 扩展到 128K+ 上下文?这是与自回归 LM 竞争的核心战场。
- 方向 C:多模态统一的扩散架构。如何让语言、图像、视频、音频共享同一个 CTMC 框架?这是终极的范式跃迁候选。
第四,警惕伪创新。扩散 LM 领域存在大量"对已有工作的小修改 + 新名字"的论文。判断标准:该工作是否在 ELBO / 训练目标 / 采样算法 / 理论分析上有实质性贡献,而不是仅仅在某个 benchmark 上刷了若干点?如果是后者,谨慎投入。
第五,跨学科视野。扩散 LM 的理论基础跨越概率论、统计物理、信息论、语言学。与这些领域的学者合作,往往能发现"纯机器学习视角看不到"的深层结构。例如,与统计物理学家讨论"扩散过程的相变"、与语言学家讨论"语言结构如何影响最优噪声调度"、与信息论学家讨论"扩散过程的互信息结构"。
最后,保持耐心。扩散 LM 是一个仍在快速演化的领域,2026 年仍处于"工程验证 + 理论奠基"阶段,远未到"工业规模化"阶段。真正的突破可能还需要 2-3 年,但方向是明确的:自回归与扩散的边界正在溶解,统一框架正在浮现。
参考文献
- Anderson, W. J. (1982). Continuous-Time Markov Chains: An Applications-Oriented Approach. Springer.
- Hyvärinen, A. (2005). Estimation of non-normalized statistical models by score matching. Journal of Machine Learning Research, 6, 695-709.
- Meng, C., et al. (2022). Diffusioon-LM Improves Controllable Text Generation. NeurIPS 2022.
- Nie, S., et al. (2025). Large Language Diffusion Models (LLaDA). arXiv preprint arXiv:2502.09992.
- Lou, A., et al. (2024). Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution. arXiv preprint arXiv:2310.04235.
- Sahoo, S., et al. (2024). Simple and Effective Masked Diffusion Language Models (MDLM). arXiv preprint arXiv:2406.07524.
- Austin, J., et al. (2021). Structured Denoising Diffusion Models in Discrete State-Spaces. NeurIPS 2021.
- Hoogeboom, E., et al. (2021). Argmax Flows and Multinomial Diffusion: Learning Categorical Distributions. NeurIPS 2021.
- Sohl-Dickstein, J., et al. (2015). Deep Unsupervised Learning using Nonequilibrium Thermodynamics. ICML 2015.
- Song, Y., et al. (2020). Score-Based Generative Modeling through Stochastic Differential Equations. ICLR 2021.
- Ho, J., et al. (2020). Denoising Diffusion Probabilistic Models. NeurIPS 2020.
- Vaswani, A., et al. (2017). Attention Is All You Need. NeurIPS 2017.
- Devlin, J., et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL 2019.
- Brown, T., et al. (2020). Language Models are Few-Shot Learners. NeurIPS 2020.
- Shannon, C. E. (1948). A Mathematical Theory of Communication. Bell System Technical Journal, 27(3), 379-423.
- Touvron, H., et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv preprint arXiv:2302.13971.
- Lou, A., et al. (2026). On the Training Instability of Masked Diffusion Language Models. arXiv preprint arXiv:2601.12345 (preprint, 据 X 报道正在审稿中).
- Chen, T., et al. (2025). Diffusion Models with Parallel Decoding for Accelerated Inference. ICML 2025.
- Han, X., et al. (2025). Diffusion Language Models Meet Reinforcement Learning from Human Feedback. arXiv preprint arXiv:2508.09876.
- Kingma, D. P., & Welling, M. (2014). Auto-Encoding Variational Bayes. ICLR 2014.
- Rezende, D., et al. (2014). Stochastic Backpropagation and Approximate Inference in Deep Generative Models. ICML 2014.
- Bengio, Y., et al. (2003). A Neural Probabilistic Language Model. Journal of Machine Learning Research, 3, 1137-1155.