扩散语言模型的时间反演理论
约 30 分钟8834 字3 次阅读

扩散语言模型的时间反演理论:从吸收过程到并行生成
扩散语言模型真正值得研究的地方,不是把自回归解码换成更多采样步骤,而是重新定义“一个 token 何时应该被确定”以及不确定性如何在离散状态空间中流动。
一、问题的提出:为什么离散文本需要连续时间
自回归语言模型把文本生成写成严格的左到右过程。给定前缀后,模型预测下一个 token,再把结果写回上下文,重复这一过程。这个范式的优势是目标清晰、训练稳定、概率分解天然成立;它的代价也同样清楚:序列长度决定了最小串行步数。即使 GPU 拥有大量并行算力,生成一段文本时仍必须等待前一个位置完成。
扩散语言模型提出了另一种问题表述:先把完整序列逐渐变成噪声或掩码,再从高噪状态逐步恢复出干净序列。恢复过程可以同时处理许多位置,因此它有希望把“长度带来的串行瓶颈”转化为“少量全序列迭代”。不过,图像扩散中的连续像素空间与文本的离散 token 空间并不等价。文本不能简单地加高斯噪声;一个 token 通常只能处在有限词表中的某个类别,掩码、替换、删除和离散跳转都对应不同的随机过程。
据公开论文与公开代码的常见设计,离散扩散模型大致分成掩码吸收过程、均匀替换过程、离散 token 跳转过程,以及与非自回归掩码预测结合的混合过程。不同路线都试图解决同一个理论问题:如何定义一个前向随机过程,使逆过程既可学习,又能在有限步数内恢复长文本。
本文采用“时间反演”作为主线。这里的时间不是物理时间,而是噪声强度、掩码比例或状态混乱程度的统一坐标。我们关心四件事:前向过程是否保留足够的信息,逆向网络学习的究竟是 token、噪声还是条件分布,采样步数如何影响误差,以及并行生成是否真的改变了计算复杂度,而不只是把串行循环搬到更大的批次中。
二、形式化:吸收过程、发射过程与概率流
设词表为 ,增加一个特殊掩码状态 ,离散状态空间为 。对长度为 的序列 ,最简单的掩码吸收过程在时间 以概率 保留原 token,以概率 将它变成 。于是每个位置的前向分布为
当 、 时,终点几乎全部是掩码。重要的是,这个过程具有吸收性:一旦 token 被掩码,前向过程不会再次把它恢复成原 token。吸收性使后验计算比较简单,也让训练可以从任意噪声等级采样,而不必真实运行完整前向链。
如果使用一般离散马尔可夫链,前向转移可以写成矩阵 。每个 token 类别都是一个状态,矩阵中的元素表示从状态 跳到状态 的概率。掩码吸收只是其中一种特殊结构。均匀替换过程会把 token 送入其他词表类别;语义相似替换则可能依据词表距离、嵌入相似度或预先定义的通道进行跳转。过程越复杂,理论表达能力可能越强,但逆向后验和训练方差也会随之增加。
逆过程由参数化分布 表示,其中 可以是提示、前缀、条件标签或已经确认的 token。对掩码吸收过程,网络通常预测原始干净 token 的分布 ,再通过解析后验计算前一步状态。这样做有一个直观解释:模型不是直接猜“下一步要填什么”,而是在当前可见内容下估计每个位置的完整候选分布。
这种参数化还带来一个关键差异。自回归模型的条件熵主要围绕下一个位置展开;扩散模型的条件熵分布在所有尚未确定的位置上。若第 个位置的分布熵为 ,一个自然的确定策略是优先写回低熵位置。低熵位置相当于高置信度锚点,锚点被写回后,又可能降低邻近位置的不确定性。于是解码不再是固定顺序,而是一种由条件信息驱动的动态偏序。
从概率流角度看,连续时间离散过程可以由生成矩阵 描述。对状态概率向量 ,有
逆向过程并不是简单地把 取负号,因为随机过程的时间反演还依赖于当前边缘分布。理想逆过程需要知道状态之间的流量,并根据当前模型估计对每条边的反向强度。实践中的神经网络承担了这个估计任务:它通过上下文预测哪些位置应当发射 token、哪些位置仍应保持不确定。
因此,“去噪”一词容易造成误解。对文本而言,去噪既包括从掩码状态发射到词表状态,也包括在已有 token 错误时重新打开它、改变其类别,甚至删除一部分低质量内容。只允许掩码填充的模型更像吸收过程的逆;允许反复替换的模型则更接近一般随机流的时间反演。
三、从扩散语言模型到掩码建模的统一
掩码语言模型通常在随机位置遮挡 token,让 Transformer 根据剩余上下文预测被遮挡内容。表面看,它是一个单步训练目标;扩散语言模型则强调多个噪声等级和多步恢复。但二者可以在同一框架中理解:掩码比例是时间变量,随机遮挡是前向过程,模型输出是逆过程对干净 token 的估计。
设掩码率为 ,从训练序列中采样掩码集合 。最基本的损失为
当不同 被赋予适当权重时,这个损失可近似离散扩散的变分目标。低掩码率训练模型进行局部修补,高掩码率训练模型在严重缺失信息时建立全局结构。二者缺一不可:只训练低噪声,模型容易过度依赖邻近文字;只训练高噪声,模型可能学会生成主题相关但结构松散的片段。
统一视角还解释了为什么“随机掩码比例”并不只是数据增强。它是在训练阶段覆盖不同条件熵的任务分布。对于简单句子,较高掩码率仍可能保留足够线索;对于程序、数学证明或长篇论证,较低掩码率也可能造成关键变量断裂。一个固定的均匀时间采样未必是最优的,训练应当让不同噪声等级的梯度贡献与实际采样访问频率匹配。
在吸收过程里,模型预测 往往比预测前一步 更稳定。原因是任意时刻的干净 token 都有明确语义,而“前一步状态”依赖于噪声日程的离散化。另一方面,直接预测 可能导致高噪声阶段过度自信。工程上常见的补救包括温度校准、按时间加权的交叉熵、对低置信度位置保留掩码,以及在采样时使用候选集而不是立即采纳 top-1。
这也带出一个重要的模型选择问题:扩散语言模型是否必须使用专门的新架构?截至本文写作日期,公开路线多数仍可复用 Transformer 的双向注意力骨干,变化主要发生在训练目标、噪声过程和采样器。双向注意力使模型在每次迭代看到全序列,这是并行修复的直接来源;但它也意味着每一步都可能产生全 的注意力开销。因此,扩散目标解决的是“位置之间能否并行确定”,并不自动解决“每次全序列计算是否昂贵”。
一个更完整的统一可写成三层:第一层是状态空间,决定 token 如何被破坏和恢复;第二层是信息观测,决定模型在当前时间能看到什么;第三层是调度策略,决定哪些位置在何时被写回。传统掩码语言模型主要固定前两层的单步版本,扩散语言模型则把三层都显式化。研究创新可能发生在任何一层,而不是只有网络结构本身。
四、采样步数、误差传播与生成质量
扩散模型的核心承诺是用少量全序列迭代替代大量单 token 迭代,但“少量”不是免费获得的。若每一步只确定一小部分位置,最终仍需要许多轮;若一步确定过多位置,早期错误会成为后续上下文的一部分,造成误差锁定。采样器的任务是在并行度和错误可逆性之间选择平衡点。
设第 轮有 个尚未确定的位置,模型为这些位置给出置信度 。最简单的策略是固定比例写回:每轮确定约 个位置,剩余数量近似为 。这种策略的轮数由最小粒度和目标残差决定,但它没有利用样本难度。另一种策略按照熵排序,仅写回满足 的位置。阈值随时间变化,可以在早期保守、后期激进。
错误传播可以用一个简化的影响矩阵表示。设已确认 token 的错误指示向量为 ,下一轮错误为
其中 表示已写回错误对其他位置的影响, 表示当前轮新引入的独立误差。当谱半径 时,错误影响会衰减;当它大于一时,局部错误可能扩散成全局结构破坏。真实模型当然不是线性系统,但这个近似提醒我们:置信度不仅要反映单点准确率,还要反映该位置作为上下文锚点时的传播风险。
因此,最优确定顺序未必是单纯的低熵优先。一个语法连接词的熵可能很低,但它对全局内容的影响很小;一个变量名或函数签名的熵可能略高,却会决定后续十几行代码。可以为位置定义风险调整后的分数:
其中 是位置对未来预测的影响估计。影响可以来自注意力汇聚、梯度敏感度、扰动实验,或廉价的局部一致性检查。这个方向把扩散采样从“置信度排序”推进到“价值排序”。
可逆性是另一个关键变量。若采样器允许对已经生成的 token 重新掩码,那么错误不会永久锁定,但计算量和生成抖动会上升。局部重采样可以只打开低一致性区域,例如括号不匹配、引用断裂、代码类型冲突或证明步骤缺失的位置。它类似一种离散的局部 Langevin 修正:不重新生成全局序列,而是让不稳定区域重新进入噪声状态。
生成质量与步数之间通常不是线性关系。少数几步解决高层主题和段落结构,更多步骤用于词汇、语法和局部约束。若把质量收益写为 ,常见情形是前几步收益很大,随后边际收益递减。于是固定步数并不适合所有样本;更合理的策略是当全局一致性和局部不确定性都低于阈值时提前停止。
需要谨慎的是,公开实验中的“速度提升”可能混合了不同因素:批量大小、硬件利用率、输出长度、质量阈值和后处理成本都可能改变结论。若只比较单次 wall-clock,而不报告 token 数、网络前向次数、并行度、峰值显存和质量约束,就无法判断收益来自算法,还是来自更宽的计算配置。未公开验证的性能宣称不应直接外推到生产场景。
五、训练目标:ELBO、加权交叉熵与可学习噪声日程
离散扩散训练可以从变分下界出发。给定前向分布 和逆模型 ,负对数似然可由一系列 KL 项和重构项上界。实际实现通常不会逐项精确计算全部后验,而是选取随机时间 ,训练网络预测干净 token 或对应的转移分布。
预测干净 token 的交叉熵具有工程简洁性,但不同时间的损失尺度并不相同。高噪声阶段的可预测信息少,低噪声阶段的 token 细节多;若直接平均,模型可能把容量集中在容易的低噪声任务上。时间权重 的作用就是重新分配梯度。合理的权重应考虑信噪比、后验方差、采样器访问概率和不同时间的有效 token 数。
一个常见的设计是按信噪比加权,使模型在高噪声阶段学习全局恢复,在低噪声阶段学习精细修补。另一个设计是按掩码比例对位置加权,避免在高掩码率下因为监督位置太多而支配总梯度。还有研究会对困难样本或高不确定性位置增加权重,形成类似困难负例挖掘的训练机制。
噪声日程决定了任务难度如何随时间变化。若掩码率在前半程下降过快,模型会在很少的迭代中面对近乎完整的序列,逆过程的中间状态稀疏;若下降过慢,采样需要很多轮才能从大范围掩码进入可读文本。固定线性日程只是方便的起点,不代表它对所有长度、领域和模型规模都最优。
可以把日程视作一个控制变量,通过验证集估计每个时间段的预测熵、校准误差和梯度范数,再调整下一轮时间分布。若某个时间段损失很低但采样访问频率高,可能意味着训练浪费;若某段损失下降缓慢且错误传播严重,应增加样本或改变权重。这样的自适应日程让训练目标与采样器形成闭环,而不是各自独立调参。
数据分布也会改变最佳日程。自然语言的冗余较高,模型能依赖语义和句法恢复缺失 token;代码的局部约束更强,一个标点、缩进或变量声明可能具有高影响力;数学推导则更依赖全局符号一致性。单一日程在三类数据上产生的条件熵曲线不同,混合训练时更应关注领域条件分布,而不是只看总体平均损失。
训练阶段还必须处理“模型学会复制输入”的风险。低噪声样本中,邻近 token 足以决定目标,模型可能通过局部拷贝获得很高准确率,却没有形成长程规划能力。可以使用跨度掩码、结构感知掩码、语义单元遮挡和跨段重排,提高任务对全局建模的要求。对于代码,可按函数、类或依赖关系遮挡;对于证明,可遮挡中间引理而保留结论和条件,检验模型是否学到约束之间的关系。
六、与自回归 Transformer 的计算边界
扩散生成常被描述为“并行生成”,但需要区分三个层次。第一,位置级别是否可以同时预测;第二,预测结果是否需要串行验证;第三,每次全序列前向的成本如何随长度增长。只有第一层被并行化,并不意味着端到端延迟一定低于自回归模型。
对长度为 的序列,自回归解码大约需要 次增量步骤,每一步可利用 KV Cache 将已有上下文的重复计算降下来。扩散解码可能需要 次全序列前向,每次注意力成本近似与 相关,虽然 ,但当序列很长时,二次项会重新成为主导。若采用稀疏注意力、块状注意力或状态空间模块,扩散方法才可能同时降低串行深度和单步复杂度。
另一个边界是 KV Cache 的可复用性。自回归模型追加一个 token 时,历史 token 通常不变,因此缓存非常稳定。扩散模型每轮可能修改任意位置,前缀和后缀都会变化,缓存失效更频繁。工程实现可以将已冻结区域分块缓存,只对活跃窗口重新计算;但如果修改位置跨越大量块,缓存收益会迅速下降。
扩散模型更适合具有全局约束的任务,例如填空、编辑、结构化重写和长文本规划。它可以同时看到左右上下文,对中间内容进行双向修正。自回归模型更适合严格流式输出、无限长对话和低延迟首 token 场景。两者并非简单替代关系,混合解码可能更现实:先用自回归方式生成骨架,再用扩散式局部修补提升一致性;或者对高置信度前缀采用缓存,对中间草稿使用并行重采样。
从 scaling 角度看,扩散模型的有效计算量应写成“每轮活跃 token 数 × 前向次数 × 注意力代价”,而不是只报告采样轮数。随着模型规模增加,单次前向质量提升可能减少所需轮数;但更大的 hidden size 又提高每轮成本。真正值得比较的是在固定质量、显存、吞吐和尾延迟约束下的 Pareto 前沿。公开结果如果没有统一的质量门槛和长度分布,不能直接支持“扩散必然更快”的结论。
七、工程实现:并行解码、局部重采样与停止准则
一个可落地的采样器需要把理论分布转成调度器。初始化时,系统创建长度为 的掩码序列,并维护每个位置的状态、置信度、最近一次修改时间和一致性分数。每轮前向得到词表分布后,不应只保存 top-1,还应保存 top-k 候选、熵、边际概率和必要的校验信息。
第一类调度器是固定比例调度。它实现简单、吞吐稳定,适合基准测试和批处理。第二类是置信度阈值调度,只有超过阈值的位置才会被冻结。第三类是预算调度,在总轮数固定的情况下,为困难区域保留更多修复机会。第四类是约束调度,将语法解析器、类型检查器、JSON 校验器或引用一致性检查器接入采样环路。
局部重采样是生产系统中最有价值的机制之一。每轮生成后,系统定位低一致性区域,将其重新置为掩码,并扩大一个有限邻域,防止错误边界被固定。邻域大小不能无限增长,否则局部修复会退化为全局重生成。可使用指数衰减的重采样预算:第一次发现问题时打开较小窗口,连续失败后才扩大窗口;超过最大次数则回退到自回归修复或请求人工检查。
停止准则至少应包含三类信号。第一是统计信号,例如平均熵、最大熵和候选边际概率。第二是结构信号,例如括号平衡、段落完整性、代码可解析性和 schema 合法性。第三是稳定性信号,比较连续两轮的 token 变化率和局部编辑距离。当变化率很低但结构检查仍失败时,说明模型可能陷入错误固定点,不能仅靠“再采样一轮”解决。
并行系统还要处理批次内样本难度不同的问题。若一批样本共享最大轮数,简单样本会提前完成但占用资源,困难样本则拖长尾延迟。动态批处理可以在每轮移除已完成样本,把新请求补入空位;但不同时间等级和长度的样本混合后,显存碎片与 kernel 形状变化会增加实现复杂度。稳定生产版本应记录每轮活跃 token、重采样比例、缓存命中率和停止原因。
安全性也不能被当作后处理。扩散采样可能在中间状态短暂产生敏感内容或越权指令,如果工具调用、外部检索或执行器读取中间文本,就会出现“尚未收敛的草稿被消费”的风险。正确做法是区分草稿态和提交态:中间状态只能进入隔离的评估器,只有通过完整性、安全性和权限校验后才可对外输出或触发工具。
八、理论局限、可证伪预测与研究路线
第一项局限是离散时间反演的近似误差。连续时间公式可以提供漂亮的统一视角,但实际模型使用有限层数、有限步数和离散 token,理论上的无穷小转移并不会直接实现。步长过大时,逆过程可能跨越多个结构变化;步长过小时,前向次数又增加。需要建立针对离散状态空间的误差界,而不是直接套用连续扩散的直觉。
第二项局限是置信度的可校准性。模型概率高不等于位置适合被冻结。一个局部正确的 token 可能破坏全局约束;一个概率不高的 token 可能是唯一能维持远距离一致性的选择。未来应把 token 概率、影响范围、可逆成本和外部验证结果联合成决策分数,并在不同领域上做可靠性校准。
第三项局限是长度外推。训练时常见长度、采样时更长长度,会改变掩码比例、注意力模式和错误传播路径。扩散模型可以并行填充长序列,但并不自动学会长程规划。需要研究长度、噪声日程和有效感受野之间的耦合,尤其要报告不同长度下的质量、迭代次数与显存,而不是只给平均分。
第四项局限是数据与目标的错配。如果训练数据中的缺失模式主要是随机 token 掩码,模型未必适应真实编辑中的连续段落缺失、代码块替换和跨章节重写。可证伪的预测应明确提出:结构感知掩码在结构化任务上应减少重采样次数;自适应时间权重应降低长序列尾延迟;风险调整的冻结策略应降低局部高置信度但全局错误的比例。若实验不能支持这些预测,理论就只是叙事。
研究路线可以分为三层。基础层研究离散生成矩阵、可逆性和有限步误差;算法层研究自适应日程、价值驱动的确定顺序和局部重采样;系统层研究缓存分块、动态批处理、异构校验器和安全提交协议。三层必须共同推进,否则理论无法进入真实服务,工程技巧也无法解释何时有效。
九、给研究者与高级工程师的实验清单
第一,建立与自回归模型公平的基线。固定模型规模、数据、输出长度、硬件、质量门槛和 batch size,分别报告首 token 延迟、完整响应延迟、吞吐、显存和尾延迟。不要只比较理论前向次数。
第二,做完整的噪声时间消融。至少比较线性、余弦、分段和自适应日程,记录每个时间段的损失、熵、校准误差和采样访问频率。若某个日程在平均分上更好,必须进一步解释它是否只是改变了有效计算预算。
第三,测量错误传播。人为注入一个低置信度错误或结构错误,观察它影响的 token 数、重采样轮数和最终恢复概率。对代码、数学、自然语言分别测试,因为三者的约束传播性质明显不同。
第四,测试局部重采样的价值。比较无重采样、固定窗口、扩张窗口和风险驱动窗口,报告质量收益与额外前向成本。若局部修复只提升离线分数,却显著增加尾延迟,应在产品决策中明确取舍。
第五,验证停止准则。分别关闭统计、结构和稳定性信号,观察提前停止造成的错误类型。一个好停止器不只是减少轮数,还应知道何时模型陷入不稳定固定点,并及时转交备用策略。
第六,记录中间态安全边界。确认任何工具、检索器和执行器都不会读取未提交序列;对中间状态做敏感信息、越权意图和格式攻击测试。扩散生成的并行性不能以扩大攻击面为代价。
总体而言,扩散语言模型的理论价值在于把生成视为离散概率流的时间反演,把 token 确定顺序从固定链条变成可学习、可验证的动态过程。它不会自动消灭注意力成本,也不会自动优于自回归模型;但它提供了一个研究全局修复、并行推理和不确定性调度的统一实验平台。真正的突破点,可能不是“扩散替代自回归”,而是两种过程在不同不确定性区域上的协同分工。
参考文献
- Sohl-Dickstein et al., Deep Unsupervised Learning using Nonequilibrium Thermodynamics, 2015.
- Ho et al., Denoising Diffusion Probabilistic Models, 2020.
- Austin et al., Structured Denoising Diffusion Models in Discrete State-Spaces, 2021.
- Hoogeboom et al., Argmax Flows and Multinomial Diffusion, 2021.
- Li et al., Diffusion-LM Improves Controllable Text Generation, 2022.
- Gong et al., DiffuSeq: Sequence to Sequence Text Generation with Diffusion Models, 2022.
- Li et al., DiffusionBERT: Improving Generative Masked Language Models with Diffusion Models, 2022.
- Strudel et al., Self-conditioned Embedding Diffusion for Text Generation, 2022.
- Lou et al., Discrete Diffusion Language Modeling by Estimating the Ratios of the Data Distribution, 2023.
- Chang et al., MaskGIT: Masked Generative Image Transformer, 2022.
- Devlin et al., BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding, 2019.
- Vaswani et al., Attention Is All You Need, 2017.
- Karras et al., Elucidating the Design Space of Diffusion-Based Generative Models, 2022.
- Song et al., Score-Based Generative Modeling through Stochastic Differential Equations, 2021.
- Austin et al., Structured Denoising Diffusion Models in Discrete State-Spaces, 2021.
- 据公开资料整理;截至 2026-07-22,本文关于具体生产性能的比较均未声称已由统一硬件基准验证。