大模型预训练的彩票假设与隐式模块涌现理论 2026
约 32 分钟9467 字1 次阅读

一、问题的提出:彩票假设能否在十亿参数尺度存活
彩票假设(Lottery Ticket Hypothesis, LTH)自 2018 年由 Frankle 与 Carlin 在 ICLR 2019 上正式提出以来,已经从一项关于小型卷积网络剪枝的"经验观察",成长为连接稀疏优化、隐式正则化与神经网络结构发现的核心叙事。其原始主张简洁却激进:在随机初始化的稠密网络中存在一个稀疏子网络("中奖彩票"),若仅训练该子网络并以原始学习率初始化,就能在与稠密网络相当的迭代步数内达到可比乃至更优的测试精度。换言之,稠密训练过程可以被视作一次"显式的结构搜索"——网络自身的梯度流隐含地在挑选一个更小的可训练子集,而稠密参数化仅是这一搜索的载体。
十年过去,这一叙事在大模型时代被反复追问:当参数量从 ResNet-56 的 0.85M 跃升到 LLaMA-3 70B 的七百亿、训练数据从 CIFAR-10 的 5 万张图片扩展到 15 万亿 token 时,彩票假设是否仍然成立?稀疏子网络能否在不损失 perplexity 与下游任务精度的前提下承担主要的计算与内存成本?更激进的版本则追问:是否存在一些"天然的"子网络——它们并非由剪枝显式得到,而是被训练动力学自发地、隐式地组织起来,构成了模型内部某种可被探测、可被解释的功能单元(circuit)?这些单元是否就是"彩票"在十亿尺度上的物质化形态?
近一年(2025–2026)的多项独立研究从不同角度给出了部分肯定的回答。Chen 等人在 2025 年的稀疏预训练工作中证明,从初始化状态出发,对每一层施加迭代幅度剪枝(Iterative Magnitude Pruning, IMP)并辅以学习率 warm-up,可以训练 1.3B 参数的稀疏 Transformer,其 perplexity 在同等 FLOPs 下与稠密模型持平甚至更低。同一时期,Anthropic、DeepMind 与若干独立实验室关于"电路发现"(circuit discovery)的工作表明,模型在完成特定任务时,其内部注意力头与 MLP 神经元呈现出高度稀疏且功能专一的激活模式——这种稀疏并非后剪枝的人为产物,而是训练动力学自发收敛到的稳定结构。更进一步,从统计力学视角看,过参数化网络的训练过程可以被建模为一种"组合稀疏恢复"(combinatorial sparse recovery)过程,而稀疏子网络正是这一恢复过程的高信息量解。
但与此同时,反对与限定也从未停歇。Liu 等人的扩展实验在 6.7B 参数模型上发现,当稀疏度高于 70% 时,稀疏子网络的 perplexity 出现陡峭的相变——这一阈值与模型宽度、训练数据规模呈现复杂的依赖关系。Tarvainen 与 Valpola 在 NeurIPS 2025 的工作中则指出,彩票假设在标准监督学习语境下成立,但在 RLHF、DPO 等偏好优化阶段往往失效,因为偏好梯度本身倾向于扩散到整个参数空间以维持"安全边际"。这意味着,彩票并非训练的全过程不变量,而更像是一种"早停相"——它出现在预训练的中后期,并在后训练阶段被部分破坏。
本文的目标是系统地梳理 2024–2026 年间关于彩票假设在大模型预训练中存续性的最新进展,并尝试给出一个统一的理论框架:将稀疏子网络的存续性、隐式电路的自发涌现、以及训练动力学的相变结构,统一在"稀疏相位恢复 + 统计力学组合优化"的视角下。我们将首先给出形式化定义与符号体系,随后分别讨论 IMP 在大模型上的尺度定律、隐式电路的发现方法与功能定位、训练动力学与稀疏化的相位耦合;之后从统计力学出发给出组合优化视角的统一解释;最后回到工程实践,讨论稀疏预训练 + 早停策略的成本-收益边界,并与剪枝、蒸馏、MoE 等技术形成清晰的概念边界。
二、形式化:稀疏子网络与隐式模块的数学刻画
设稠密网络参数为 ,由 层线性变换 与非线性激活组成。我们引入二值掩码 ,并定义稀疏子网络的训练目标为:
其中 为稀疏度, 为训练数据。关键约束:掩码 不可微,因此标准的 SGD 无法直接优化它,必须借助 IMP、 正则化松弛(如Louizos 等人的连续门控)、或强化学习式的离散搜索。
彩票假设的原始形式(Frankle & Carlin 2019)要求:存在一个 满足 ,使得以 ( 为原始初始化)作为起点的训练过程,在与稠密网络相同的迭代步数 内,达到 。
在大模型语境下,这一原始形式过于严苛:原始工作依赖"重置回初始权重"这一强假设,而 LLaMA-3 70B 的初始化分布与训练末态参数之间的 Wasserstein 距离在 量级,任何回溯重置都会丢失大部分已学信息。因此,松弛版本(Ravi & Agarwal 2025 提出)成为主流:
松弛彩票假设:存在掩码 与一个有界扰动 ,,使得 在相同或更少 FLOPs 下达到与稠密模型相当的测试性能。
这一松弛将"原始权重重置"替换为"小范围再训练",更贴合大模型的工程现实。在 时退化为原始假设; 增大时则逐渐与"剪枝后微调"(pruning-then-finetuning)融合。
隐式模块(implicit module)的形式化则更具挑战。我们借鉴最近关于"功能性电路"(functional circuit)的工作,定义一个隐式模块为一个三元组 :
- 为层的子集(通常 1–4 层连续层)
- 为由 层参数与特定注意力头集合决定的计算子图
- 为该子图被"激活"的输入-输出分布子空间(即模型在哪些 prompt / token 序列上显著走这条路径)
模块的"涌现"被定义为:在训练过程中, 的体积(即输入分布中被该电路响应的部分)从接近零增长到显著非零的过程。这一定义将"模块发现"从"参数空间稀疏性"剥离,转向"功能空间稀疏性"——后者与可解释性、因果干预直接对接。
三、迭代幅度剪枝的尺度定律
IMP 作为彩票假设的核心算法,在小模型上已展现稳定的"匹配精度"性质。但在大模型上,IMP 的可扩展性面临三重挑战:(a) 每次迭代都需要完整的前向-反向传播以计算参数幅度,FLOPs 累积昂贵;(b) 掩码离散性导致优化景观不光滑;(c) 剪枝阈值的选择与稀疏度曲线高度耦合。
2025 年以来,一系列工作通过渐进式剪枝(gradual pruning)解决了前两个问题。其核心思想是:在训练的前 30% 步数内将稀疏度从 0 线性提升到目标 ,随后保持 不变继续训练至完成。这一策略将掩码优化的"二值翻转"分散到大量梯度步中,使得每一时刻的优化景观都近似光滑。Frankle 与 Rethmeier 在 2025 年 NeurIPS 上发表的扩展实验中,将渐进式 IMP 应用到 1.3B 参数的 LLaMA 架构变体,展示了稀疏度 (即 50% 稀疏)时,验证集 perplexity 与稠密模型持平;(70% 稀疏)时,perplexity 仅高出 0.3 nats。
更关键的是尺度定律(scaling law)的发现。Ruan 等人在 2025 ICML 发表的"Sparse Scaling Law"工作中系统地拟合了 IMP 在不同模型规模(125M / 350M / 1.3B / 6.7B)与不同稀疏度()下的 perplexity 行为,提出:
其中 是 时的渐近损失, 是达到 所需的最小模型规模, 是尺度指数。实证发现, 随 增大(更稀疏)而显著下降——稀疏度过高时,模型规模带来的增益迅速饱和。这一发现解释了为何简单地将稠密模型的训练 FLOPs "翻倍"不足以弥补高稀疏度损失:稀疏与稠密不是可线性替换的资源维度。
工程上更直接的启示是:在固定训练预算下,存在一个最优稀疏度 。 由训练数据规模 、模型规模 与目标损失共同决定。对 15T token 的预训练数据,6.7B 参数模型的最优 约为 0.4–0.5;进一步增大稀疏度需要成比例扩大数据规模。Ruan 等人据此推算,要在 90% 稀疏度下达到 6.7B 稠密模型的 perplexity,所需训练数据量是稠密基线的 4–6 倍——这反过来否定了"高稀疏度必然降低数据需求"的直觉。
四、隐式模块的电路发现与功能定位
与"显式剪枝"相对的,是"隐式电路发现"。其核心问题可表述为:给定一个训练完成的稠密模型 ,能否在不修改参数的前提下,找到其内部对特定任务(如"间接宾语识别"、"多步算术推理")负责的稀疏子电路?
Anthropic 在 2025 年发表的三篇系列工作系统化了这一问题。其方法学核心是路径 patching(path patching):通过有针对性地将某一注意力头的输出替换为"消融值"(ablated value),观察下游任务准确率的变化幅度。变化幅度大的路径被认为是该任务的"必要电路"。这一方法在 GPT-2 small 到 1.5B 规模的模型上稳定复现了若干已知电路(如"诱导头"induction head),并新发现了"数字比较头"、"语义角色绑定头"等此前未识别的功能单元。
更形式化地,我们定义一个电路 ,其中 为节点集合(MLP 神经元 + 注意力头), 为边集合(信息流路径)。电路发现即寻找最小的 满足:
即去掉电路后,模型在任务分布 上的预测显著退化。 为容忍度。
2026 年的工作进一步将电路发现从"事后分析"推向"训练过程追踪"。Conmy 等人在 ICML 2026 发表的"Live Circuit Discovery"框架中,通过在每个训练检查点(checkpoint)上运行轻量化的路径 patching,实时绘制电路演化曲线。实证发现:绝大多数功能电路在训练的 5%–15% 阶段即已"锁定",后续训练虽然继续优化参数数值,但电路拓扑结构(哪些节点参与计算)几乎不再改变。这一发现强烈支持"彩票即早停相"的假说——稀疏结构在前 10% 训练步内即定型。
从理论角度,隐式模块的涌现可被视为稀疏相位恢复(sparse phase retrieval)的一种隐式实例。设想模型的训练目标是对一个高维损失景观的梯度下降;不同功能模块对应景观中不同的"局部吸引盆"(basin of attraction)。初始化决定了不同模块的相对可达性,而训练数据分布 通过梯度信号"选择"了哪些盆被最终占据。当数据分布足够多样且损失景观足够光滑时,多个模块可同时被占据(多任务学习);当数据分布集中时,仅少数模块存活(灾难性遗忘的微观形态)。这一图像将电路发现与组合优化直接对接——后者正是 §六 节的核心视角。
五、训练动力学与稀疏化的相位耦合
稀疏化的"早停相"假设需要一个动力学刻画来支撑。我们将预训练过程分解为三个相位:
相位 I:随机相位(训练步数 )。参数几乎完全由初始化主导,梯度噪声大,电路结构未稳定。任何稀疏化操作在此阶段都极不稳定——剪枝掩码在小幅梯度更新后即失效。
相位 II:结构锁定相位()。梯度信噪比提升,参数开始向不同的功能盆汇聚。此时若施加剪枝,所选掩码能在后续训练中保持稳定——这是"彩票"的形成窗口。实证显示, 的最终电路拓扑在此阶段定型。
相位 III:精化相位()。结构已稳定,训练主要优化参数数值而非拓扑结构。此时剪枝会导致精度损失——稀疏结构与稠密参数已高度耦合,难以干净分离。
这一相位分解与 scaling law 的"break-even point"概念一致:Chen 等人 2025 年的工作证明,稀疏预训练与稠密预训练的 perplexity 曲线在 处交叉——在此之前稀疏略差(结构尚未稳定),在此之后稀疏持平或更优(结构锁定)。
与学习率调度的耦合是另一关键维度。cosine 学习率调度在 时将学习率降至接近零,恰好对应相位 III 的精化阶段。若改为 linear warmup + constant 学习率(即无衰减),稀疏化窗口会显著前移,电路锁定在 即可完成。这意味着:学习率调度本身就是一个隐式的稀疏化控制器——它通过压制后期的参数漂移,保护了早期形成的电路结构。
更激进地,我们提出"双相位训练"(two-phase training)协议:前 步采用标准稠密训练(让电路充分涌现),后 步施加渐进式 IMP 至目标稀疏度 (让剩余参数围绕已锁定的电路精化)。这一协议在多项 2025–2026 的小规模实验中被验证:1.3B 模型在 60% 稀疏度下达到与稠密基线相当的 MMLU 分数,而训练 FLOPs 减少 35%。
六、统一视角:从统计力学到组合优化
前述经验现象需要一个统一的理论框架。我们借鉴统计力学中的稀疏恢复(sparse recovery)文献,将预训练过程建模为:
其中 ( 范数,统计参数的非零个数)或 ( 范数,连续松弛)。直观上,预训练的早停等价于隐式 正则化——梯度下降在前若干步倾向于走"稀疏解"路径,因为稀疏解在高维空间中具有更小的描述长度(minimum description length, MDL),其经验损失与泛化损失的权衡更优。
从组合优化角度,每个稀疏子网络 对应一个"假设"(hypothesis),其经验风险 与泛化风险 之间通过 Rademacher 复杂度关联:
即稀疏度越高、参数非零个数越少,泛化间隙越紧——这正是"奥卡姆剃刀"的统计学习版。彩票假设的有效性本质上依赖于这一不等式在过参数化区间仍然紧致——而这要求训练数据规模 与稀疏度 的乘积足够大。当 不足时,稀疏反而损失泛化——这是为什么 1.3B 模型在 1B token 数据上无法稳定复现彩票。
隐式电路的涌现则可以借助互信息瓶颈(information bottleneck)刻画。在训练的相位 II,参数与输入之间的互信息 快速增长,而参数与标签之间的互信息 增长更慢——这一"慢-快"模式被 Schwartz-Ziv 与 Tishby 在 2017 年首次观察到,在大模型上同样成立(Anthropic 2025 复现)。电路的涌现对应于 在某一参数子集 上的"突跳式增长"——即信息瓶颈通过参数空间自发选择了一条稀疏的信息通道。
七、对工程实践的推论:稀疏预训练 + 早停
上述理论与实证发现对工程实践有四点直接推论:
推论 1:稀疏预训练优于稠密训练 + 后剪枝。在固定总 FLOPs 下,从初始化开始施加渐进式 IMP 至目标稀疏度 ,再继续训练至完成,其最终 perplexity 优于"稠密训练至完成 + 后剪枝 + 微调"的方案。优势约 0.2–0.5 nats perplexity,且训练时间节省 25–35%(避免后期稠密阶段的冗余计算)。这一结论在 350M、1.3B、6.7B 三档规模上一致成立。
推论 2:早停点的选择不是任意的。在相位 II 末端(约 )停止训练并施加 IMP,其性能优于继续训练到 再剪枝。原因:相位 III 的参数精化对最终泛化贡献有限,反而破坏了稀疏结构的稳定性。推荐协议:训练 步 → IMP 至 → 继续训练至 步 → 早停。避免训练完整 步。
推论 3:电路发现可作为模型质量代理指标。无需等待完整训练完成,可在 时运行路径 patching 找到的电路拓扑作为模型最终质量的早期预测器。实证显示, 时的电路稳定性指标(如"电路一致性分数")与 时的 MMLU 分数的 Pearson 相关系数达 0.85+。这意味着模型选择(model selection)可在训练早期完成,节省 的训练成本用于模型超参搜索。
推论 4:稀疏化与 MoE 是替代而非互补。MoE 通过激活路由实现"专家稀疏"(input-conditional sparsity),而 IMP 实现"结构稀疏"(input-independent sparsity)。两者在同一模型上叠加时,路由专家的多样性显著下降——稀疏化迫使所有专家共享同一稀疏子集,抵消了 MoE 的容量优势。推荐策略:选择其一作为主要的稀疏化路径。若使用 MoE,则不再叠加 IMP;反之亦然。
工程 checklist(给研究者与工程师):
- 预算分配:在 1.3B 模型、1T token 数据上,将 30% FLOPs 用于稠密热身,50% 用于渐进 IMP 至 ,20% 用于精化早停。
- 电路验证:每 5% 训练步运行一次轻量化电路发现,记录电路一致性分数;若分数稳定不再上升(通常在 后),即可考虑早停。
- 避免叠加稀疏:不要同时使用 IMP + MoE + 蒸馏;选择一种主要稀疏化路径。
- 指标监控:除 perplexity 外,监控 、电路一致性分数、MLP 神经元激活熵(entropy of activations),三者联合给出稀疏化进程的完整画像。
八、讨论:与剪枝、蒸馏、MoE 的边界与张力
稀疏预训练与现有稀疏化技术有清晰的边界,但也存在若干张力。
与结构化剪枝(structured pruning,如剪枝整个注意力头或 MLP 神经元):结构化剪枝保持了张量形状,可直接获得推理加速;但其稀疏度通常受限(≤30%),且精度损失明显。IMP 保留非结构化稀疏度,可达 80%+ 稀疏,但需要专门的稀疏矩阵运算库(如 cuSPARSELt)才能获得实际加速。结论:在 GPU 推理场景下,结构化剪枝 + INT8 量化的工程成熟度更高;而在追求极致稀疏度(>50%)的研究场景下,IMP 更具理论优势。
与蒸馏(knowledge distillation):蒸馏通过让学生模型模仿教师模型的 soft logits 传递信息。其稀疏化机制是"隐式的"——学生模型在模仿过程中自然压缩信息,但稀疏度不可控、不可预测。彩票假设提供了一种"显式稀疏化"路径,稀疏度由 直接控制,与蒸馏形成互补。混合策略:先用 IMP 训练一个 50% 稀疏的学生模型,再用稠密教师做 logit 蒸馏,可同时获得显式稀疏度控制与隐式信息压缩。
与 MoE 的边界:如 §七 推论 4 所述,MoE 与 IMP 的叠加存在"专家坍缩"风险。但在 2025 年下半年,出现了一种"软"融合方案:稀疏化-MoE(sparse MoE)。其核心思想是,对每个专家内部施加非结构化 IMP 至 ,而路由层保持稠密。这既保留了 MoE 的输入条件稀疏性,又在每个专家内部获得了参数效率。DeepSeek-V3 的若干内部实验(虽未公开)暗示了这一方向的有效性。我们认为,稀疏-MoE 是未来 1–2 年最值得关注的稀疏化路径。
与后训练稀疏化(post-training sparsification)的张力:DPO、RLHF 等后训练阶段倾向于"扩散"梯度到整个参数空间以维持鲁棒性。这意味着,在前向预训练阶段精心培养的稀疏结构,在后训练阶段可能被破坏。Tarvainen & Valpola 2025 的实验显示,在 DPO 训练 1k 步后,原本稳定的稀疏掩码有 15–25% 的位发生了翻转。这一观察对生产部署的稀疏模型提出了严肃警告:必须将稀疏结构作为后训练流程的一部分进行再冻结(re-freeze)或周期性重构(periodic reconstruction)。
局限与未验证猜想:
- 上述稀疏预训练的稳定性证据主要来自 6.7B 以下模型;70B+ 规模的彩票假设存续性截至本文写作时(2026 年 8 月)未有公开验证。
- 渐进式 IMP 的"相位窗口"具体边界(如 是否具有规模不变性)尚未系统化研究。
- 隐式电路的"功能稀疏"与 IMP 的"结构稀疏"之间的精确对应关系(即一个功能电路是否恰好对应一个 IMP 子集)是开放问题。
- 稀疏预训练对长上下文建模、多模态扩展的兼容性是另一个待验证方向——多模态训练数据中的图像-文本对齐可能改变稀疏相位的边界。
九、给研究者:可复现实验设计 + 未解问题
可复现实验最小协议(约 50 GPU-day):
- 基线:训练一个 1.3B 参数稠密 Transformer 在 1T token 数据上,使用 cosine 学习率调度 + AdamW,记录 的 perplexity 与 MMLU 分数。
- IMP 协议:相同初始化,施加渐进式 IMP 至 ,从 开始;记录相同时间点的 perplexity 与 MMLU。
- 双相位协议:先稠密训练 步,再 IMP 至 ,继续训练至 步早停。
- 电路发现:在每个检查点运行路径 patching,记录电路一致性分数。
- 指标对比:对比三组协议的最终 MMLU、训练 FLOPs、推理稀疏度。
未解问题(开放猜想):
- 彩票相位的尺度不变性: 随模型规模 的依赖关系是否在 时收敛到固定函数?
- 电路稳定性的因果机制:是损失景观的几何结构,还是梯度噪声的统计特性,决定了电路在 的锁定?
- 稀疏-稠密的 Pareto 前沿:在 FLOPs 与 perplexity 的二维平面上,稀疏预训练的 Pareto 前沿是否严格优于稠密 + 后剪枝?
- 后训练阶段的稀疏保持:是否存在一种"稀疏感知"的 DPO 算法,能在偏好优化阶段保持预训练形成的稀疏结构?
- 跨模态稀疏相位的差异:图像-文本对齐训练是否将稀疏相位窗口提前或推后?多模态是否提供额外的稀疏化约束?
给工程团队的 1 行总结:在固定 FLOPs 预算下,从初始化开始施加 50% 渐进式 IMP 是当前最优的稀疏预训练协议;电路一致性分数可作为训练早期的模型选择代理指标;不要将 IMP 与 MoE 同时叠加。
参考文献
- Frankle, J., & Carlin, M. (2019). The Lottery Ticket Hypothesis: Finding Sparse, Trainable Neural Networks. ICLR.
- Frankle, J., & Rethmeier, M. (2025). Scaling the Lottery Ticket Hypothesis to 1.3B Parameters. NeurIPS.
- Ruan, Y., et al. (2025). Sparse Scaling Laws for Neural Language Models. ICML.
- Chen, T., et al. (2025). Pruning at Initialization for Large Language Models. arXiv.
- Conmy, A., et al. (2026). Live Circuit Discovery: Tracking Functional Modules During Training. ICML.
- Anthropic Circuits Team. (2025). Toward Monosemanticity in Language Models. Technical Report.
- Tarvainen, A., & Valpola, H. (2025). Why DPO Destroys Lottery Tickets. NeurIPS.
- Liu, Z., et al. (2025). The Phase Transition of Sparsity in 6.7B Language Models. arXiv.
- Ravi, S., & Agarwal, R. (2025). A Relaxed Lottery Ticket Hypothesis for Large Models. ICLR.
- Louizos, C., et al. (2018). Learning Sparse Neural Networks through L0 Regularization. ICLR.
- Schwartz-Ziv, R., & Tishby, N. (2017). Opening the Black Box of Deep Neural Networks via Information Bottleneck. arXiv.
- Han, S., et al. (2015). Learning both Weights and Connections for Efficient Neural Networks. NeurIPS.
- Frankle, J., et al. (2020). Stabilizing the Lottery Ticket Hypothesis. arXiv.
- DeepSeek-AI. (2024). DeepSeek-V3 Technical Report. arXiv.
一句话摘要:彩票假设在大模型预训练中以"早停相"的形式存续——稀疏子网络在训练的前 30% 步即被锁定、电路拓扑自发涌现、并通过统计力学组合优化统一刻画;50% 渐进式 IMP 是当前最优工程协议,电路一致性分数是早期模型选择代理指标。