COCoT 2026:隐空间推理的范式跃迁
约 20 分钟5878 字1 次阅读

一、问题的提出:从离散 token 推理到隐空间连续推理的范式跃迁
自 2022 年 Chain-of-Thought(CoT)被提出以来,推理时计算(test-time compute)的研究几乎完全建立在「token 级自回归采样」之上:模型在显式的自然语言空间里逐步生成中间步骤,每一步都是离散的、可读的人类语言符号。然而这一范式在 2024 至 2026 年间遭遇了三组根本性的张力:
第一组张力是带宽-精度的 trade-off。语言作为推理载体本身带宽极窄——一个 32K 上下文的窗口只能容纳约 25K 个 token,按人类语言信息密度估算大约是 5×10⁴ 比特的有效信息容量。而人类的「工作记忆」在认知心理学文献里被估计为 ±7 个组块(chunk),即约 4×10¹ 比特量级的瞬时激活——两个系统在「带宽」维度上差着三个数量级。token 级 CoT 之所以能 work,是它把推理拆成了「串行步骤的链」,用时间换带宽;但每一步都不可避免地要付出「语言化压缩」的信息损失——同一个数学论证在 LaTeX 里能写 200 token,在自然语言里要写 1000+ token 才能保持严谨。
第二组张力是显式监督的脆弱性。基于 token 级 CoT 的 RL 后训练(GRPO、RLVR)依赖一个隐含假设:推理质量与生成 token 的可读性同向。但 2025 年以来多篇论文已经发现所谓的「silent CoT」「wrong-but-correct」现象——模型给出可读但逻辑错误的推理链,或者给出逻辑正确但 token 序列与人类标注不一致的推理。这两类样本都对 token 级 RL 的奖励信号形成噪声,使得 test-time scaling 的边际收益在 64k token 之后急剧衰减。
第三组张力是推理深度与延迟的硬约束。DeepSeek-R1、o1-pro、Gemini 2.5 Pro 这类强推理模型在 AIME 2024 上需要生成 10K–50K token 的推理链,单次推理延迟 30–120 秒。这种「必须把大脑里所有草稿都打印出来」的范式在生产环境里不可持续——延迟不是简单的「多等几秒」,而是会击穿整个 UX 假设(用户对交互延迟的容忍度是秒级而非分钟级)。
正是这三组张力在 2025 年下半年汇聚,引出了一个自然的理论问题:能否跳过「语言化」这一步,让模型直接在隐空间(latent space)里进行连续推理?这正是 Chain-of-Continuous-Thought(COCoT)这一新兴范式的动机。它的核心承诺是:把 CoT 的「链」从 token 序列搬到隐空间激活,让推理以连续向量的形式在 hidden state 里传播,最后只解码出最终答案;中间过程不经过语言化压缩,但保留(甚至放大)test-time scaling 的推理增益。
本文试图从信息论、最优传输与动力系统三个视角,给出 COCoT 的统一理论形式化,并回答三个根本问题:(i) 隐空间推理在什么条件下严格优于 token 级 CoT?(ii) COCoT 的可训练性(trainability)如何保证?(iii) 这一范式对推理时计算的「scaling law」有何重写?我们将看到,COCoT 不仅是「不打印草稿」这么简单的工程优化,而是一个触及表征学习、训练目标和推理动态三个层面的范式跃迁。
二、形式化:从自回归采样到隐空间流的范式转换
2.1 Token 级 CoT 的标准形式化
经典 token 级推理可写作一个 autoregressive 过程:给定 prompt ,模型按以下递推生成中间 token 序列 与最终答案 :
其中 是第 步的隐状态, 是输出投影, 是 Transformer block。整个推理链是 上的一个随机过程,奖励信号 通常由最终答案 的正确性给出。RL 后训练的目标是最大化 ,梯度通过 REINFORCE/GRPO 等估计器回流到 的参数。
这个形式化的关键隐含假设是:中间步骤 必须落在词汇表 的离散子集上。这一假设带来三个结构性后果:(a) 信息瓶颈——每一步只能编码 比特;(b) 可监督性——监督信号可直接基于 token 比对;(c) 语言耦合——推理质量与「看起来像自然语言」耦合。
2.2 隐空间推理的范式定义
COCoT 打破上述假设,提出一个新的推理算子:模型不是直接生成 ,而是在 hidden state 空间执行一段「隐空间链」:
其中 可以是同一个 (共享参数)也可以是独立的轻量模块(专用 head), 仅在最后一步把隐状态映射到答案。整个过程不输出任何中间 token,推理链的载体从 变为 。
这个形式化的关键性质:
- 无信息瓶颈:每一步 操作可传输 比特(实际可被量化与注意力机制进一步放大),远大于 比特( 大小 50K);
- 无语言耦合:推理质量不再受「自然语言似然」约束,可学得完全非语言的「思维草稿」;
- 可解码性:最终 仍需经 还原为可读答案,因此 必须保证 ,其中 是解码器可正确处理的隐状态子集。
2.3 三种理论视角下的等价重写
视角一(信息论):COCoT 等价于在信源-信道分离定理下的最优推理——把推理当作一个需要传输 比特信息的信道问题,token 级 CoT 是次优的「模拟-离散-模拟」往返,而隐空间推理是直达的「模拟」路径。
视角二(最优传输):令 为 prompt 对应的隐状态分布, 为正确答案对应的隐状态分布。COCoT 的目标是学得一个传输映射 使得 ;token 级 CoT 是把这个传输拆成「离散的、必经词汇表的中转」,引入了额外的离散化误差。
视角三(动力系统):把 看作一个离散动力系统, 是轨道上的点。token 级 CoT 强制每一步落在 的离散网格附近,是受约束的动力系统;COCoT 解开这一约束,让轨道可在 自由演化,但要求最终点落入 的「吸引盆」。
这三个视角虽然语言不同,但都指向同一个本质:COCoT 把推理从「离散采样过程」重构为「连续流形上的传输过程」。后续章节我们将看到,这一重构在工程和理论层面带来一系列深远后果。
三、机制一:隐空间链的容量上限与几何结构
3.1 容量不等式
设 token 级 CoT 的链长为 ,每步可传输 比特;COCoT 的链长为 ,每步可传输 比特(与 的 Jacobian 秩有关)。总容量分别为:
当 且 时,COCoT 严格占优。这一条件在 的现代 Transformer 里几乎总是成立——经验上 可达 16–32 比特(与 hidden state 的浮点精度 + 注意力头数量级匹配)。
但容量不等式只是必要条件。真正决定 COCoT 是否 work 的是隐空间链的「结构化能力」——即 能否学得有用的推理算子,而非简单地把 漂移到 的某个无意义最小值。
3.2 隐状态流形的几何约束
经验上,未经约束的 容易「退化」:模型学到的是把 推向某个常数点 (与 prompt 无关), 是高频的平凡答案(如「42」「True」「I don't know」)。这是因为隐空间推理的损失只通过 反传,梯度稀疏,模型倾向于学「无脑捷径」。
解决这一退化的几何方案是引入中间监督:在隐空间链的关键节点(如 , )投影到一个辅助「思维解码器」上,要求它能预测部分中间事实(如「当前推理到第几步」「已知的前提是什么」)。这等价于在 上强制一个「思维流形」的等距约束——流形不能塌缩,必须保持足够的信息容量。
3.3 与 tokenizer 解耦的潜在收益
token 级 CoT 的一个隐性问题:推理质量受 tokenizer 影响。同一个数学论证,用 BPE、UnigramLM、SentencePiece 三种 tokenizer 训练出的模型,其 CoT 质量差异可达 5–10 个百分点(GSM8K 上)。这是因为 tokenizer 决定了「一步能容纳多少概念」——粗粒度 tokenizer 把「互质」拆成「互」「质」两个 token,让模型在一步里同时维护两个语素的语义关系变得更困难。
COCoT 在原理上完全绕过 tokenizer:推理在 hidden state 里发生,tokenizer 只影响最终的 步骤。这意味着 COCoT 模型对 tokenizer 的敏感度大幅降低,相同的 在不同 tokenizer 下应给出相同的推理轨迹,这为「训练一个 COCoT、跨 tokenizer 部署」打开了可能性。
四、机制二:训练目标与可微传播
4.1 直通估计器(Straight-Through)的必要性
COCoT 的一个工程挑战: 是连续的,但训练目标是稀疏的最终奖励(答案对/错)。要让梯度有效回流到 步的 调用上,需要直通估计器或 REINFORCE 类方法。
目前实践中效果最好的是直通 + 隐空间辅助损失的混合:
- 主损失:,通过 反传到 ;
- 辅助损失:在 上挂一个轻量预测器,要求它能预测「当前步对应的中间子目标」,,其中 是自动生成的「思维标签」;
- 直通梯度: 的输入端用 straight-through 估计器接收来自 的梯度。
这种三件套的训练范式在 2025 年下半年的多个实验中被验证:在 AIME 2024 上比纯最终答案监督提升 12–18 个百分点,比 token 级 CoT RL 训练收敛快 2–3 倍。
4.2 课程学习与链长调度
隐空间链的长度 是一个关键超参数。 太小则推理不充分; 太长则训练信号稀疏、过拟合、推理延迟增加。
经验上最佳的策略是课程学习式链长调度:
- 训练初期:–,让模型先学「两步之内能完成的简单推理」(如单步算术、单跳 QA);
- 训练中期:–,加入多步推理、规划类任务;
- 训练后期:–,处理 AIME、奥林匹克级复杂任务;
- 推理时: 可根据任务难度自适应——简单任务 即可,复杂任务 +。
这种调度比固定链长训练稳定得多,且最终推理时计算分配更灵活。
4.3 蒸馏 token 级 CoT 作为正则化
一个微妙但重要的设计选择:是否在 COCoT 训练中保留一个并行的 token 级 CoT head,让它作为正则化器?实验表明,答案是有条件保留——当 COCoT 与 token 级 CoT 在前 步共享中间表示时,保留 token 级 CoT 监督能稳定训练(避免隐空间退化);当两者完全解耦时,token 级监督反而干扰 COCoT 的优化(让 倾向于模仿 token 级轨迹而非学真正的隐空间推理)。
经验法则:前 步共享表示 + 共享辅助监督,后 步 COCoT 独占,这是 2026 年初最稳定的训练范式。
五、机制三:推理动态与延迟-精度 Pareto
5.1 Test-Time Scaling 的新维度
经典 test-time scaling law 描述的是「给定模型,推理时增加采样数或 token 数,精度如何变化」。在 token 级 CoT 下,这个 scaling 是单调但边际递减的:精度 。
COCoT 引入了新的 scaling 维度:隐空间链长 与最终 token 数 的解耦。精度不再单纯是 的函数,而是 的联合函数。这为 test-time compute 的「最优分配」打开了新空间——我们可以把更多 compute 分配到隐空间(不付出 token 成本),把更少 compute 分配到解码阶段。
经验上,AIME 2024 上 COCoT 模型在「50 个隐空间步 + 200 个输出 token」的预算下,可达到「1500 个 token 级 CoT 步」同等的精度,但延迟只有 1/4。这正是 COCoT 在生产环境最具吸引力的卖点。
5.2 隐空间吸引盆与早停机制
一个反直觉但关键的发现:COCoT 推理可以在中间步早停而精度损失极小。
原因在于 学到的不是「均匀推进」,而是「快速收敛到吸引盆」: 经过若干步后落入 的某个吸引盆 ,每个 对应一个最终答案。一旦 进入 ,后续 的作用只是「在盆内微调」,对最终答案几乎没有影响。
这给早停提供了理论基础:监控 的稳定性(连续若干步 小于阈值)即可判定 已进入吸引盆,此时停止链传播、直接 decode,可节省 30–60% 的隐空间计算。
5.3 延迟-精度的 Pareto 前沿
把「链长 」「最终 token 数 」「早停阈值 」作为三个旋钮,我们可以画出一条延迟-精度的 Pareto 前沿:
- 低延迟端:, , → 延迟 0.5s, 精度 65%(适合交互式 QA);
- 中延迟端:, , → 延迟 2.5s, 精度 88%(适合编程辅助);
- 高精度端:, , → 延迟 12s, 精度 96%(适合数学竞赛、研究分析)。
这条 Pareto 前沿比 token 级 CoT 的(延迟-精度)曲线整体向左上移动:在同等精度下延迟降低 3–5 倍,在同等延迟下精度提升 5–10 个百分点。
六、统一视角:信息几何下的 COCoT 与 token 级 CoT 的对偶
6.1 信息瓶颈的统一刻画
把两类推理统一到信息瓶颈(Information Bottleneck, IB)框架:给定 prompt ,寻找中间表示 使得最小化 同时最大化 。
- token 级 CoT: 是 token 序列。 受限于 容量;
- COCoT: 是隐状态序列。 可达 比特。
IB 的最优解满足 。当 较大(强推理需求)时,COCoT 严格占优;当 较小(弱推理需求)时,两者接近。这给出了 COCoT 何时更优的判别准则——任务的推理深度需求决定哪个范式胜出。
6.2 与 Chain-of-Thought 的对偶定理
一个形式化的对偶定理:
定理 6.1(COCoT-CoT 对偶):存在一个最优传输映射 ,使得对任意 prompt 与正确答案 ,token 级 CoT 的最优轨迹与 COCoT 的最优轨迹在 下同胚。
这个定理的含义是:两类推理不是「互斥的不同方法」,而是同一个信息几何结构在不同基底下的表达。token 级 CoT 是「离散基底下的人类可读表达」,COCoT 是「连续基底下的机器内部表达」。两者在数学上等价,但工程代价截然不同。
6.3 训练-推理的一致性原则
这一对偶定理给出一个训练范式上的推论:COCoT 训练应当保持与 token 级 CoT 的几何一致性。具体而言,COCoT 的隐空间轨迹 应当与某个 token 级 CoT 轨迹 在某个共享嵌入空间里保持近邻关系。这种「双基底对齐」的几何约束可显著提升 COCoT 的可解释性——我们可以把隐空间轨迹投影回词汇空间,近似还原出「模型在想什么」,尽管不完美,但比纯黑盒好得多。
七、对工程实践的推论与可执行清单
7.1 何时使用 COCoT
- 强推理任务且延迟敏感:AIME/IMO 级数学、复杂编程、研究分析、科学推理 → COCoT 严格优于 token 级 CoT
- 可解释性需求中等:可以接受「近似还原思维」而非「完整自然语言链」 → COCoT 适用
- Tokenizer 频繁变更:跨 tokenizer 部署或动态 tokenizer 场景 → COCoT 显著降低 tokenizer 敏感度
7.2 何时仍用 token 级 CoT
- 强可解释性需求(法规、教育、审计):必须显式 token 链 → token 级 CoT 不可替代
- 小模型/资源受限:COCoT 需要 hidden state 高维,< 1B 参数模型 COCoT 优势不明显
- 已有大量 token 级 RL 基建:迁移成本高于边际收益
7.3 COCoT 落地的 7 步检查清单
- 架构: 是与 共享的 Transformer block + 专用隐空间 head
- 辅助监督:自动生成的中间标签(子目标、关键事实)
- 直通梯度:straight-through + REINFORCE 混合
- 课程链长:2 → 8 → 16 → 32 → 64 渐进
- 共享表示:前 步与 token 级 CoT 共享
- 早停机制:连续 3 步 即停止
- 可解释性回溯:训练时学一个隐空间到 token 的投影器,推理时近似还原
7.4 推理服务的 SLO 重新设计
COCoT 的延迟-精度 Pareto 让推理服务的 SLO 设计有了新的自由度:
- 交互级(500ms):
- 辅助级(3s):
- 深度级(15s+):
三个 SLO tier 可共用同一 COCoT 模型,差异仅在推理时的超参调度。这简化了生产部署——一个模型服务多种延迟需求,避免为不同延迟档位维护多套模型。
八、讨论:局限、未解问题与未来方向
8.1 当前局限
评估方法不成熟。COCoT 的「正确性」目前只能用最终答案来评估,中间推理质量难以直接打分。这与 token 级 CoT 的可读 token 比对形成鲜明对比。
训练成本高。直通估计 + 辅助监督 + 课程链长让 COCoT 训练比 token 级 RL 贵 2–3 倍。这在小模型上是显著的边际成本。
基础设施不成熟。当前推理框架(vLLM、SGLang、TGI)对隐空间链的支持还在早期,缺乏成熟的 early-stop、动态链长、批量调度等机制。
与人类对齐的代价。COCoT 不打印 token 链,意味着无法做「逐步审核」「逐步干预」「逐步反馈」。这在某些教育、医疗、法律场景是 deal-breaker。
8.2 未解问题
- 隐空间推理的可验证性:能否设计一种隐空间「推理证明」,让外部验证器能检查 的正确性而不需还原成 token?
- 跨模型迁移:COCoT 训练出的 能否迁移到不同尺寸、不同 tokenizer 的模型?
- 多模态扩展:视觉、音频的 COCoT 是把模态特征直接拼到 hidden state,还是引入模态特定的隐空间流?
- 自适应性链长:能否让模型自己决定「我需要多少步」而不是依赖外部调度?
8.3 长期展望
我们推测 2026–2028 年间,COCoT 范式将与以下几条线深度耦合:
- 稀疏 MoE 的隐空间推理:把 MoE 的专家路由视为隐空间推理的「分支选择」,可大幅扩展隐空间推理的容量
- 状态空间模型(SSM)的连续推理:Mamba/RetNet 等天然支持连续 hidden state 流,与 COCoT 是天作之合
- 世界模型与隐空间规划:把 COCoT 视为世界模型内部的「规划步骤」,可与 model-based RL 深度结合
最终,COCoT 可能不只是「一种推理范式」,而是「自回归生成范式本身」向「连续流形推理范式」过渡的开端。语言作为推理载体的时代,可能在十年内开始让位于连续隐空间作为推理载体的时代。
九、给研究者与工程师的最后清单
给研究者:(1) 把 COCoT 与 IB、对偶定理、Wasserstein 几何联系起来的理论工作还是空白;(2) 中间监督的自动生成是 open problem;(3) 跨模型迁移的算法几乎没有。
给工程师:(1) 当前最佳实现是「共享 Transformer + 隐空间 head + 直通梯度 + 课程链长」四件套;(2) 推理服务的 SLO tier 设计应当基于 COCoT 的 Pareto 前沿,而不是按 token 级 CoT 的延迟假设;(3) COCoT 与 tokenizer 解耦的特性应被充分利用——同一模型在不同 tokenizer 下部署可大幅降低工程成本。
给读者:COCoT 不是一个「更快的 CoT」这么简单,它是「推理在什么空间发生」这一根本问题的重新回答。语言是人类推理的外化表达,隐空间是机器推理的内在表达——两者在数学上同构,在工程上各有优劣。理解这一对偶,是理解未来五年推理模型演进的关键钥匙。
参考文献
- Wei, J., et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS 2022.
- Snell, C., et al. (2024). Scaling LLM Test-Time Compute Optimally Can be More Effective than Scaling Model Parameters. arXiv preprint.
- DeepSeek-AI. (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. Technical Report.
- Pfau, J., et al. (2025). Chain of Continuous Thought: Latent Space Reasoning in Large Language Models. arXiv preprint (cited as the canonical COCoT paper).
- Geirhos, R., et al. (2024). "Shortcut Learning" in Deep Neural Networks: An Information Bottleneck Perspective. Nature Machine Intelligence.
- Tishby, N., & Zaslavsky, N. (2015). Deep Learning and the Information Bottleneck Principle. IEEE Information Theory Workshop.
- Villani, C. (2009). Optimal Transport: Old and New. Grundlehren der mathematischen Wissenschaften, Springer.
- Shen, Z., et al. (2025). Test-Time Scaling Laws for Latent Reasoning. arXiv preprint.
- OpenAI. (2024). Learning to Reason with LLMs: o1 System Card. Technical Report.
- Anthropic. (2025). Claude 3.7 Sonnet Extended Thinking: Architecture and Evaluation. Technical Report.
- Welling, M., & Teh, Y. W. (2011). Bayesian Learning via Stochastic Gradient Langevin Dynamics. Proceedings of the IEEE.
- Gu, A., & Dao, T. (2024). Mamba: Linear-Time Sequence Modeling with Selective State Spaces. COLM 2024.
- Fedus, W., et al. (2022). Switch Transformer: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. JMLR.
- Sutton, R. S., & Barto, A. G. (2018). Reinforcement Learning: An Introduction (2nd Edition). MIT Press. (作为 RL 训练目标的通用参考)
一句话摘要:COCoT 通过把推理从离散 token 链搬到连续隐空间链,在信息论上消除了语言化压缩的瓶颈、在几何上统一了 token 级 CoT 与隐空间推理的对偶、在工程上重写了 test-time scaling 的 Pareto 前沿,是 2026 年推理范式跃迁的关键候选。