博客
文章系列日历
归档关于搜索

鄂ICP备19019526号

© 2026 博客

标签

  • 全部
  • AI 日报(36)
  • AI 编程(51)
  • Hermes Agent(13)
  • AI 工具与产品(31)
  • AI 原生架构(58)
  • 大模型研究(55)
  • 杂项(2)
  • AI 行业趋势(22)
  • 行业研究(0)
  • 游戏(1)
  • Agent 技术(39)
  • 智能体与 AI 应用开发(21)
  1. 文章
  2. 大模型研究

当前标签:大模型研究 · 共 55 篇

  • 课程学习的相变理论 2026:从易到难数据排序与损失景观耦合

    课程学习的相变理论 2026:从易到难数据排序与损失景观耦合

    本文用统计场论重新推导课程学习,把课程温度 τ 与泛化误差的耦合刻画为亚临界-临界-超临界三段式相变,给出临界温度 τc 的封闭形式、盆地连通性的相变诊断,以及 SRE 训练平台可观测性的三组新指标。

    2026年7月7日·
    大模型研究
  • 推测解码的接受率统计力学 2026:从草稿-目标分布匹配到最优猜测长度的相变理论

    推测解码的接受率统计力学 2026:从草稿-目标分布匹配到最优猜测长度的相变理论

    本文建立推测解码的接受率统计力学框架,揭示单次推测窗口的接受数方差与 Rényi 散度的有限样本相变性质,证明最优猜测长度 κ* 在 α ∈ [0.68, 0.75] 的实际工作区间内自然收敛到 [3,7],并论证 α_c ≈ 0.74 作为工程相变点的双曲鞍点本质。

    2026年7月6日·
    大模型研究
  • 状态空间模型的对偶谱理论 2026:从选择性扫描、HiPPO 矩阵到 Mamba-2 的对偶几何

    状态空间模型的对偶谱理论 2026:从选择性扫描、HiPPO 矩阵到 Mamba-2 的对偶几何

    本文从连续线性 ODE 出发,重建 SSM 的离散对偶形式,证明 Mamba 选择性扫描与 S4 对偶卷积核在频域共享同一谱族,并由此推出 Mamba-2 SSD 对偶的线性注意力等价与受限傅里叶基的秩-1 闭式。

    2026年7月5日·
    大模型研究
  • 大模型训练动力学的非平衡统计力学 2026:当 SGLD、SDE 与 SGD 撞上损失景观的隐式正则化时

    大模型训练动力学的非平衡统计力学 2026:当 SGLD、SDE 与 SGD 撞上损失景观的隐式正则化时

    把优化器重新理解为带温度场的动态系统是 2026 年大模型训练理论的最大范式转移。本文以 Langevin 动力学、Fokker-Planck 方程与辛几何三条数学线索,重新审视 SGD、Shampoo、Muon、SOAP 的统一图景,揭示隐式正则化作为大模型泛化的真正设计自由度——并指出 K-FAC、Shampoo、Muon 等二阶方法的本质是把损失景观各向异性转化为更新方向协方差矩阵的单位化。

    2026年7月4日·
    大模型研究
  • 神经网络损失景观的拓扑学 2026:从模式连接、低损耗盆地到模型合并的几何基础

    神经网络损失景观的拓扑学 2026:从模式连接、低损耗盆地到模型合并的几何基础

    用微分拓扑与持续同调重新解读 LLM 损失景观:模式连接性、MoE 置换对称性、持续预训练的盆地相变与后训练稀疏奖励的高原-峡谷结构,给出 2026 年合并与后训练的工程决策框架。

    2026年7月3日·
    大模型研究
  • 注意力机制的秩坍缩与低秩瓶颈理论 2026:当 token mixing 撞上训练动力学的低秩瓶颈时

    注意力机制的秩坍缩与低秩瓶颈理论 2026:当 token mixing 撞上训练动力学的低秩瓶颈时

    本文从 cross-entropy 几何结构出发,给出注意力 $W_V$ 矩阵低秩吸引子定理,证明有效秩上界为 $mathrm{rank}(V^*)$。结合 Adam 隐式秩正则化、softmax 谱压缩、扩散 / DPO 等不同训练目标的秩变化,统合理解 2026 年所有主流注意力变体、KV cache 压缩算法与 LoRA rank 选择的理论基础。

    2026年7月2日·
    大模型研究
  • 分组查询注意力 GQA 的几何学 2026:当 MQA、DeepSeek MLA 与 KV 共享的极限相遇

    分组查询注意力 GQA 的几何学 2026:当 MQA、DeepSeek MLA 与 KV 共享的极限相遇

    从 Multi-Head 到 Multi-Latent,分组查询注意力走过了从“等价压缩”到“几何重构”的四阶段演化;本文用信息几何与秩分析重新审视 GQA、MLA 与 Q/K 解耦的极限,并给出 2026 H2 注意力架构选型的理论判据。

    2026年7月1日·
    大模型研究
  • 涌现即统计幻觉?2026 大语言模型能力边界的几何相变理论

    涌现即统计幻觉?2026 大语言模型能力边界的几何相变理论

    把涌现能力、grokking、长度泛化统一为同一族几何相变;用统计场论与微分几何重建能力流形;给出 4 个可证伪预言与 GP-Bench 协议。

    2026年6月30日·
    大模型研究
  • Test-time Scaling 的信息论几何 2026:当推理时计算撞上熵坍缩与互信息瓶颈

    Test-time Scaling 的信息论几何 2026:当推理时计算撞上熵坍缩与互信息瓶颈

    用信息论重建 test-time scaling:熵坍缩定理 + 互信息瓶颈 + ToT Pareto 前沿三个核心定理,加上 Mermaid 调度流程图与 2026 H2 趋势猜想,给出 verifier 驱动的统一决策框架。

    2026年6月29日·
    大模型研究
  • 离散扩散 LLM 的理论重建 2026:从 LLaDA 到 Mercury 的非自回归生成为何重塑推理时计算的几何

    离散扩散 LLM 的理论重建 2026:从 LLaDA 到 Mercury 的非自回归生成为何重塑推理时计算的几何

    当文本生成从打字机式自回归转向块级并行去噪,推理时计算的帕累托前沿正在被改写。本文从 Markov 链基础出发,重建 LLaDA 8B、Gemini Diffusion、Mercury Coder 与 DiffusionGemma 的统一理论框架,解释为什么 dLLM 不仅带来 5-10 倍吞吐量,还重新分配了推理时 compute 的最优预算。

    2026年6月28日·
    大模型研究
  • 位置编码与长度泛化的理论重建 2026:当 RoPE 撞上 loss landscape

    位置编码与长度泛化的理论重建 2026:当 RoPE 撞上 loss landscape

    从 Fourier 基的频带截断,到 ALiBi 的线性偏置假设,再到 YaRN 的双阶段插值与频谱保持,位置编码的演化本质上是一场关于“Transformer 能否在训练窗口外做频率泛化”的理论辩论。本文从 loss landscape 的频域耦合角度重建这一辩论的理论框架,并给出 2026 年的工业级决策依据。

    2026年6月27日·
    大模型研究
  • 模型合并的几何学:Task Arithmetic、TIES、DARE 与进化搜索的理论基础

    模型合并的几何学:Task Arithmetic、TIES、DARE 与进化搜索的理论基础

    当一个社区在 12 个月内合并出 200+ 个 SOTA 模型时,模型合并已经从工程技巧升格为可被严格分析的理论对象。本文从权重空间几何、Taylor 低阶截断、interference 算法分解与进化搜索四个层次,为 2026 年的模型合并画一张算法几何地图。

    2026年6月26日·
    大模型研究
  • 机制可解释性的理论重建 2026:从电路分析到因果中介的范式跃迁

    机制可解释性的理论重建 2026:从电路分析到因果中介的范式跃迁

    2024-2026 年 mech interp 从手工作坊走向半自动化 + 理论化双轨:稀疏自编码器在 Claude 3 Sonnet 上识别 3400 万个单义特征,ACDC 算法在 4 GPU 小时内自动重建 IOI 电路,因果中介分析把 head 级 indirect effect 形式化。MoE / Mamba-3 / CoT 推理的可解释性扩展也已起步,但 TC0 理论边界意味着纯 attention 电路无法完备解释推理时计算。

    2026年6月25日·
    大模型研究
  • Weight Merging 的理论重建 2026:Task Arithmetic、TIES 与 DARE 三大范式的数学基础与边界

    Weight Merging 的理论重建 2026:Task Arithmetic、TIES 与 DARE 三大范式的数学基础与边界

    当多个微调后的 LLM 都站在损失景观的低谷平原上时,模型合并的成败取决于它们是否处于同一个线性模式连通盆地。本文从线性模式连通性出发,拆解 Task Arithmetic、TIES-MERGING 与 DARE 三大合并范式的数学假设、归并冲突与冗余处理。

    2026年6月24日·
    大模型研究
  • 数据选择理论 2026:从 influence functions 到 data curation scaling laws 的范式跃迁

    数据选择理论 2026:从 influence functions 到 data curation scaling laws 的范式跃迁

    2026 年大模型研究的最深刻转向不是更大的模型,而是更聪明的“挑数据的策略”。本文从 influence functions 的早期理论出发,沿着 data curation scaling laws、selection-via-loss、qualitative diversity 三条路径,重建 2026 年大模型数据选择理论的全貌,论证“数据缩放律”正在替代“参数缩放律”成为预训练效率的新瓶颈。

    2026年6月23日·
    大模型研究
  • 合成数据训练与模型坍缩的相变理论 2026

    合成数据训练与模型坍缩的相变理论 2026

    用统计力学和随机矩阵理论重新审视 model collapse:本文给出 2026 年关于递归合成数据训练的可量化边界,给出 n_c、rho、sigma_min* 三个可测量量。

    2026年6月22日·
    大模型研究
  • LLM 的归纳偏置与组合泛化:Transformer 是否真正具备系统性能力

    LLM 的归纳偏置与组合泛化:Transformer 是否真正具备系统性能力

    从 Chomsky 的系统性原则出发,结合 SCAN、COGS 等结构化基准的近期实证,重新审视 Transformer 是否真正具备结构性归纳偏置,并提出面向组合泛化的架构诊断框架。

    2026年6月21日·
    大模型研究
  • Grokking 与大模型训练的相变理论:当泛化能力在损失饱和之后突然涌现

    Grokking 与大模型训练的相变理论:当泛化能力在损失饱和之后突然涌现

    本文重新审视 Grokking 现象在大模型训练语境下的理论意涵——损失函数在长时间饱和之后突然出现的泛化跃迁,并非“训练巧合”,而是损失景观中高维相变的宏观投影。理解这一相变结构,将重塑我们对涌现能力、缩放定律与训练策略的工程直觉。

    2026年6月20日·
    大模型研究
  • 潜空间推理的几何学 2026:从 Coconut 到 CODI 的连续思维链如何重塑推理理论

    潜空间推理的几何学 2026:从 Coconut 到 CODI 的连续思维链如何重塑推理理论

    当显式 CoT 撞上 token 化的表达瓶颈,潜空间连续推理正成为 2026 年推理理论的新前沿。本文以 Coconut (ICLR 2025) 与 CODI (2026-01) 为轴,剖析连续思维链如何通过 hidden state 传递替代 token 生成,揭示其在隐空间几何、训练动力学、可解释性三个层面的理论重塑,并给出离散 vs 连续 CoT 的工程选型决策树。

    2026年6月19日·
    大模型研究
  • 优化器的几何学:2026 年大模型训练的 Lion-2、Muon 与 Shampoo 复兴

    优化器的几何学:2026 年大模型训练的 Lion-2、Muon 与 Shampoo 复兴

    当 LLM 训练规模突破万亿 token,AdamW 不再是默认答案——本文从损失景观几何学出发,分析 Lion-2、Muon、Soap、Shampoo 四大优化器家族在 2026 年 LLM 训练中如何超越 AdamW,节省 10-35% 训练 token。

    2026年6月18日·
    大模型研究
上一页2 / 3
下一页