当前标签:大模型研究 · 共 55 篇
把大模型的能力涌现视为统计力学的有限尺寸相变,用 Fisher 标度假设与临界指数给出可证伪的统一框架,把 emergent abilities 现象统一到 Wilson-Fisher 不动点的 RG flow 语言里。
把训练—泛化双序参量纳入 Landau 势刻画几何相变、用持久同调的 Betti 数离散合并刻画拓扑相变,两层耦合后 grokking 被理解为损失空间的二级相变与解空间的一阶拓扑相变在临界权重衰减下的同步事件——既能解释跃迁的延迟性与阶跃性,又能为长 epoch 训练提供可工程化的监控指标。
把大模型损失景观视为高维 Morse 函数,把训练、LoRA 微调、模型合并与对称性破缺统一为同一套临界点分类与障碍谱理论,可推导 LoRA 线性模式连通性的成立条件,并给出合并何时安全可用的工程判据。
把 MoE 路由函数映射到 Gibbs 分布、把专家温度映射到能量函数、把负载均衡约束映射到化学势约束——通过配分函数层级、自由能极小化、对称性破缺三个统计力学工具,把路由工程中的工程经验(温度、Top-K、辅助损失)收编为同一配分函数族的可微推论。
从离散吸收过程、概率流到并行解码,系统解释扩散语言模型如何把 token 确定顺序变成可学习的动态调度,并分析采样步数、误差传播与自回归模型的计算边界。
把多个微调后的大模型看成同一参数流形上的不同任务切片,知识蒸馏是从教师切片的切线丛往学生切片的指数映射,模型合并是把各切片切向量沿联络平移到公共原点的群作用,两者在黎曼几何下统一为任务算子的流形配准,并给出曲率诊断、合并冲突的形式化解与跨模型迁移的几何不变量。
把推理时五种主流算力分配范式统一为对真实后验的 KL 散度逼近问题,给出每种范式的衰减阶、覆盖半径与 Pareto 决策边界。
把 test-time compute 视作可分配预算的形式化框架,把 compute-optimal scaling law、自适应推理预算分配、test-time RL 整合到同一张统计力学相图上,并给出 5 条工程可执行项。
最大更新参数化(μP)通过标度变换的几何不变性,使小模型的最佳超参数能够零样本迁移到大模型,为trillion级参数LLM的调参提供了一条理论与实践仿备的可行路径。
RL训练范式的演化揭示了从显式价值估计(PPO)到隐式对比优化(DPO)再到去 Critic 的群组优势拓扑(GRPO)的统一几何内核——这一演化本质上是将奖励标量场重构为偏好流形上的最优传输问题,从而绕过了高维文本空间中价值函数逼近的固有困难。
系统拆解大模型评测的核心指标体系、主流方法学路径与最具影响力的公开评测平台与开源项目;从 PPL、MMLU-Pro、SWE-bench 到 Chatbot Arena,帮助研究者和工程师建立可落地的评测认知框架。
当 DPO 把 RLHF 折成对偶损失、GRPO 把 PPO 的 critic 折成群组基线、RLVR 把奖励折成规则验证器时,三条路径殊途同归地落在奖励几何、偏好采样、验证反馈的统一三轴上;本文从公理化与不动点的角度重建这条谱系,澄清当前工程实践里被混淆的若干概念。
把自回归语言模型的离散 token 生成重新解释为吸收马尔可夫链在嵌入空间的几何投影,把连续时间扩散模型重新解释为发射马尔可夫链在数据流形的布朗游走;当嵌入维度 d 与序列长度 T 同时趋于无穷,二者在数据流形上坍缩为同一族对偶半群——这一对偶性是 LLaDA、MERCY、Diffusion-LM 等离散扩散语言模型统一在连续扩散 SDE 框架下的理论根因。
当 LLaDA、Mercury、Seed Diffusion 把逐 token 自回归换成整句去噪时,文本生成的几何形状从单向链式路径塌缩成双向流形上的扩散轨迹——本文用 score matching、并行接受率统计与去噪曲率三件套,给出这一范式转移的严格理论脚手架。
大模型知识编辑通过因果追踪定位知识神经元,结合 ROME、MEMIT 等超平面编辑算法实现精准修正,核心挑战在于批量编辑时的追踪-干扰平衡——知识方向正交化是当前最有效的干扰控制手段。
DeepSeek-V3 风格无辅助损失本质是把负载均衡约束从 Lagrangian 形式转化为节点势函数形式的几何对偶——三种视角统一指向同一 Fisher 流形优化问题。
把 LLM 的非自回归生成从离散扩散的随机游走重写为一条可微的常微分方程轨迹,在向量空间直接走最优传输直线,从而把推理时计算、收敛性、可控性统一到一套 ODE 求解器里。
当 LLM 被视作由稀疏子图(circuit)构成的计算图,叠加假说揭示了「为什么模型能用少于特征数的神经元编码所有特征」,本文给出从归因、因果干预到稀疏编码的几何统一。
把 CoT 重新形式化为推理图 G=(V,E,W),本文用可达性测度、组合复杂度与图采样下界三件套,统一解释 CoT 有效性,并给出三条未公开验证的猜想。
DeepSeek 抛出的 NSA 把 attention 的接受域切成了可学习的压缩/选择/滑动窗三分支。本文用 metric-measure 空间给出五条主定理(紧化存在性、压缩不动点、稀疏率相变、与 Mamba-2 SSD 的对偶谱、与 GQA/MQA 的几何包含),并画出两条训练动力学相变曲线,给研究者五条未公开验证的几何猜想与一份八项工程基线。