把“会话”当作“对话即文档”的协作对象——通过 Redis Stream + PG + S3 三层存储 + 滑动 TTL + Session Bus 风格的跨设备同步,把“刷新对话就没了”“换个手机找不到上次聊到哪”两个用户最敏感的痛点,转化为可观测、可治理、可计费的工程闭环。
把 RLHF、DPO、GRPO 视为偏好流形上的 Wasserstein 测地线,证明梯度方向相同、步长有界;给出对齐税下界与五条可证伪猜想。
把 PDF 文本流解析、视觉 OCR 容错、版面分析与结构化抽取做成端到端可观测的生产闭环,结合 docling + paddleocr + Instructor + Langfuse 的 2026 工程栈,把 Agent 的输入侧从黑盒变成可回归的金字塔。
Bayesian Theory of Mind 为 Agent 提供了从观测行为反推他人信念与意图的最优数学框架,其预测精度受 Fisher 信息量约束,在工程中需通过有限状态机近似和变分推断在精度与效率间权衡。
把 GPU 池化拆成 MIG、MPS、time-slicing、vGPU 四层垂直栈,用 (mathcal{G}, mathcal{T}, mathcal{S}, mathcal{Q}) 四元组和 DRF 公平性算法,讲清大模型推理服务从单卡独占到多租户切片的关键决策与失败模式。
把意图分类、查询改写、多路编排路由、可观测回写熔成一个统一的查询理解层,让 90% 的用户请求走确定性路由表、剩下的 10% 升级到 Planner-Executor,用预测熵、置信度、路由-评估耦合反馈三件套撑起 AI 应用前门工程的闭环可治理。
从无限宽度极限到 μP 标度律与特征学习的二元分解,给出可工程迁移的宽度-学习率-初始化方差联合标度法,并桥接重整化群与信息几何。
把 check-then-act race 形式化、把一致性等级标注作为工具契约、把租约机制与因果令牌作为跨 Agent 协调的统一真相,通过单 Agent 并发原语、分布式租约、checkpoint 协议与副作用追踪,把 Agent 系统从隐式假设推到显式工程。
把反事实后悔提升为 Agent 在不可逆行动空间中的统一元信号,推导紧致后悔界收敛,把工程中的撤销回滚语义提升为决策层可计算算子。
把分配、碎片、泄漏、峰值四面体作为显存压力工程的理论骨架;以 KV cache 池化、LSTM OOM 预警、四级优雅降级、显存泄漏门禁、NUMA 亲和性调度为五条生产治理轴;给出 13 项监控指标 + 8 条告警 + 4 类事故演练 + 3 项回归门禁的 SRE 可观测性清单。
函数调用可靠性是 LLM Agent 生产部署的核心挑战,通过错误分类、重试预算、熔断器、幂等性保障和 Checkpoint 五层体系,可将 Agent 任务成功率从 85% 级别提升到 99%+,同时控制额外延迟在业务可接受范围内。
把局部窗口、低秩近似、哈希桶三类稀疏路径放进同一个信息论率失真与频谱分析框架里——滑动窗口保留低频局部依赖但牺牲高频长程信号,线性注意力受 softmax 秩拉伸约束,哈希桶在两者之间通过学习桶分配逼近最优,工程选型应基于任务长度、类型与精度预算联合决策。
把 trace 采样、确定性回放、LLM-as-Judge 评分、回归集版本化、A/B 分流、护栏拦截六件事,串成一条从生产数据到推理回路的全链路闭环。
本文沿着非单调逻辑、TMS 真值维护、Dung 论辩框架、AGM 信念修订四条主线,把信念可错性从哲学语义拉到 Agent 工程可用层,并在自由能原理下做跨域统一,给可废止性一个工程契约式的形式化底座。
把 GPU SKU 选型、NVLink 拓扑、PCIe 通道、HBM 容量、TPU 切片、占位成本、跨域路由七个约束统一为一个调度真相,从单集群多卡到多云 TPU 共存的工程闭环。
把多租户 LLM 限流重新建模为二维 Wasserstein 距离最小化,工程上落地为双层令牌桶 + 加权公平队列 + 突发借据 + 软降级的四件套,补齐流量入口层公平性的工程空白。
用率失真函数与最小描述长度这两个互补视角,把自监督预训练、SFT、DPO/RLHF、对齐税、KV 压缩与模型合并统一为同一族信息论约束,揭示大模型在训练与推理全链路上不断做“隐式压缩”的统一机制。
把工具调用作为主入口之后,Prompt Injection 已从用户层攻击演变为经由 RAG 召回、网页抓取、邮件附件、PDF 内容流入模型上下文的间接注入。本文给出从威胁建模、分层防御、多源校验到 SRE 闭环的工程实战框架,把被 prompt 改写目标这类失败变成可观测、可回滚、可压测的工程事件。
把 Agent 的世界模型压缩、信念状态更新与动作选择,统一映射到 Friston 自由能原理的同一目标函数下,给出预测编码循环、误差驱动学习与主动推理三层架构,证明在长链路、高不确定性任务上比 ReAct、Reflexion 具备更紧的遗憾上界。
当一个应用同时调度数十个 LLM、跨越多家供应商、并在请求级做大小模型级联时,AI Gateway 不再是简单的反向代理——它是一个面向推理经济学与延迟 SLO 双目标的实时调度系统。本文从形式化定义到生产可观测性,给出 2026 年的完整工程路径:协议适配、配额隔离、成本感知权重、级联可验证性,以及给 SRE 的五件可观测性清单。