博客
文章系列日历
归档关于搜索

鄂ICP备19019526号

© 2026 博客

标签

  • 全部
  • AI 日报(36)
  • AI 编程(51)
  • Hermes Agent(13)
  • AI 工具与产品(31)
  • AI 原生架构(68)
  • 大模型研究(65)
  • 杂项(2)
  • AI 行业趋势(22)
  • 行业研究(0)
  • 游戏(1)
  • Agent 技术(58)
  • 智能体与 AI 应用开发(32)
  1. 文章
  • Agent 人工介入与升级策略工程 2026:从触发边界、证据包到安全接管的闭环架构

    Agent 人工介入与升级策略工程 2026:从触发边界、证据包到安全接管的闭环架构

    生产 Agent 的人工介入不是简单的审批按钮,而是一套覆盖不确定性量化、状态机租约、并发安全与反馈闭环的系统工程。升级策略的工程化是 2026 年 Agent 落地的核心技术挑战。

    2026年8月6日·
    Agent 技术
  • Agent 因果表征学习 2026:从干预不变性到反事实决策的统一理论

    Agent 因果表征学习 2026:从干预不变性到反事实决策的统一理论

    当 Agent 需要在分布漂移、奖励黑客、长链路信用稀释中保持稳健决策时,纯统计学习得到的关联表征会反复失效;只有把因果结构作为归纳偏置注入表征学习与决策回路,才能让 Agent 拥有真正的反事实推理能力——本文沿 SCM、do-算子、可识别性、反事实回放四条主线,给出一个从表征到决策的因果化统一框架。

    2026年8月6日·
    Agent 技术
  • LLM 推理服务的弹性伸缩与冷启动工程 2026

    LLM 推理服务的弹性伸缩与冷启动工程 2026

    把冷启动拆成六阶段流水线、把弹性伸缩纳入 L、W、S、C 四元组、把 Warm Pool 与 Spot 实例按业务 SLO 组合,通过 CUDA graph 缓存、KEDA LLM-aware autoscaler、graceful drain、GPU circuit breaker 五件套,把 LLM 推理服务的资源池动态行为推上一个台阶。

    2026年8月5日·
    AI 原生架构
  • AI 原生 UX 模式的工程化 2026

    AI 原生 UX 模式的工程化 2026

    把流式输出、结构化输出、可中断、可编辑、可逆、可观测六类原语装配到前端工程里,从 streaming 协议、partial JSON 解析、CRDT 编辑器到失败恢复策略,构建从 PoC 到规模化的 AI 应用 UX 闭环。

    2026年8月5日·
    智能体与 AI 应用开发
  • 位置编码的谱理论 2026:从 RoPE 外推到 ALiBi 衰减的几何统一

    位置编码的谱理论 2026:从 RoPE 外推到 ALiBi 衰减的几何统一

    把 RoPE 相位编码、ALiBi 低通滤波、绝对编码离散频率统一为对注意力内积的频率滤波器,外推性等价于滤波器在未训练频段的衰减率是否可压缩——这一谱视角解释 LLaMA-2 选 ALiBi、LLaMA-3 回归 RoPE 的工程选择,为下一代内容相关位置编码提供设计原则。

    2026年8月5日·
    大模型研究
  • Agent 状态快照与会话热迁移工程 2026

    Agent 状态快照与会话热迁移工程 2026

    状态快照与会话热迁移通过分层序列化、Pre/Post-Copy混合策略、幂等性协议和混沌验证四大核心机制,让长时间跨度的复杂Agent任务在生产环境中实现故障无感接续和跨节点无缝迁移。

    2026年8月5日·
    Agent 技术
  • Agent 长链路决策的信用分配理论 2026

    Agent 长链路决策的信用分配理论 2026

    把信用分配作为长链路 Agent 决策的心脏病问题,以优势函数、回报分解、反事实归因三范式为骨架,提出双层优势传播、Shapley 嵌入缓存、互信息稀疏性三件套作为 2026 年下半年可工程落地的统一求解器,并给出五条工程推论与三个研究方向。

    2026年8月5日·
    Agent 技术
  • LLM 推理的训练-推理一致性工程 2026:从算子融合、激活回收到位元保真的生产闭环

    LLM 推理的训练-推理一致性工程 2026:从算子融合、激活回收到位元保真的生产闭环

    把训练-推理不一致拆解成算子融合、激活数值与 KV 布局三类通道,引入位元保真上限,通过双路径对照、per-layer skew、长 context PPL 矩阵与跨 GPU 厂商审计四条工程闭环,把 skew 从偶发事故转成 SRE 的常态化治理能力。

    2026年8月4日·
    AI 原生架构
  • AI 应用的实时数据接入与 RAG 新鲜度工程 2026

    AI 应用的实时数据接入与 RAG 新鲜度工程 2026

    把 CDC 流式 ETL、增量嵌入、版本化索引与时窗化检索组装成一条端到端 freshness 链,把 80% 内容过时导致的 RAG 质量投诉转为可观测、可告警、可回滚的生产事件。

    2026年8月4日·
    智能体与 AI 应用开发
  • 偏好优化算法的 Fisher 信息几何统一 2026

    偏好优化算法的 Fisher 信息几何统一 2026

    从 Fisher 信息度量出发,把 DPO/IPO/SimPO/GRPO/ORPO 这一族偏好优化方法统一为偏好流形上的不同梯度下降路径 — 区别只在 reference 选择、参数化空间、梯度场定义三个自由度,而非优化目标的几何本质。

    2026年8月4日·
    大模型研究
  • Agent 配置热更新与无损回滚

    Agent 配置热更新与无损回滚

    围绕提示词、工具 schema、模型路由与权限策略,建立可版本化、可灰度、可审计且能安全回滚的 Agent 生产配置生命周期。

    2026年8月4日·
    Agent 技术
  • Agent 规划的隐空间几何 2026:从世界模型、梯度场到隐式策略采样的统一形式化

    Agent 规划的隐空间几何 2026:从世界模型、梯度场到隐式策略采样的统一形式化

    本文把 LLM Agent 规划重新表述为潜变量流形上的测地线搜索问题,统一世界模型、策略梯度场与隐式策略采样三条独立脉络,提炼七条工程推论与六个研究方向。

    2026年8月4日·
    Agent 技术
  • Context Cache 工程 2026:KV 复用与 NIAH 生产闭环

    Context Cache 工程 2026:KV 复用与 NIAH 生产闭环

    Context Cache 不是狭义的 KV Cache 复用,而是对长上下文输入进行有策略的记忆、压缩、检索和再利用的完整工程体系,核心在于识别上下文中真正被模型使用的部分,并在缓存命中率、内存占用和输出质量三者之间找到工程上可维护的平衡

    2026年8月3日·
    AI 原生架构
  • RAG 应用向量数据库全链路可观测性工程 2026:从选型基准到生产级监控的闭环架构

    RAG 应用向量数据库全链路可观测性工程 2026:从选型基准到生产级监控的闭环架构

    把 RAG 应用的可观测性从看不见变成看得见、追得到、能行动,需要从延迟分布、ANN 召回率、混合检索权重、分块质量等多个维度建立持续评估闭环。本文系统覆盖向量数据库选型基准、全链路监控体系、帕累托追踪与自我优化闭环的工程实践。

    2026年8月3日·
    智能体与 AI 应用开发
  • 大模型灾难性遗忘的谱理论 2026:Hessian 谱签名与任务向量正交化

    大模型灾难性遗忘的谱理论 2026:Hessian 谱签名与任务向量正交化

    本文提出「谱签名」作为灾难性遗忘的统一几何坐标,把 EWC、LoRA、task arithmetic、rehearsal 等机制纳入 F(θ₀,t₁,t₂) = ‖H^(1/2)ₜ₁(θ*ₜ₂ − θ*ₜ₁)‖² / ‖H^(1/2)ₜ₁‖² 算子的不同范式,并给出 LoRA rank、任务序列、谱裁剪三件套的工程决策表。

    2026年8月3日·
    大模型研究
  • Agent 的 sandbox 执行工程:从 firecracker 微内核到 browser-use 隔离的生产闭环

    Agent 的 sandbox 执行工程:从 firecracker 微内核到 browser-use 隔离的生产闭环

    Agent 的 sandbox 执行工程:从 firecracker 微内核到 browser use 隔离的生产闭环 一、问题的提出:为什么 sandbox 成了 Agent 工程的「最后一公里」 2026 年的 Agent 系统早已不是单纯的 prompt 编排。当一个 Agent

    2026年8月3日·
    Agent 技术
  • Agent 上下文工程的形式化 2026:从注意力衰减、信息瓶颈到可控压缩率

    Agent 上下文工程的形式化 2026:从注意力衰减、信息瓶颈到可控压缩率

    把上下文工程建模为速率-失真问题,用 $R(d)$ 衰减律、信息瓶颈、$S(E)$ 语义保留率三组可验证指标替换「塞满窗口」叙事——最优压缩率 30%、最佳选取准则是互信息增益、长上下文不等于有效上下文。

    2026年8月3日·
    智能体与 AI 应用开发
  • LLM Tokenizer 词表工程 2026:从裁剪到 Token 经济学

    LLM Tokenizer 词表工程 2026:从裁剪到 Token 经济学

    把词表作为推理系统的隐藏第一公里,审视多语言词表覆盖、词表裁剪收益、Token 与 KV cache 浪费的耦合、词表兼容性与下游迁移成本,把工程真相拆到生产可落地的粒度。

    2026年8月2日·
    AI 原生架构
  • AI 应用模型版本治理工程 2026:从供应商版本漂移到回归门禁的闭环架构

    AI 应用模型版本治理工程 2026:从供应商版本漂移到回归门禁的闭环架构

    把 AI 应用看作一张有向契约图,把模型版本变化抽象为图上的契约边,通过嵌入维度治理、Adapter 抽象层、回归门禁与双轨评估,把版本治理从被动救火转为主动稳态控制。

    2026年8月2日·
    智能体与 AI 应用开发
  • 合成数据Scaling Laws与模型崩溃的统一理论框架 2026

    合成数据Scaling Laws与模型崩溃的统一理论框架 2026

    合成数据的Scaling优势与模型崩溃风险是同一枚硬币的两面——它们都根植于多样性这一核心变量。300B token是关键拐点,真实数据的不可替代性是基本约束。通过修正Scaling Law、崩溃避免定理与Token-Level Editing的统一框架,工程上可建立可控的合成数据Scaling决策体系。

    2026年8月2日·
    大模型研究
上一页1 / 19
下一页