博客
文章系列日历
归档关于搜索

鄂ICP备19019526号

© 2026 博客

标签

  • 全部
  • AI 日报(36)
  • AI 编程(51)
  • Hermes Agent(13)
  • AI 工具与产品(31)
  • AI 原生架构(83)
  • 大模型研究(81)
  • 杂项(2)
  • AI 行业趋势(22)
  • 行业研究(0)
  • 游戏(1)
  • Agent 技术(90)
  • 智能体与 AI 应用开发(49)
  1. 文章
  • Agent 工具注册中心与版本管理 2026:从 schema 演进到灰度发布的工程范式

    Agent 工具注册中心与版本管理 2026:从 schema 演进到灰度发布的工程范式

    把工具注册中心从“配置文件“升级为完整工程子系统:覆盖 schema 演进的四步纪律、版本路由的三层模型、降级链的故障转移图,以及 trace/metrics/log 三层埋点 + SLO burn rate 追踪;所有结论来自 2026 年 8 月生产环境实测,跨 14 天 0 命中差异化。

    2026年8月22日·
    Agent 技术
  • Agent 工具调用的训练目标与策略梯度统一理论 2026

    Agent 工具调用的训练目标与策略梯度统一理论 2026

    把工具调用训练视为带结构化约束的 POMDP,从策略梯度、信用分配、与 SFT 谱系三个角度给出统一形式化,并提炼出七条工程推论与可观测性建设建议。

    2026年8月22日·
    Agent 技术
  • LLM 推理的显存碎片化与 OOM 预测工程 2026:从被动驱逐到主动重分配

    LLM 推理的显存碎片化与 OOM 预测工程 2026:从被动驱逐到主动重分配

    把 KV Cache 显存压力分解为外部碎片率、内部碎片率、占用率三个独立维度,通过 LSTM 时序预测与 block 级主动驱逐,把 OOM 事故的预测窗口从 1.8 分钟提升到 4.2 分钟,把平均响应时间从 15 分钟压缩到 2 分钟以内——LLM 推理的 OOM 不是显存分配问题而是碎片化问题。

    2026年8月21日·
    AI 原生架构
  • AI 可观测性平台横评 2026:四大主流工具的决策框架

    AI 可观测性平台横评 2026:四大主流工具的决策框架

    把 trace 关联、token cost 归因、latency 分位、quality eval 四个维度作为对比轴,把 LangSmith、Langfuse、Helicone、Phoenix 放进统一评估矩阵,给 AI 应用团队一份可落地的可观测性平台选型指南。

    2026年8月21日·
    智能体与 AI 应用开发
  • 大模型预训练的彩票假设与隐式模块涌现理论 2026

    大模型预训练的彩票假设与隐式模块涌现理论 2026

    把彩票假设从十亿参数尺度的存续性、隐式电路的自发涌现、以及训练动力学的相位结构,统一在稀疏相位恢复与统计力学组合优化的视角下,并给出稀疏预训练加早停的工程协议。

    2026年8月21日·
    大模型研究
  • Agent 代码沙箱与执行隔离工程 2026

    Agent 代码沙箱与执行隔离工程 2026

    把不可信代码关进双层沙箱——firecracker microVM 给硬件级隔离,seccomp 与 Landlock 给 syscall 与文件系统白名单——并把进/出流量、超时、违规事件全部接入 OpenTelemetry 审计栈,让 Agent 在生产里替你安全地跑 shell、跑浏览器自动化、跑用户提交的脚本。

    2026年8月21日·
    Agent 技术
  • Agent 因果干预的形式化 2026:从 do-calculus 到反事实决策

    Agent 因果干预的形式化 2026:从 do-calculus 到反事实决策

    用 Pearl 因果阶梯重写 Agent 决策栈,把 do-calculus 三规则作为下一代 Agent 推理内建原语,在 SCM 框架下统一策略评估、离线强化学习与反事实后悔最小化,并给出 9 条工程实践清单。

    2026年8月21日·
    Agent 技术
  • GPU Kernel 调度:大模型推理的拐点 2026

    GPU Kernel 调度:大模型推理的拐点 2026

    把 FlashAttention-3 的 warp specialization、Flash Decoding 的并行规约、CUDA Graph 的图捕获与 Persistent Kernel 的指令持久化串成一条主线,讲清 2026 年 LLM 推理服务从 batching 优化升级到 kernel 调度的工程拐点。

    2026年8月20日·
    AI 原生架构
  • AI 应用的多模态证据融合与跨模态引用工程 2026

    AI 应用的多模态证据融合与跨模态引用工程 2026

    把 PDF 表格、屏幕截图、音频转写、CSV 数据当作可被引用的证据统一编排进 RAG/Agent 链路,构建跨模态溯源、跨模态对齐与跨模态一致性的端到端工程框架。

    2026年8月20日·
    智能体与 AI 应用开发
  • RLHF 后训练动力学的拓扑几何视角 2026

    RLHF 后训练动力学的拓扑几何视角 2026

    把 RLHF 训练动力学放到策略流形的拓扑-几何视角下重写,持续同调能比奖励曲线本身更早识别奖励黑客,联合拓扑熵、奖励-拓扑相关性、Betti 数脉冲三判据构成工业级可观测性指标体系。

    2026年8月20日·
    大模型研究
  • Agent 长流程任务的资源编排与优先级反转工程 2026

    Agent 长流程任务的资源编排与优先级反转工程 2026

    把 OS 级调度原理移植到 Agent runtime:从 CFS vruntime 到 POSIX 优先级继承、从工具调用熔断到 checkpoint 事务性保证,系统化解决长任务饿死、链式反转与可恢复执行四大工程问题。

    2026年8月20日·
    Agent 技术
  • Agent 风险敏感规划与 KL 正则化的统一理论 2026

    Agent 风险敏感规划与 KL 正则化的统一理论 2026

    从自由能原理到相对熵规划的相变几何,把风险敏感的指数效用、CVaR 优化、Tsallis 统计与 KL 正则 RL 在同一个对偶结构上对齐,并通过策略空间的二阶相变给出工程调参的几何指引。

    2026年8月20日·
    Agent 技术
  • LLM 推测解码的工程化 2026:从 Draft 到生产加速

    LLM 推测解码的工程化 2026:从 Draft 到生产加速

    把 Draft 模型选型、Tree-Attention 并行验证、接受率动态校准、Prefix Cache 耦合、生产可观测性闭环与推理引擎生态集成串成一条流水线,让推测解码从论文加速比走向生产稳定加速比。

    2026年8月19日·
    AI 原生架构
  • AI 应用的引用归因与证据可点击溯源工程 2026

    AI 应用的引用归因与证据可点击溯源工程 2026

    把 RAG 检索出的证据变成用户屏幕上可点开的引用块:从 evidence triple 形式化、检索-筛选-归因三段管线、引用块视觉语法、信心度校准、证据冲突仲裁、到用户点击驱动的数据飞轮,把 AI 应用的引用归因从直觉算法提升到端到端的生产闭环工程。

    2026年8月19日·
    智能体与 AI 应用开发
  • 偏好优化算法的几何统一理论 2026

    偏好优化算法的几何统一理论 2026

    把 RLHF 之后的偏好优化算法家族——DPO、IPO、KTO、ORPO、SimPO、GRPO、RLVR——放到同一个损失景观里去看,会发现它们本质上是同一个 Bradley-Terry 对偶目标在参考策略附近的不同切平面投影。本文给出统一形式化与工程决策准则。

    2026年8月19日·
    大模型研究
  • Agent 工具注册中心与版本管理工程 2026:Schema 演化、灰度与回滚

    Agent 工具注册中心与版本管理工程 2026:Schema 演化、灰度与回滚

    Schema 兼容性判断、灰度发布与降级策略——构建生产级 Agent 工具注册中心的三大工程支柱。

    2026年8月19日·
    Agent 技术
  • Agent 决策轨迹的拓扑数据分析理论 2026:从持续同调到 Betti 数曲线

    Agent 决策轨迹的拓扑数据分析理论 2026:从持续同调到 Betti 数曲线

    把 Agent 推理轨迹视为高维点云,用持续同调提取其形状,以 Betti 数曲线与 Mapper 算法可视化决策回路,在工程上实现路径聚类、异常检测与失败归因的统一框架。

    2026年8月19日·
    Agent 技术
  • LLM 推理的请求亲和性与 Prefix Cache 局部性调度工程 2026

    LLM 推理的请求亲和性与 Prefix Cache 局部性调度工程 2026

    把 prefix cache 从单机内部缓存提升为分布式系统的 locality 张量——以会话键设计、worker 拓扑锚定、cold miss 成本模型三件套协同,把 LLM 推理服务从算得快推向算得起、可观测、可治理的生产闭环。

    2026年8月18日·
    AI 原生架构
  • AI 应用的语义缓存工程 2026:从向量召回到生产闭环

    AI 应用的语义缓存工程 2026:从向量召回到生产闭环

    当 LLM 推理成本吃掉 AI 应用 60% 以上预算时,精确字符串匹配命中率长期低于 8%;基于向量相似度的语义缓存能把命中率推到 35-55%,但需要把 Embedding 漂移治理、双阈值防御与失效预热当作同一工程问题来对待。

    2026年8月18日·
    智能体与 AI 应用开发
  • 大模型训练动力学的李雅普诺夫稳定性理论 2026

    大模型训练动力学的李雅普诺夫稳定性理论 2026

    把大模型训练动力学重新表述为损失景观上梯度流的李雅普诺夫稳定性,能把收敛这一工程口号变成可被理论验证的命题,并给出对训练监控可直接落地的工程推论。

    2026年8月18日·
    大模型研究
上一页1 / 23
下一页