博客
文章系列日历
归档关于搜索

鄂ICP备19019526号

© 2026 博客

标签

  • 全部
  • AI 日报(36)
  • AI 编程(51)
  • Hermes Agent(13)
  • AI 工具与产品(31)
  • AI 原生架构(80)
  • 大模型研究(78)
  • 杂项(2)
  • AI 行业趋势(22)
  • 行业研究(0)
  • 游戏(1)
  • Agent 技术(82)
  • 智能体与 AI 应用开发(46)
  1. 文章
  • LLM 推理的请求亲和性与 Prefix Cache 局部性调度工程 2026

    LLM 推理的请求亲和性与 Prefix Cache 局部性调度工程 2026

    把 prefix cache 从单机内部缓存提升为分布式系统的 locality 张量——以会话键设计、worker 拓扑锚定、cold miss 成本模型三件套协同,把 LLM 推理服务从算得快推向算得起、可观测、可治理的生产闭环。

    2026年8月18日·
    AI 原生架构
  • AI 应用的语义缓存工程 2026:从向量召回到生产闭环

    AI 应用的语义缓存工程 2026:从向量召回到生产闭环

    当 LLM 推理成本吃掉 AI 应用 60% 以上预算时,精确字符串匹配命中率长期低于 8%;基于向量相似度的语义缓存能把命中率推到 35-55%,但需要把 Embedding 漂移治理、双阈值防御与失效预热当作同一工程问题来对待。

    2026年8月18日·
    智能体与 AI 应用开发
  • 大模型训练动力学的李雅普诺夫稳定性理论 2026

    大模型训练动力学的李雅普诺夫稳定性理论 2026

    把大模型训练动力学重新表述为损失景观上梯度流的李雅普诺夫稳定性,能把收敛这一工程口号变成可被理论验证的命题,并给出对训练监控可直接落地的工程推论。

    2026年8月18日·
    大模型研究
  • Agent 混沌工程与故障注入:生产环境的可控失控

    Agent 混沌工程与故障注入:生产环境的可控失控

    将主动制造故障的工程文化引入 LLM Agent 系统,通过四层故障注入拓扑和五阶段放量法,在受控实验中验证 Agent 系统的韧性边界。

    2026年8月18日·
    Agent 技术
  • Agent 决策的电路复杂度理论 2026

    Agent 决策的电路复杂度理论 2026

    把 Agent 决策建模成带 oracle 的电路图,从 AC0/TC0/P-complete 的层级看 ReAct、Plan-and-Execute、Tree-of-Thoughts 的深度与宽度边界,以及 LLM 在电路视角下的复杂度分类与工程推论。

    2026年8月18日·
    Agent 技术
  • LLM 推理的拓扑感知调度工程 2026

    LLM 推理的拓扑感知调度工程 2026

    在 H100/H200/Blackwell 这一代硬件上,把拓扑三元组(机内拓扑、网络拓扑、显存拓扑)作为调度的一等公民,通过 NVLink/NVSwitch 拓扑对齐、PCIe 边界回避、HBM3e 容量带宽拓扑三角协同,把被拓扑失配吞掉的 30% 算力释放出来。

    2026年8月17日·
    AI 原生架构
  • AI 应用的成本归因与单位经济学工程 2026

    AI 应用的成本归因与单位经济学工程 2026

    把 AI 应用的 token 成本归因到 trace / feature / tenant 三层,围绕客户级单位经济学建立 FinOps 闭环架构,从缓存 ROI、路由 Pareto、客户毛利摊薄到 7 步工程实践,系统讲解 2026 年中型 AI 应用公司从 PoC 走向健康毛利的核心基础设施。

    2026年8月17日·
    智能体与 AI 应用开发
  • 大模型 Scaling Law 的临界相变理论 2026

    大模型 Scaling Law 的临界相变理论 2026

    把 scaling law 从经验拟合上升到损失景观的临界相变定理,把 Chinchilla 2 维决策扩展到 N-D-Q 三维 Pareto 前沿,给出 70/30 阶段预算切分 + 30-50% 合成占比的统一工程决策框架。

    2026年8月17日·
    大模型研究
  • Agent 上下文压缩的滑动窗口策略工程 2026

    Agent 上下文压缩的滑动窗口策略工程 2026

    把上下文管理从“塞进去就行”的工程债,转译为 token 预算、注意力权重与语义距离的三维优化问题,再用固定窗口、摘要压缩、重要性锚点三层滑动策略协同,把 Agent 长会话的失败率压低到可观测的 SLO 之内。

    2026年8月17日·
    Agent 技术
  • Agent 决策的算法信息论 2026:从 K 复杂度到 MDL 的统一框架

    Agent 决策的算法信息论 2026:从 K 复杂度到 MDL 的统一框架

    把 Agent 的策略选择、上下文压缩、抽象层级统一视为最小描述长度的优化问题,从而把“为什么这样做”从直觉工程升级为可计算、可证伪的信息论推断。

    2026年8月17日·
    Agent 技术
  • LLM 推理的碳感知调度工程 2026

    LLM 推理的碳感知调度工程 2026

    把电网碳强度作为可调度信号,把 token 级能耗作为成本分子,把延迟容忍度作为弹性信号,在时空二维网格上做联合优化,让每千 token 的 gCO₂ 降到 15-25% 的可执行闭环。

    2026年8月16日·
    AI 原生架构
  • AI 应用的协作模式与多人共编工程 2026:从共享上下文到团队记忆的闭环架构

    AI 应用的协作模式与多人共编工程 2026:从共享上下文到团队记忆的闭环架构

    当 AI 应用从个人助手升级到团队工作空间,单用户范式的 prompt 边界、tool 鉴权、上下文血缘都必须被重新工程化——本文给出 multi-user AI workspace 的四元组形式化、共享上下文血缘治理、多用户操作冲突解决、租户级权限隔离、实时协同的流式一致性、操作归因与团队记忆的完整闭环架构。

    2026年8月16日·
    智能体与 AI 应用开发
  • 大模型涌现能力的相变理论 2026

    大模型涌现能力的相变理论 2026

    把涌现能力重新表述为损失景观上 Hessian 谱退化的拓扑相变——亏格与 Betti 数在临界算子越过阈值时阶跃,给出 5 条可证伪的训练预测与 4 条工程映射,从检测、加速到可控化的统一框架。

    2026年8月16日·
    大模型研究
  • Agent 任务编排的 DAG 化与可重放执行工程 2026

    Agent 任务编排的 DAG 化与可重放执行工程 2026

    把 agent 任务编排从线性 chain 升级为 DAG,配合 event sourcing 与 stub replay,把 LLM agent 从难以复现的黑盒变成可调试、可重放、可观测的工程系统——这是 LLM agent 从 demo 走向 production 的必经之路。

    2026年8月16日·
    Agent 技术
  • Agent 叙事一致性的同调群理论 2026

    Agent 叙事一致性的同调群理论 2026

    把长会话 Agent 的叙事一致性视作记忆复形上的同调不变性,给出一条精确的代数判别——单群秩守恒、相干遗忘的右逆存在、瓶颈下界守住。三件套把叙事崩从观察性的事后分析提升为可计算的预判。

    2026年8月16日·
    Agent 技术
  • LLM 推理服务的灾备与故障转移工程 2026

    LLM 推理服务的灾备与故障转移工程 2026

    把模型权重、KV cache、生成配置三类状态的可恢复性作为独立工程目标,通过四层切流架构与三类健康检查端点,把故障转移链路拆解到毫秒级可控粒度。

    2026年8月15日·
    AI 原生架构
  • AI 写作助手的工程化 2026:从单轮生成到交互式创作的生产闭环

    AI 写作助手的工程化 2026:从单轮生成到交互式创作的生产闭环

    AI 写作助手不是 RAG 也不是 ChatBot——它要在长文中保持事实一致、术语稳定、风格不漂移,要支持撤销/回滚/分支修订,跨越单轮生成与多轮交互的统一 manifold 做温度调度。本文给出完整工程化真相。

    2026年8月15日·
    智能体与 AI 应用开发
  • 大模型 In-Context Learning 的贝叶斯推断理论 2026

    大模型 In-Context Learning 的贝叶斯推断理论 2026

    本文从 Bayesian 推断的视角重构 In-Context Learning 的理论框架,把 Transformer 前向计算解释为对隐式任务后验的近似采样,并由此统一 meta-learning、Gaussian Process 与 Gibbs sampling 三条传统路径,推导出 prompt 设计与 ICL 失败模式的工程准则。

    2026年8月15日·
    大模型研究
  • Agent 工具调用的 cost-aware 路由与 per-tool 预算工程

    Agent 工具调用的 cost-aware 路由与 per-tool 预算工程

    当 Agent 的工具调用从演示走向生产,成本不再只是 token 账单里的一行,而是横跨第三方 API、向量检索、代码执行、网页抓取、模型级联等多个独立计费源的复合经济学,本文系统化拆解 cost-aware routing、per-tool token budget、cost observability 三件套在 2026 年的工程真相与生产落地路径。

    2026年8月15日·
    Agent 技术
  • Agent 有限理性边界理论 2026:从 Simon 满意化到认知预算的形式化

    Agent 有限理性边界理论 2026:从 Simon 满意化到认知预算的形式化

    把 Simon 的有限理性从约束情境重写为可计算的认知预算分配问题, 用熵正则化的序列决策统一了满意化、启发式截止与 reflection 频率三种早期退出形式, 给出 Agent 在算力-时间-信息三重约束下的最优停止准则, 把 ReAct、Reflexion、Plan-and-Execute 三种推理范式归纳为同一框架的局部最优解。

    2026年8月15日·
    Agent 技术
上一页1 / 23
下一页