博客
文章系列日历
归档关于搜索

鄂ICP备19019526号

© 2026 博客

标签

  • 全部
  • AI 日报(36)
  • AI 编程(51)
  • Hermes Agent(13)
  • AI 工具与产品(31)
  • AI 原生架构(56)
  • 大模型研究(53)
  • 杂项(2)
  • AI 行业趋势(22)
  • 行业研究(0)
  • 游戏(1)
  • Agent 技术(34)
  • 智能体与 AI 应用开发(19)
  1. 文章
  • 主动推断视角下的 Agent 世界模型与工具选择:自由能最小化的统一框架

    主动推断视角下的 Agent 世界模型与工具选择:自由能最小化的统一框架

    本文从自由能原理和主动推断出发,提出 Agent 的世界模型是环境生成过程的变分近似,工具调用是信息增益行动,记忆更新遵循变分推断规律,三者在自由能最小化目标下实现统一。

    2026年7月25日·
    Agent 技术
  • LLM 推理混合精度路由工程 2026: 从 FP8 权重到 INT4 KV 的生产真相

    LLM 推理混合精度路由工程 2026: 从 FP8 权重到 INT4 KV 的生产真相

    在线推理的显存墙不再是单一精度的命题: 本文拆解 FP8 权重 + INT4 KV + FP16 attention 这套生产级混合精度栈如何在 LLM 推理中实现 35% 显存节省 + 7% p99 时延回缩, 同时保证 KV cache 跨会话复用的命中率不塌方。

    2026年7月24日·
    AI 原生架构
  • Prompt 工程化与回归测试 2026:从版本化、A/B 平台到 prompt-CI 的闭环

    Prompt 工程化与回归测试 2026:从版本化、A/B 平台到 prompt-CI 的闭环

    把 prompt 从魔法字符串升级为一等软件资产:git 化 + 分层契约 + 三道 CI 闸门 + 稳定哈希分桶 A/B + trace 回流闭环,每一次 prompt 改动都接入版本控制、回归测试、灰度发布与一键回滚。

    2026年7月24日·
    智能体与 AI 应用开发
  • 大模型损失景观的 Morse 拓扑与模式连通性 2026

    大模型损失景观的 Morse 拓扑与模式连通性 2026

    把大模型损失景观视为高维 Morse 函数,把训练、LoRA 微调、模型合并与对称性破缺统一为同一套临界点分类与障碍谱理论,可推导 LoRA 线性模式连通性的成立条件,并给出合并何时安全可用的工程判据。

    2026年7月24日·
    大模型研究
  • Agent 的 Prompt Injection 防御工程 2026:纵深防御的真相

    Agent 的 Prompt Injection 防御工程 2026:纵深防御的真相

    Agent 的 Prompt Injection 防御不是单点技术而是纵深工程,本文从输入侧 trust tier、检测层对抗模式库、运行时防火墙结构化指令栈、输出侧 deterministic guard、持续红队评估五层,给出 2026 年生产 Agent 真正可落地的纵深防御闭环与八个必走动作清单。

    2026年7月24日·
    Agent 技术
  • Agent 主动信息获取的理论统一视角 2026

    Agent 主动信息获取的理论统一视角 2026

    把“问什么”和“做哪个动作”放在同一个期望-信息联合流形上统一决策,从 POMDP、bandit、information theory 到 active inference 的统一线索,本文给出 2026 年最新的理论骨架与五条工程推论。

    2026年7月24日·
    Agent 技术
  • MoE 推理 All-to-All 与 NVLink 拓扑感知调度工程 2026

    MoE 推理 All-to-All 与 NVLink 拓扑感知调度工程 2026

    把 MoE 推理的跨卡专家路由变成可调参的工程对象:grouped-top-K 让通信局部化、DeepEP 把 dispatch 融合到 kernel、NUMA-aware + nvlink-topo-file 暴露物理拓扑、EAGLE-2/3 + 共享 routing cache 把单 token decode 摊到多 token,再用四层 OTel 指标守住专家热点与带宽长尾。

    2026年7月23日·
    AI 原生架构
  • 多步任务代理应用的生产执行工程 2026:从任务分解、状态机到错误恢复的闭环架构

    多步任务代理应用的生产执行工程 2026:从任务分解、状态机到错误恢复的闭环架构

    从任务分解的边界模糊性到长程上下文的窗口耗尽,从中途失败的断点缺失到执行结果验证的级联风险——多步任务代理应用的核心工程挑战在于建立可靠的状态机抽象与多层恢复策略。

    2026年7月23日·
    智能体与 AI 应用开发
  • 稀疏激活 MoE 的统计力学理论 2026:从配分函数到专家专科化涌现的统一视角

    稀疏激活 MoE 的统计力学理论 2026:从配分函数到专家专科化涌现的统一视角

    把 MoE 路由函数映射到 Gibbs 分布、把专家温度映射到能量函数、把负载均衡约束映射到化学势约束——通过配分函数层级、自由能极小化、对称性破缺三个统计力学工具,把路由工程中的工程经验(温度、Top-K、辅助损失)收编为同一配分函数族的可微推论。

    2026年7月23日·
    大模型研究
  • Agent capability 库的可发现性工程 2026

    Agent capability 库的可发现性工程 2026

    把 capability 索引当作一等公民:embedding 索引 + cross-encoder 重排 + DAG 组合 + 健康降级 + 四指标可观测,让 Agent 从知道 1000 个工具变成在合适的回合挑出合适的 3 个。

    2026年7月23日·
    Agent 技术
  • Agent 元认知与错误归因的形式化 2026:从失败溯源、置信度反传到决策熔断的统一算子

    Agent 元认知与错误归因的形式化 2026:从失败溯源、置信度反传到决策熔断的统一算子

    把失败事件视为可被形式化编码的张量、把元认知视为递归自指的算子幂、把置信度视为反传到决策层的反向梯度,让 Agent 能在每一轮决策时显式回答“我正在做什么、我可能错在哪里、如果错了该怎么回收”,从而把“可观测性”推进到“可计算性”。

    2026年7月23日·
    Agent 技术
  • LLM 推理调度的延迟公平性工程 2026:从 WFQ、抢占到多 SLO 的生产闭环

    LLM 推理调度的延迟公平性工程 2026:从 WFQ、抢占到多 SLO 的生产闭环

    当 LLM 推理的瓶颈从 KV 内存转移到调度器公平性,我们看到 TTFT p99 在多租户混合负载下漂移 5%,长尾请求被短请求频繁插队饿死;本文从 WFQ 公平排队、协作/非协作抢占、多 SLO 分层队列三方面拆解生产级推理调度器的工程真相。

    2026年7月22日·
    AI 原生架构
  • LLM 应用可观测性平台选型 2026:四大主流工具的工程真相

    LLM 应用可观测性平台选型 2026:四大主流工具的工程真相

    把 LLM 应用可观测性分解为 Trace/Metrics/Eval/Cost 四维,用 LangSmith/Langfuse/Phoenix/Helicone 四个产品在四维上的实际能力画出一张可在 2026 下半年直接拿去拍板的工程选型决策矩阵,配上四层部署架构与三条铁律。

    2026年7月22日·
    智能体与 AI 应用开发
  • 扩散语言模型的时间反演理论

    扩散语言模型的时间反演理论

    从离散吸收过程、概率流到并行解码,系统解释扩散语言模型如何把 token 确定顺序变成可学习的动态调度,并分析采样步数、误差传播与自回归模型的计算边界。

    2026年7月22日·
    大模型研究
  • Agent SLA 与生产级可用性工程 2026:从承诺、降级到熔断校验的闭环架构

    Agent SLA 与生产级可用性工程 2026:从承诺、降级到熔断校验的闭环架构

    把 SLA 当作一个三层闭环来展开,配套 SLO 一等公民、可观测性栈、退路熔断、对账工程、六个必走动作清单与 30/60/90 上线节奏。

    2026年7月22日·
    Agent 技术
  • Agent 决策的不确定性量化与置信度校准理论 2026

    Agent 决策的不确定性量化与置信度校准理论 2026

    从可靠图分解、贝叶斯近似、共形预测到风险敏感决策的统一形式化框架,并配套 ReAct、Reflexion、MCP、HITL 四类 agent 架构的可观测接口。

    2026年7月22日·
    Agent 技术
  • LLM 推理安全纵深防御工程 2026:输入过滤、越狱检测与对抗训练闭环

    LLM 推理安全纵深防御工程 2026:输入过滤、越狱检测与对抗训练闭环

    LLM 推理安全是输入过滤、越狱检测、内容审计、对抗训练四层纵深防御系统工程,生产目标为召回率95%以上、误伤率0.1%以下、P99延迟5ms以内。

    2026年7月21日·
    AI 原生架构
  • 对话 AI 应用的长期记忆与人格一致性工程 2026

    对话 AI 应用的长期记忆与人格一致性工程 2026

    把对话产品的长期一致性拆成可量化的四层存储、五因子检索、七轴评估,并给出 20 轮锚点重注入、事实冲突检测、越狱集每周更新等五条可执行清单,适合正在做对话应用的工程师与产品经理。

    2026年7月21日·
    智能体与 AI 应用开发
  • 大模型知识蒸馏与模型合并的黎曼几何 2026:从任务算子、流形缝合到统一配准

    大模型知识蒸馏与模型合并的黎曼几何 2026:从任务算子、流形缝合到统一配准

    把多个微调后的大模型看成同一参数流形上的不同任务切片,知识蒸馏是从教师切片的切线丛往学生切片的指数映射,模型合并是把各切片切向量沿联络平移到公共原点的群作用,两者在黎曼几何下统一为任务算子的流形配准,并给出曲率诊断、合并冲突的形式化解与跨模型迁移的几何不变量。

    2026年7月21日·
    大模型研究
  • Agent 网关与流量治理工程 2026:从单租户限流到多租户成本护栏的生产闭环

    Agent 网关与流量治理工程 2026:从单租户限流到多租户成本护栏的生产闭环

    Agent 网关已经从可选项升级为 Agent 生产化的核心基础设施,它必须在 50ms 内完成流量整形、配额检查、模型降级、工具隔离与成本归因六大决策,并以 Redis 原子配额桶、动态路由评分与 OTel GenAI 可观测性为标准范式。

    2026年7月21日·
    Agent 技术
上一页1 / 16
下一页