博客
文章系列日历
归档关于搜索

鄂ICP备19019526号

© 2026 博客

标签

  • 全部
  • AI 日报(36)
  • AI 编程(51)
  • Hermes Agent(13)
  • AI 工具与产品(31)
  • AI 原生架构(54)
  • 大模型研究(51)
  • 杂项(2)
  • AI 行业趋势(22)
  • 行业研究(0)
  • 游戏(1)
  • Agent 技术(30)
  • 智能体与 AI 应用开发(17)
  1. 文章
  • Agent 元认知与错误归因的形式化 2026:从失败溯源、置信度反传到决策熔断的统一算子

    Agent 元认知与错误归因的形式化 2026:从失败溯源、置信度反传到决策熔断的统一算子

    把失败事件视为可被形式化编码的张量、把元认知视为递归自指的算子幂、把置信度视为反传到决策层的反向梯度,让 Agent 能在每一轮决策时显式回答“我正在做什么、我可能错在哪里、如果错了该怎么回收”,从而把“可观测性”推进到“可计算性”。

    2026年7月23日·
    Agent 技术
  • LLM 推理调度的延迟公平性工程 2026:从 WFQ、抢占到多 SLO 的生产闭环

    LLM 推理调度的延迟公平性工程 2026:从 WFQ、抢占到多 SLO 的生产闭环

    当 LLM 推理的瓶颈从 KV 内存转移到调度器公平性,我们看到 TTFT p99 在多租户混合负载下漂移 5%,长尾请求被短请求频繁插队饿死;本文从 WFQ 公平排队、协作/非协作抢占、多 SLO 分层队列三方面拆解生产级推理调度器的工程真相。

    2026年7月22日·
    AI 原生架构
  • LLM 应用可观测性平台选型 2026:四大主流工具的工程真相

    LLM 应用可观测性平台选型 2026:四大主流工具的工程真相

    把 LLM 应用可观测性分解为 Trace/Metrics/Eval/Cost 四维,用 LangSmith/Langfuse/Phoenix/Helicone 四个产品在四维上的实际能力画出一张可在 2026 下半年直接拿去拍板的工程选型决策矩阵,配上四层部署架构与三条铁律。

    2026年7月22日·
    智能体与 AI 应用开发
  • 扩散语言模型的时间反演理论

    扩散语言模型的时间反演理论

    从离散吸收过程、概率流到并行解码,系统解释扩散语言模型如何把 token 确定顺序变成可学习的动态调度,并分析采样步数、误差传播与自回归模型的计算边界。

    2026年7月22日·
    大模型研究
  • Agent SLA 与生产级可用性工程 2026:从承诺、降级到熔断校验的闭环架构

    Agent SLA 与生产级可用性工程 2026:从承诺、降级到熔断校验的闭环架构

    把 SLA 当作一个三层闭环来展开,配套 SLO 一等公民、可观测性栈、退路熔断、对账工程、六个必走动作清单与 30/60/90 上线节奏。

    2026年7月22日·
    Agent 技术
  • Agent 决策的不确定性量化与置信度校准理论 2026

    Agent 决策的不确定性量化与置信度校准理论 2026

    从可靠图分解、贝叶斯近似、共形预测到风险敏感决策的统一形式化框架,并配套 ReAct、Reflexion、MCP、HITL 四类 agent 架构的可观测接口。

    2026年7月22日·
    Agent 技术
  • LLM 推理安全纵深防御工程 2026:输入过滤、越狱检测与对抗训练闭环

    LLM 推理安全纵深防御工程 2026:输入过滤、越狱检测与对抗训练闭环

    LLM 推理安全是输入过滤、越狱检测、内容审计、对抗训练四层纵深防御系统工程,生产目标为召回率95%以上、误伤率0.1%以下、P99延迟5ms以内。

    2026年7月21日·
    AI 原生架构
  • 对话 AI 应用的长期记忆与人格一致性工程 2026

    对话 AI 应用的长期记忆与人格一致性工程 2026

    把对话产品的长期一致性拆成可量化的四层存储、五因子检索、七轴评估,并给出 20 轮锚点重注入、事实冲突检测、越狱集每周更新等五条可执行清单,适合正在做对话应用的工程师与产品经理。

    2026年7月21日·
    智能体与 AI 应用开发
  • 大模型知识蒸馏与模型合并的黎曼几何 2026:从任务算子、流形缝合到统一配准

    大模型知识蒸馏与模型合并的黎曼几何 2026:从任务算子、流形缝合到统一配准

    把多个微调后的大模型看成同一参数流形上的不同任务切片,知识蒸馏是从教师切片的切线丛往学生切片的指数映射,模型合并是把各切片切向量沿联络平移到公共原点的群作用,两者在黎曼几何下统一为任务算子的流形配准,并给出曲率诊断、合并冲突的形式化解与跨模型迁移的几何不变量。

    2026年7月21日·
    大模型研究
  • Agent 网关与流量治理工程 2026:从单租户限流到多租户成本护栏的生产闭环

    Agent 网关与流量治理工程 2026:从单租户限流到多租户成本护栏的生产闭环

    Agent 网关已经从可选项升级为 Agent 生产化的核心基础设施,它必须在 50ms 内完成流量整形、配额检查、模型降级、工具隔离与成本归因六大决策,并以 Redis 原子配额桶、动态路由评分与 OTel GenAI 可观测性为标准范式。

    2026年7月21日·
    Agent 技术
  • Agent 持续学习的弹性权重理论 2026:从 EWC、SI 到任务向量正交的统一形式化

    Agent 持续学习的弹性权重理论 2026:从 EWC、SI 到任务向量正交的统一形式化

    把 Fisher 信息矩阵、Hebbian trace、任务向量方向三类持续学习机制在 Agent 场景下做形式化统一,给出参数级 inertia、行为级保留、数据级重放三条保护线的协同架构,以及十条可立即落地的工程规则。

    2026年7月21日·
    Agent 技术
  • LLM 网关与代理工程 2026:多模型路由、语义缓存与限流治理的统一架构

    LLM 网关与代理工程 2026:多模型路由、语义缓存与限流治理的统一架构

    2026 年 LLM 生产系统的必备基础设施——网关层以多模型路由、语义缓存、令牌桶限流、三轴可观测性四大能力,实现 AI 流量的成本可控、韧性可靠与运维可观测。

    2026年7月20日·
    AI 原生架构
  • AI 实时协作工程 2026:CRDT 与 conflict-aware 推理

    AI 实时协作工程 2026:CRDT 与 conflict-aware 推理

    多人 AI 协作的本质是“把 AI 变成协作对象而非中心服务器”——通过 CRDT 实现无冲突的共享 context、conflict-aware scheduler 降低 50-70% token 成本、CRDT 操作日志满足合规审计,最终让 AI 在多人场景下的行为与人类协作编辑一样自然、可追溯。

    2026年7月20日·
    智能体与 AI 应用开发
  • 推理时计算分配的变分下界理论 2026:五范式的统一几何

    推理时计算分配的变分下界理论 2026:五范式的统一几何

    把推理时五种主流算力分配范式统一为对真实后验的 KL 散度逼近问题,给出每种范式的衰减阶、覆盖半径与 Pareto 决策边界。

    2026年7月20日·
    大模型研究
  • Agent 调试与可观测性工程 2026:从 token 级归因到生产复盘的四层架构

    Agent 调试与可观测性工程 2026:从 token 级归因到生产复盘的四层架构

    把 Agent trace 拆成数据模型、运行时三轴采集、replay/bisect 调试协议、postmortem+fix-forward 复盘四层架构,从 token 级归因到三轴 SLO 告警,建立数据驱动的 Agent 工程质量闭环。

    2026年7月20日·
    Agent 技术
  • Agent 推理的因果推断视角 2026:do-calculus 与反事实决策框架

    Agent 推理的因果推断视角 2026:do-calculus 与反事实决策框架

    把因果推断的 SCM + do-calculus + 反事实三件套作为 Agent 决策的形式化骨架:通过把工具调用显式建模为 do(X)、把 self-critique 锚定到已观察事实、并建立因果监控指标体系,让 Agent 在长任务失败归因、工具链级联错误、个性化策略调整等当前最稀缺场景下获得质的提升。

    2026年7月20日·
    Agent 技术
  • LLM 推理服务的能耗与碳感知调度工程 2026:从 PUE 到碳感知路由的生产闭环

    LLM 推理服务的能耗与碳感知调度工程 2026:从 PUE 到碳感知路由的生产闭环

    把单次推理能耗分解为 FLOPs × 内存 × IO 三轴度量,通过 DVFS 下限配置、SM 占用率调优、carbon-aware 时空路由、prefix cache 与 Carbon Span 可观测性,在不牺牲延迟 SLO 的前提下实现 30-50% 的总能耗下降;本文给出 GPU 级、调度级、可观测性级三层工程闭环的 Pareto 前沿与 7 条可落地的 SRE 清单。

    2026年7月19日·
    AI 原生架构
  • AI 应用的数据飞轮与冷启动工程 2026:从用户反馈闭环到模型自迭代的四层架构

    AI 应用的数据飞轮与冷启动工程 2026:从用户反馈闭环到模型自迭代的四层架构

    把 LLM 应用的反馈闭环拆成信号采集、反馈归因、数据回流、模型自迭代四层工程基础设施,把冷启动的零用户与小样本两个阶段分别形式化,并给出三轴约束与七条工程纪律,让应用越用越好用。

    2026年7月19日·
    智能体与 AI 应用开发
  • Test-Time Scaling 的计算最优分配理论 2026

    Test-Time Scaling 的计算最优分配理论 2026

    把 test-time compute 视作可分配预算的形式化框架,把 compute-optimal scaling law、自适应推理预算分配、test-time RL 整合到同一张统计力学相图上,并给出 5 条工程可执行项。

    2026年7月19日·
    大模型研究
  • Agent 人机协作(HITL)工程 2026:从审批流到反馈闭环的生产落地

    Agent 人机协作(HITL)工程 2026:从审批流到反馈闭环的生产落地

    当 Agent 从 demo 走到生产,什么时候让人介入、介入之后状态如何恢复、人的反馈如何回流为模型偏好,这三个问题把一个会说话的玩具变成会协作的同事;本文把 HITL 拆成审批流、可恢复执行、反馈闭环、权限边界四块工程,给出可直接落地的实现骨架与失败模式清单。

    2026年7月19日·
    Agent 技术
上一页1 / 16
下一页