博客
文章系列日历
归档关于搜索

鄂ICP备19019526号

© 2026 博客

标签

  • 全部
  • AI 日报(36)
  • AI 编程(51)
  • Hermes Agent(13)
  • AI 工具与产品(31)
  • AI 原生架构(58)
  • 大模型研究(55)
  • 杂项(2)
  • AI 行业趋势(22)
  • 行业研究(0)
  • 游戏(1)
  • Agent 技术(39)
  • 智能体与 AI 应用开发(21)
  1. 文章
  2. AI 原生架构

当前标签:AI 原生架构 · 共 58 篇

  • Continuous Batching 与 Chunked Prefill 工程真相:从 vLLM 0.4 到 0.7 调度器的演进

    Continuous Batching 与 Chunked Prefill 工程真相:从 vLLM 0.4 到 0.7 调度器的演进

    vLLM 0.4 → 0.7 的调度器演进揭示了一个反直觉的事实:LLM 推理的瓶颈早已不在模型本身,而在调度器怎么把不同长度、不同生命周期的请求塞进同一个 GPU kernel。本文拆解 continuous batching 与 chunked prefill 两次决定性重构,以及 2026 年 disaggregation 的下一步。

    2026年6月17日·
    AI 原生架构
  • KV cache 优化工程实战 2026:从 PagedAttention 到 FlashDecoding 的生产级推理内核

    KV cache 优化工程实战 2026:从 PagedAttention 到 FlashDecoding 的生产级推理内核

    2026 年的 LLM 推理工程已经从堆 GPU 走向重写每一层显存访问。本文沿 PagedAttention / FlashAttention / FlashDecoding / Speculative Decoding 顺序,剖析生产级推理内核如何把单卡 decode 吞吐从 200 tok/s 推到 2000+ tok/s 的工程路径。

    2026年6月16日·
    AI 原生架构
  • LLM 可观测性工程实战 2026:从 OpenTelemetry GenAI 语义约定到生产级 trace 架构

    LLM 可观测性工程实战 2026:从 OpenTelemetry GenAI 语义约定到生产级 trace 架构

    当 LLM 应用进入生产,APM 工具的 QPS/P95/ErrorRate 已不再充分。本文从 8 个 GitHub 仓库实时数据出发,拆解 LLM 可观测性的 5 类核心信号(token/cost/latency/quality/retrieval)、OpenTelemetry GenAI 语义约定的标准化进程、Langfuse/Opik/Phoenix/OpenLLMetry/Helicone 五大开源项目横向对比,以及 5 个生产级工程模式与三类典型事故案例。

    2026年6月15日·
    AI 原生架构
  • RAG 工程实战 2026:从 Naive RAG 到 Agentic RAG 的四层架构跃迁

    RAG 工程实战 2026:从 Naive RAG 到 Agentic RAG 的四层架构跃迁

    Anthropic Contextual Retrieval 让检索失败率下降 67%、Self-RAG/CRAG/GraphRAG 三大自反思范式落地、Agentic RAG 的工程陷阱与选型决策树——一篇 2026 年 RAG 工程师的实战地图。

    2026年6月14日·
    AI 原生架构
  • 推理时计算的范式革命:当大模型学会“多花点时间想”之后,AI 架构发生了什么

    推理时计算的范式革命:当大模型学会“多花点时间想”之后,AI 架构发生了什么

    OpenAI o1/o3、Anthropic Claude 3.7 Sonnet、Google Gemini 2.5 Pro、DeepSeek R1——四家实验室在 2025 年集体把“推理时计算”推到默认能力。这篇文章拆解这场架构革命的根源、四条路径的差异,以及它对 AI 应用架构的连锁冲击。

    2026年6月13日·
    AI 原生架构
  • Agent 设计的反框架哲学:Anthropic 五大工作流模式深度解读

    Agent 设计的反框架哲学:Anthropic 五大工作流模式深度解读

    从 Augmented LLM 到自治 Agent——深度拆解 Anthropic 在《Building effective agents》中提出的五类工作流模式(Prompt Chaining / Routing / Parallelization / Orchestrator-Workers / Evaluator-Optimizer),结合 Cloudflare Code Mode 与 MCP 协议演进,探讨在 2026 年构建 LLM Agent 时应如何克制地引入复杂度。

    2026年6月12日·
    AI 原生架构
  • MCP 工程实战:把 Model Context Protocol 跑进生产环境的 5 个关键决策

    MCP 工程实战:把 Model Context Protocol 跑进生产环境的 5 个关键决策

    Anthropic 在 2024 年 11 月开源的 MCP 协议,在 2026 年已经从"概念验证"走向"生产部署"。本文以最新 2025-11-25 规范为锚点,从架构、传输、安全、性能、可观测五个维度,剖析在生产环境部署 MCP 时必须回答的工程问题,并附 Cloudflare Code Mode 等 2026 年新范式的实战代码。

    2026年6月11日·AI原生架构 · 第 12 篇·
    AI 原生架构
  • Agent 工程范式 2026:从 Workflow 到 Context Engineering 的演进路径

    Agent 工程范式 2026:从 Workflow 到 Context Engineering 的演进路径

    从 Anthropic《Building Effective Agents》到 LangChain《Context Engineering 的崛起》,复盘 2024–2026 Agent 工程范式演进:为什么 context 才是决定 agent 表现的关键,以及开发者应当如何落地。

    2026年6月11日·AI原生架构 · 第 11 篇·
    AI 原生架构
  • AI原生架构(十):通向ASI之路——AI原生应用的未来展望

    AI原生架构(十):通向ASI之路——AI原生应用的未来展望

    # AI原生架构(十):通向ASI之路——AI原生应用的未来展望 ## 引言:从技术突破到文明重构 在前九篇文章中,我们系统地探讨了AI原生应用架构的各个层面:从时代背景与架构跃迁,到成熟度模型;从11个关键要素的全景解读,到模型选择、Agent设计模式、上下文工程、智能体开发、分布式部署、AI网关、运行时,以及即将展开的可观测、评估与安全。这些内容构成了AI原生应用从理念到实践的完整拼图。...

    2026年5月12日·AI原生架构 · 第 10 篇·
    AI 原生架构
  • AI原生架构(九):AI应用运行时——驾驭不确定性的执行基座

    AI原生架构(九):AI应用运行时——驾驭不确定性的执行基座

    # AI原生架构(九):AI应用运行时——驾驭不确定性的执行基座 在前八篇文章中,我们依次探讨了AI原生应用的时代背景与架构跃迁、成熟度模型、11个关键要素全景、模型选择与Agent设计模式、上下文工程实战、智能体开发实践、分布式多智能体通信协议,以及AI网关——连接应用与大模型的智能总调度中心。现在,我们将进入AI原生应用架构中另一个至关重要的基础设施——**AI应用运行时(Runtime)*...

    2026年5月12日·AI原生架构 · 第 9 篇·
    AI 原生架构
  • AI原生架构(八):AI网关——连接应用与大模型的智能总调度中心

    AI原生架构(八):AI网关——连接应用与大模型的智能总调度中心

    # AI原生架构(八):AI网关——连接应用与大模型的智能总调度中心 在前七篇文章中,我们依次探讨了AI原生应用的时代背景与架构跃迁、成熟度模型、11个关键要素全景、模型选择与Agent设计模式、上下文工程实战、智能体开发实践,以及分布式多智能体通信协议。这些内容覆盖了构建AI原生应用的核心技术栈,但还有一个关键的"枢纽"尚未深入剖析——那就是AI网关。 如果说大模型是各具特长的专家团队,AI...

    2026年5月12日·AI原生架构 · 第 8 篇·
    AI 原生架构
  • AI原生架构(七):从单进程到分布式——A2A协议、Nacos注册中心与消息驱动

    AI原生架构(七):从单进程到分布式——A2A协议、Nacos注册中心与消息驱动

    # AI原生架构(七):从单进程到分布式——A2A协议、Nacos注册中心与消息驱动 在第六篇文章中,我们系统学习了从单智能体到工作流再到多智能体系统的开发模式,并初步探讨了分布式部署的必要性和A2A协议的基本概念。但这些讨论主要集中在概念层面,对于如何在实际工程中实现分布式智能体的注册、发现、通信与编排,还需要更深入的技术细节。本文将结合《AI原生应用架构白皮书》第三章后半部分的内容,全面拆解...

    2026年5月12日·AI原生架构 · 第 7 篇·
    AI 原生架构
  • AI原生架构(六):智能体开发从入门到进阶——单智能体、工作流与多智能体

    AI原生架构(六):智能体开发从入门到进阶——单智能体、工作流与多智能体

    # AI原生架构(六):智能体开发从入门到进阶——单智能体、工作流与多智能体 在第五篇文章中,我们深入探讨了上下文工程的三大核心技术——提示词工程、RAG与记忆系统,理解了如何为模型提供高质量的上下文信息以提升输出效果。现在,我们将进入AI原生应用开发中最具实践性的领域之一——**智能体(Agent)开发**。 如果说上下文工程解决了模型"能不能理解"的问题,那么智能体开发解决的是模型"能不能...

    2026年5月12日·AI原生架构 · 第 6 篇·
    AI 原生架构
  • AI原生架构(五):上下文工程实战——提示词、RAG与记忆系统

    AI原生架构(五):上下文工程实战——提示词、RAG与记忆系统

    # AI原生架构(五):上下文工程实战——提示词、RAG与记忆系统 在前四篇文章中,我们依次探讨了AI原生应用的时代背景与架构跃迁、成熟度模型、11个关键要素全景,以及模型选择与Agent设计模式。现在,我们将进入AI原生应用开发中最核心、也最考验工程能力的领域之一——**上下文工程(Context Engineering)**。 如果说模型决定了应用能力的"上限",那么上下文工程决定了应用在...

    2026年5月12日·AI原生架构 · 第 5 篇·
    AI 原生架构
  • AI原生架构(四):模型选择与Agent设计模式——打好AI应用的底座

    AI原生架构(四):模型选择与Agent设计模式——打好AI应用的底座

    # AI原生架构(四):模型选择与Agent设计模式——打好AI应用的底座 在第三篇文章中,我们系统性地介绍了AI原生应用的11个关键要素。其中,**模型(Model)** 和 **框架(Framework)** 是整个架构的基石——模型提供智能的"大脑",框架提供开发的"脚手架"。 无论是RAG、记忆、工具还是网关,所有其他要素都建立在模型的选择和框架的编排之上。如果基础没有打牢,上层再精美...

    2026年5月12日·AI原生架构 · 第 4 篇·
    AI 原生架构
  • AI原生架构(三):AI原生应用的11个关键要素全景解读

    AI原生架构(三):AI原生应用的11个关键要素全景解读

    📚 本系列目录 :《AI 原生架构》 当前第 3/10 篇 · 上一篇:AI原生架构(二):AI原生应用架构成熟度模型——你的应用在哪个阶段? · 下一篇:AI原生架构(四):模型选择与Agent设计模式——打好AI应用的底座 📚 系列导航 《 AI 原生架构 》共 10 篇,本篇是第 3

    2026年5月12日·AI原生架构 · 第 3 篇·
    AI 原生架构
  • AI原生架构(二):AI原生应用架构成熟度模型——你的应用在哪个阶段?

    AI原生架构(二):AI原生应用架构成熟度模型——你的应用在哪个阶段?

    AI原生应用架构成熟度模型是衡量技术能力、业务融合与安全可信的标尺。本文深入解析从M1到M4的四级演进路径与五大评估维度,助你找到当前位置与前进方向。

    2026年5月12日·AI原生架构 · 第 2 篇·
    AI 原生架构
  • AI原生架构(一):AI原生应用时代已来——从云原生到AI原生的架构跃迁

    AI原生架构(一):AI原生应用时代已来——从云原生到AI原生的架构跃迁

    2022年ChatGPT横空出世,2024年o1模型展现强推理能力,2025年MCP协议与A2A架构落地,AI正从聊天机器人演进为能接管数字世界、改变物理世界的系统性力量。本文解析《AI原生应用架构白皮书》核心观点,梳理从云原生到AI原生的架构跃迁。

    2026年5月12日·AI原生架构 · 第 1 篇·
    AI 原生架构
上一页3 / 3
下一页