当前标签:AI 原生架构 · 共 58 篇
把多 LoRA 推理服务视为受张量存储、KV 隔离、多 SLO 三重约束下的在线调度问题,通过 PEFT 微架构分层、L_max 容量公式、adapter-aware KV scheduler 与租户级成本归因,构建 2026 年生产可用的多租户 LLM 推理工程闭环。
把 P99 从系统测度提升为可治理对象,围绕调度噪声 / 计算路径 / 多租户干扰三类机制展开,统一为分位-预算耦合框架,给出 7 条带量化指标的工程推论,为推理服务的 SRE 治理提供可量化的反馈闭环。
在线推理的显存墙不再是单一精度的命题: 本文拆解 FP8 权重 + INT4 KV + FP16 attention 这套生产级混合精度栈如何在 LLM 推理中实现 35% 显存节省 + 7% p99 时延回缩, 同时保证 KV cache 跨会话复用的命中率不塌方。
把 MoE 推理的跨卡专家路由变成可调参的工程对象:grouped-top-K 让通信局部化、DeepEP 把 dispatch 融合到 kernel、NUMA-aware + nvlink-topo-file 暴露物理拓扑、EAGLE-2/3 + 共享 routing cache 把单 token decode 摊到多 token,再用四层 OTel 指标守住专家热点与带宽长尾。
当 LLM 推理的瓶颈从 KV 内存转移到调度器公平性,我们看到 TTFT p99 在多租户混合负载下漂移 5%,长尾请求被短请求频繁插队饿死;本文从 WFQ 公平排队、协作/非协作抢占、多 SLO 分层队列三方面拆解生产级推理调度器的工程真相。
LLM 推理安全是输入过滤、越狱检测、内容审计、对抗训练四层纵深防御系统工程,生产目标为召回率95%以上、误伤率0.1%以下、P99延迟5ms以内。
2026 年 LLM 生产系统的必备基础设施——网关层以多模型路由、语义缓存、令牌桶限流、三轴可观测性四大能力,实现 AI 流量的成本可控、韧性可靠与运维可观测。
把单次推理能耗分解为 FLOPs × 内存 × IO 三轴度量,通过 DVFS 下限配置、SM 占用率调优、carbon-aware 时空路由、prefix cache 与 Carbon Span 可观测性,在不牺牲延迟 SLO 的前提下实现 30-50% 的总能耗下降;本文给出 GPU 级、调度级、可观测性级三层工程闭环的 Pareto 前沿与 7 条可落地的 SRE 清单。
Reasoning LLM 让单请求 token 量乘 10 到 100,传统 vLLM/SGLang serving 的 batch 聚合假设系统性失效——用 prefix-shared prefill + FP8 KV + 不对称 thinking-KV 回收 + cost-aware early stop 的四件套重构推理调度,把 HBM 利用率推到 90% 才能撑住生产。本篇从三轴成本模型(token · KV · 时间)出发盘点 2026 H2 主流引擎在 reasoning workload 上的几何取舍。
当 LLM 服务从 PoC 推到日均亿级 token 时,看不见会成为第一性瓶颈。本文给出 OTel GenAI 字段选型、Token 级 trace 与 KV cache 状态关联、GPU-Token-Quality 三轴闭环告警、P99 漂移自动 rollback 的完整生产范式与故障复盘。
GPT-5、Claude 3.7 Sonnet 等前沿模型已推动合成数据占比突破 50%,但质量-多样性-成本三角的权衡仍是未解工程难题。本文从生成、过滤、配比三阶段拆解合成数据的最佳实践,并提出能力覆盖度作为评估核心指标。
把冷启动预算、流量预测、多区域故障切换拆成可度量、可演练、可验证的三轴闭环,让推理平台在 90 秒 Ramp 与 30 秒 Failover 中都稳在 SLO 内。
把 3D 并行(TP+PP+DP)的几何切分与通信开销、ZeRO-3 的状态分区与 all-gather 摊销、NCCL 拓扑感知与故障恢复统一为可决策的生产基线,让 70B+ 模型训练从论文可跑走向 7×24 生产可跑。
在 LLM 推理的连续批处理框架下,GPU 显存容量逐渐成为并发上限。本文聚焦 KV Cache 的三层卸载策略:HBM 作为 L0 热点缓存、CPU DRAM 作为 L1 温缓存、NVMe SSD 作为 L2 冷缓存,通过热度感知准入控制、异步 DMA 传输与 WAL 持久化,将并发上限提升 3-5 倍,同时将 P99 延迟控制在 SLO 允许范围内。
从 PagedAttention 块表、RadixTree 复用、Chunked Prefill SLO 折中到 SM 调度与抢占式调度的工程化对齐,把推理引擎从 60% 利用率推到 85%+。
当 8 卡 H100 的 NVLink 域把全互联带宽堆到 900 GB/s、把跨 PCIe 交换机的 P2P 带宽压到 64 GB/s 时, tensor parallelism 跨域切分会立刻把推理时延拖慢 1.4-2.1 倍——本文从拓扑模型、张量并行切分点、流水线并行阶段数、专家并行通信四个维度拆解 GPU 拓扑感知调度的工程真相。
当一个 70B 基座要同时承载 200 个任务的 LoRA 适配器时,传统独立推理进程范式在显存、延迟、调度三维度失效;本文给出 S-LoRA 统一内存池、PEFT 热加载与三层路由元数据索引的生产工程真相。
当量化模型在部署第 3-6 周出现“沉默退化”时,离线 benchmark 帮不了你——需要把 PPL 漂移、激活分布偏移、任务级回归三层信号收口到自动回滚决策矩阵的在线监控工程。
Prefix cache 是 2026 LLM serving 系统决定 TCO 的关键变量:存储、匹配、隔离、失效四维拆解与生产实证。
本文用 Saras / vLLM v1.0 / DistServe / Mooncake 四个生产样本,推导 Token 级调度在 GPU 推理栈里的工程真相——五元组决策、SM-aware 匹配、跨节点 KV 中心化,与 SLO 公平性的范式跃迁。