为什么现在大模型越训越强,线上推理瓶颈反而越来越难解决?
最近信通院发布的《Token 驱动智算基础设施观测报告》,算是戳破了现在行业最真实的底层矛盾:
模型迭代飞速进化,但智算集群的物理瓶颈几乎没有突破。
很多人看模型只看评测榜、参数规模、上下文长度。
但做过线上推理运维的都清楚:模型能力是上层逻辑,真正卡死吞吐、延迟、稳定性的,永远是底层硬件与调度架构。
今天用生产环境视角,聊聊目前 token 推理集群躲不开的硬核瓶颈,不玩概念
1. 绝大多数推理卡顿,根本不是算力不够
很多团队排查问题,第一反应就是:GPU 利用率低=算力闲置。
实际上线上推理是典型的访存密集型场景,而非计算密集型。
Decode 阶段每步生成 token,都需要频繁读写 KV-Cache。
显存带宽一旦跑满,哪怕 GPU SM 单元空闲 40%,整体吞吐直接卡死。
这就是现在最普遍的带宽墙>算力墙。
这也是为什么很多集群卡得要死,监控看利用率却很健康,属于非常隐蔽的底层瓶颈。
2. KV-Cache 碎片化,是线上抖动的最大元凶
长上下文推理普及之后,几乎所有集群都遇到同一个问题:
显存被大量零散 KV 块占满,有效利用率极低。
长短请求混跑、会话不销毁、上下文窗口不统一,会导致显存出现大量细碎空洞。
哪怕整体显存占用不高,新请求也无法申请连续显存块,直接触发 `swap` 降级。
一旦发生显存与内存置换,延迟直接翻倍、P99 抖动爆炸,这是生产环境最典型、最难根治的推理劣化问题。
3. 传统离线调度,完全不适配在线 Token 服务
目前很多智算平台的调度器,前身都是**AI 训练任务调度**。
训练是大包、稳态、长耗时;
推理是碎包、突发、潮汐流量。
两者调度逻辑完全不兼容。
现在最常见的线上劣化场景:
短请求、Prefill 重任务、超长 Decode 请求混部。
长会话持续霸占显存缓存池,导致新请求资源饥饿,出现节点局部过载、全局负载均衡假象。
看着负载很平均,实际上节点内部资源严重倾斜。
4. 算力碎片化问题,混布集群几乎无解
现在中小厂集群基本都是多代 GPU 混布。
不同卡型的显存带宽、NVLink 带宽、FP16 算力差异巨大。
如果调度器不做 Token 量级感知分发,
只是简单轮询、按卡均分任务,
最终结果就是:
强卡空转、弱卡过载、整体集群吞吐上不去。
属于典型「统计均衡,实际崩坏」。
5. 开发者真正需要转变的思维
以前优化模型:调参、Prompt 工程、RAG 策略。
现在优化推理:必须懂硬件资源约束。
超大上下文不是越强越好。
Prefill 吃算力,Decode 吃带宽,两者资源模型完全不同。
很多人无脑几万 Token 全量灌入上下文,
本质就是把上层偷懒,转嫁成底层集群的压力雪崩。
真正落地稳定的线上架构,基本都遵循这套逻辑:
- 超长文档优先分块、摘要、检索过滤
- 严格限制单实例最大上下文阈值
- 长短请求物理隔离部署
- 开启 KV 缓存动态淘汰 + 碎片整理
- 区分 Prefill/Decode 资源池单独调度
现在行业很魔幻:
模型能力月月突破,
但智算底层的显存、带宽、调度、碎片化问题,几乎没有本质解法。
软件优化只能缓解,不能根治。
物理瓶颈永远是 AI 服务落地的最终天花板。
最近我自己线上也做了一轮参数调优、上下文限流、请求隔离,P99 延迟肉眼可见稳了很多。
有做推理、智算运维、模型部署的朋友,欢迎交流你们线上遇到的奇葩抖动、隐式瓶颈。
页:
[1]