FluidPD:面向SLO感知的预填充-解码分离式LLM服务原地弹性调度
事件
预填充-解码分离已成为大模型推理服务的常见架构,因为它把执行模式和 SLO 目标不同的两个阶段拆开。现有系统通常采用固定的预填充/解码工作节点比例,再配合请求路由。但真实负载既有短时突发,也有预填充与解码需求比例的持续漂移,原本配置合理的比例会很快失配,即使别处有空闲算力,也会出现延迟 SLO 违约。传统自动扩缩容反应慢、需要备用 GPU,也无法直接解决短时间尺度的阶段失衡。
为此,研究团队提出 FluidPD,一套提供 SLO 感知原地弹性的 P/D 分离服务系统,包含两个互补机制。FluidToken 应对瞬时失衡:当解码侧出现空闲时,把有界的部分预填充计算卸载给解码工作节点。FluidRole 应对持续失衡:在不重载模型、不重启引擎的前提下,把运行中的工作节点在预填充与解码角色之间原地重新分配。两者都由轻量压力指标驱动,这些指标能在资源压力演变为 SLO 违约之前就将其暴露出来。
在 Azure 生产 trace 负载上,FluidPD 相比静态 SGLang 将整体 SLO 达成率最高提升 94.6 个百分点,说明 SLO 感知的原地 P/D 弹性可以在不额外配置工作节点的前提下提升服务质量。对部署大模型推理服务的团队而言,这意味着用调度而非堆算力来应对负载波动,值得关注其在实际集群中的落地成本与稳定性。
来源
本条目由采集管线自动抓取并发布,完整内容见下方来源链接。
*采集源:arXiv cs.AI*