✕

AI咨询

每日早报 投融资 最新技术 行业应用 大模型进展

AI知识

AI工具库 AI智能体 AI编程 Hermes 使用 Codex 使用 Claude Code 学习路径 Prompt模板库

AI应用

最佳实践 企业落地 AI赚钱 OPC 一人公司 落地SOP AI成熟度诊断 咨询预约

其他

AI 问答 关于本站
首页 / 最新技术 / 正文

FluidPD:面向SLO感知的预填充-解码分离式LLM服务原地弹性调度

事件

预填充-解码分离已成为大模型推理服务的常见架构,因为它把执行模式和 SLO 目标不同的两个阶段拆开。现有系统通常采用固定的预填充/解码工作节点比例,再配合请求路由。但真实负载既有短时突发,也有预填充与解码需求比例的持续漂移,原本配置合理的比例会很快失配,即使别处有空闲算力,也会出现延迟 SLO 违约。传统自动扩缩容反应慢、需要备用 GPU,也无法直接解决短时间尺度的阶段失衡。

为此,研究团队提出 FluidPD,一套提供 SLO 感知原地弹性的 P/D 分离服务系统,包含两个互补机制。FluidToken 应对瞬时失衡:当解码侧出现空闲时,把有界的部分预填充计算卸载给解码工作节点。FluidRole 应对持续失衡:在不重载模型、不重启引擎的前提下,把运行中的工作节点在预填充与解码角色之间原地重新分配。两者都由轻量压力指标驱动,这些指标能在资源压力演变为 SLO 违约之前就将其暴露出来。

在 Azure 生产 trace 负载上,FluidPD 相比静态 SGLang 将整体 SLO 达成率最高提升 94.6 个百分点,说明 SLO 感知的原地 P/D 弹性可以在不额外配置工作节点的前提下提升服务质量。对部署大模型推理服务的团队而言,这意味着用调度而非堆算力来应对负载波动,值得关注其在实际集群中的落地成本与稳定性。

来源

本条目由采集管线自动抓取并发布,完整内容见下方来源链接。

*采集源:arXiv cs.AI*

📎 原始来源:arXiv cs.AI
本站内容为摘要与观点整理,不全文转载原文;版权归原作者所有。
💬 对这篇还有疑问?

直接问 AI,回答带站内出处。

就这篇提问

相关内容