STAR:面向 decode 阶段的智能重调度系统
导语
近日,南京大学智能软件与工程学院王智彬老师团队围绕大模型推理服务中的 decode 阶段负载不均问题开展研究,提出面向 decode 阶段的重调度系统 STAR。相关论文《STAR: Decode-Phase Rescheduling for LLM Inference》发表于 HPDC。该工作也是南京大学首次以第一单位在 HPDC 这一 CCF A 类会议发表论文。
论文题目:STAR: Decode-Phase Rescheduling for LLM Inference
大模型推理通常包含 prefill 和 decode 两个阶段。prefill 负责处理输入并生成 KV cache,decode 则基于 KV cache 逐 token 生成输出。随着推理任务从普通问答走向长链路推理和复杂写作,输出长度差异会变得非常显著,decode 阶段的工作负载也随之出现明显不均衡。
在 prefill-decode 分离架构中,请求通常会在 prefill 后被分配到某个 decode 实例继续生成。如果只在请求交接时做一次静态分配,后续输出长度的变化就可能让某些 decode 实例长期过载,带来 KV cache OOM 风险和 SLO 违约问题。

图 1 不同输出长度会导致 decode 实例间出现显著负载差异。
核心挑战
第一,如何准确且低开销地刻画未来工作负载。decode 阶段不仅要看当前每个实例的负载,还要估计正在执行请求后续还会生成多少 token。现有方法要么依赖额外辅助模型,带来开销和精度限制;要么通过 prompt 工程让模型先预测长度,容易侵入用户输入并影响输出质量。
第二,如何在复杂决策空间中有效重调度。decode 重调度不仅要判断哪些实例过载、哪些实例空闲,还要决定迁移哪个请求、何时迁移,并权衡迁移 KV cache 的开销。对于接近完成的请求,迁移本身可能得不偿失。
STAR 的核心思路
STAR 是 smart token-length aware rescheduling 的缩写,核心思想是用“剩余生成长度预测”提前感知未来 decode 负载,并在 decode 阶段动态迁移请求,从而缓解实例间负载不均。
系统包含两个关键组件:一是轻量级、连续运行的 LLM-native predictor,它利用目标 LLM 最后一层、最后一个 token 的 hidden state,通过小型 MLP 预测剩余输出长度;二是多阶段重调度策略,它综合当前负载和预测负载,筛选可迁移请求,并通过模拟迁移效果选择最能降低负载方差的方案。

图 2 STAR 系统总览:调度器周期性收集状态、预测长度,并触发 decode 实例间迁移。
实验效果
实验表明,STAR 可以显著提升长输出场景下的大模型推理服务质量。相比基于 vLLM 的 prefill-decode 分离系统,STAR 最高带来 2.63 倍 goodput 提升,将 P99 TPOT 降低 75.1%,并能避免实验中的 OOM 发生。
在长度预测方面,STAR 的 LLM-native predictor 相比已有方法平均降低 49.42% 的 MAE,并保持较低运行开销。整体来看,预测机制让调度器不只响应当前状态,也能面向未来负载进行更主动的重调度。

图 3 STAR 在 ShareGPT 小集群上的代表性端到端结果。
总结与展望
STAR 将大模型推理系统中的调度视角进一步推进到 decode 执行过程中:当请求的实际输出长度逐步显现时,系统可以持续更新对未来负载的判断,并通过动态迁移保持各 decode 实例的负载均衡。
面向长上下文问答、复杂推理、多轮智能体等应用场景,decode 阶段的负载管理将越来越影响服务稳定性与用户体验。STAR 展示了结合长度预测与运行时重调度的一条可行路径,也为后续构建更弹性的大模型服务系统提供了参考。
合作成果
此外,我们还参与合作完成了论文《BCCE: Block-Centric GPU Co-Design for Real-Time Range-Top-K Query at Scale》,该工作同样发表于 HPDC,面向实时分析中的 Range-Top-K 查询场景,探索通过块中心的 GPU 协同设计提升大规模动态数据查询效率。
联系我们
对我们工作感兴趣的老师、同学,欢迎联系:wzbwangzhibin@gmail.com。