NEWS / 08 · AI 基础设施 / TOKEN 吞吐

GPU SCHEDULING

Hugging Face 研究显示:
GPU 集群利用率的关键可能是调度顺序,而非继续堆硬件。

当实时推理、批量推理和训练任务共享同一套 GPU 集群时,硬件数量并不能直接说明产出。Hugging Face 博客介绍的约束感知 GPU allocator,在相同硬件和相同负载下与 FIFO scheduler 对比,结果把注意力重新拉回任务顺序、需求曲线和资源预留方式。

问题不只是排队,而是预留

FIFO 按到达顺序分配任务,容易为实时推理按全天峰值预留 GPU。低峰期这些资源仍被锁定,批量任务只能等待。约束感知分配器则在整个调度周期内同时考虑任务优先级、资源连续性和实时需求曲线。

官方文章称,在 7 个基准场景中,GPU 利用率最高提升 33 个百分点,priority-weighted output 在全部场景提升,最高达 105%。这两个数字含义不同:前者是利用率百分点,后者是优先级加权产出相对提升,不能合并成所有场景的平均百分比。

Token 成本也会被调度影响

对 API 中转和模型服务来说,调度顺序会直接影响每个 Token 的基础设施成本。实时请求如果被高峰预留绑住,批处理吞吐会下降;批处理如果长期占满资源,实时请求延迟又会抬升。把负载类型和需求曲线纳入调度,比单纯堆更多 GPU 更接近真实运营问题。

  • 研究比较了约束感知 allocator 与 FIFO scheduler 的 7 个场景。
  • 相同硬件和负载下,GPU 利用率最高提升 33 个百分点。
  • priority-weighted output 在全部场景提升,最高达 105%。
  • 文章强调提升来自分配顺序和约束建模,不是更换硬件。

TopoReduce 编辑观察

模型路由、队列和 GPU 调度其实属于同一个系统问题:有限资源如何根据任务价值被解释地分配。中转站如果能记录请求优先级、Token 吞吐、延迟和回退,就可以把“价格优化”进一步推进到“单位 Token 的可靠产出优化”。

数据与原文AIHOT 条目:约束感知 GPU 调度器官方原文:Same Cluster, 33 Points More Utilization
← 上一篇:Cursor Origin返回 News 列表 →

让每个 Token 都有清晰的成本。

了解 TopoReduce 的模型路由、可观测性与 API 中转能力。

进入 API 中转站