Ai2 用 GPU 时间预算替换优先级调度器
热点事件持续更新
Ai2 用 GPU 时间预算替换优先级调度器
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
Ai2 称其已用 GPU 时间预算、分层公平分配和时间切片合约替换原有的优先级调度器,把各研究项目该分多少 GPU 时间的争论从逐案运维任务变成透明的预算流程。该集群管理数千块 NVIDIA H100、B200 和 B300,规模为 88 至 1024 块 GPU,服务约 150 名内部研究者,待处理需求常年是可用算力的 2-3 倍。 按 Ai2 的说法,用户可将最低运行时间设为零,表示该 GPU 时间不分配;这类负载始终可被抢占,也不计入任何预算。使用时间切片时,受保护的运行时间上限为 8 小时,超过分配额度后会话即可被抢占。 Ai2 还表示,正在其本地存储旁投资一个纯 CPU 集群,用于数据准备类开发会话,并计划为这些纯 CPU 负载构建可恢复会话。
AI 根据报道生成 · 1 小时前更新
最新进展10月9日 23:20
Ai2 如何用 GPU 时间预算重塑集群调度报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- Hugging Face BlogAi2 如何用 GPU 时间预算重塑集群调度
Ai2 用 GPU 时间预算、分层公平分配和时间切片合约替换了原有的优先级调度器,把各研究项目该分多少 GPU 时间的争论从逐案运维任务变成透明的预算流程。其集群管理数千块 NVIDIA H100、B200 和 B300,规模 88 至 1024 块 GPU,服务约 150 名内部研究者,待处理需求常年是可用算力的 2-3 倍。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。