GPU管理:闲置GPU成为新型停飞飞机
OpenAI
Anthropic
Meta
Amazon/AWS
Google/DeepMind
Microsoft
利用率而非智能正成为人工智能的关键限制。随着企业自行采购GPU,保持它们忙碌比获取它们更具挑战性。GPU管理成为一项关键学科,以最大化硬件投资回报。
文章将闲置的GPU比作停飞航班,指出成本按日历小时累积,而收入却依赖于利用率。在人工智能领域,模型质量曾一度是首要关注点,但如今瓶颈已转向算力的可用性和效率。即使像Anthropic和Meta这样的大型实验室,尽管投入巨资,仍面临算力短缺的问题。采用本地GPU的企业则面临一个新挑战:如何让硬件保持有利可图的利用率。即便繁忙的集群也可能因工作负载不匹配而浪费容量,因为不同任务(如推理、训练、量化)的需求各异。GPU管理——作为一种持续的编排层——正应运而生,可以实时分配资源。专用的小型模型能够腾出容量,但需要编排才能有效重新部署这些资源。
来源: Hugging Face blog —
原文
