AI基础设施的隐藏陷阱:上线六个月后客户学到的东西(以及我们如何在软硬件一体机中解决这些问题)
NVIDIA
Scala^r 团队(隶属于 Rubytech 集团)的一位架构师描述了客户在构建自己的 AI 基础设施时遇到的典型问题,例如集成问题、GPU 选型、网络瓶颈、供电与冷却以及认证问题。文章解释了他们的即用型软硬件一体机(PAK)Scala^r MII 如何通过提供经过测试的技术栈、优化的网络和调度器增强功能来避免这些问题。
这篇文章由Scala^r(Rubytech集团旗下)的建筑师Alexey撰写,讨论了客户在构建自己的AI基础设施时遇到的挑战。主要的陷阱包括:组件单独工作正常但在负载下共同运行失败;选择错误的GPU(通常是不需要时却选用了H100);网络配置不当导致性能下降(例如,将RDMA流量与备份流量混在一起);Kubernetes集群缺乏容错能力;低估了电力和冷却需求;以及受监管行业的漫长认证过程。为了解决这些问题,Scala^r提供了“Scala^r MII”软硬件综合体,它预设了硬件、操作系统、Kubernetes、GPU堆栈和网络堆栈的测试组合,将部署时间缩短到1-2周,与自行组装相比性能提升200-300%。该综合体支持多种GPU平台(NVIDIA和中国替代品),并包含物理流量分离、MLAG网络、具有GPU拓扑感知的自定义调度器、冗余电源和FSTEC证书等功能。文章还重点介绍了训练、微调和推理三种场景,其中PAK带来了显著的性能提升。
来源: Habr — хаб ИИ —
原文
