
AI 基础设施备件不能简单按设备总数乘固定比例。应根据单件故障影响、冗余设计、现场替换时间、供应与维修周期、型号兼容范围和扩容计划,分别确定 GPU 服务器部件、交换机、电源、风扇、网卡、模块与线缆的策略。
先按业务影响分级
判断某部件故障是否导致单节点降级、整个 Rail 中断、管理失联或大面积训练暂停,并核对现有冗余能维持多久。关键度高且无法跨设备借用的部件,更需要现场备件;已有可靠冗余和短补货周期的部件,可以采用不同策略。
兼容范围决定能否共享
记录备件完整料号、硬件修订、适用设备、固件要求和必要附件。外形相同不代表可以替换,跨批次部件也可能要求升级或重新验证。能够覆盖多个型号的共享备件应有明确证据,并准备匹配的配置和恢复步骤。
备件本身也需要生命周期管理
设置保管环境、标签、序列号、借用和补充流程,定期检查固件、包装和可用状态。长期存放的电池、光学部件或整机可能有特殊要求。每次使用后应更新库存和故障记录,用实际消耗校正后续数量。
项目核验要点
- 每种备件都有故障影响、冗余和补货周期依据。
- 完整记录料号、适用范围、固件和替换附件。
- 现场人员已演练更换、配置恢复和业务重新纳管。
- 定期盘点保管状态、借用记录和生命周期变化。
备件表应与故障预案和支持合同一起评审。目标不是囤积更多物料,而是在约定恢复时间内拿到正确、可用且团队会更换的部件。
WeChat
Profile