岗位职责
●支持和保障训练和推理业务高效平稳的运行,缩短故障恢复时间(MTTR),提高运行效率
●完成节点的基线检查与性能验证工作,确保资源能够高质量高性能投入生产
●实现服务相关各部件状态的实时感知,提升问题自愈率与处理效率,降低干预成本
●参与系统架构优化,提升整体稳定性
●编写和维护运维文档,沉淀最佳实践
任职要求
●知名院校大学本科学历以上,计算机、电子工程或相关专业
●接触过千卡以上GPU服务器管理
●熟悉Linux 服务器的管理、问题排查与分析
●熟悉NVLink/NVSwitch/HBM/RDMA
●了解DCGM/NVSM
●具备良好的故障排查和问题解决能力
●有较强的团队协作和沟通能力
加分项
●有大规模集群运维经验
●熟悉容器化技术(如Docker、Kubernetes)
●有自动化运维工具开发经验