Skip to content
← Back to job listings

GPU集群运维工程师(J10808)

Moore Threads · 北京市

External listingfull-time6 months ago

About The Role

  1. GPU集群全栈运维实施
  • ● 负责大规模GPU集群的日常运维,涵盖GPU服务器硬件、高速网络、集群存储及Kubernetes容器平台的稳定运行。
  • ● 负责GPU集群的部署实施:从上架验收、网络配置、存储挂载、k8s容器平台部署的全流程实施
  • ● 建立并维护运维规范:编写GPU故障处理手册、网络连通性测试标准、存储性能基线等
  1. 监控告警与故障响应
  • ● 构建集群监控体系:部署监控GPU运行状态;配置IB/RoCE网络流量监控;搭建存储健康状态看板等
  • ● On-Call响应:处理训练任务异常中断,执行紧急故障隔离等
  • ● 故障定位:报告GPU硬件、网络/存储、服务器等故障,配合SRE团队输出故障分析方案
  1. 平台工具与效能优化
  • ● 开发运维自动化脚本,实现批量节点巡检与故障分析,优化资源交付效率
  • ● 集群容量与成本管理:监控GPU利用率、存储水位增长,定期输出资源使用报告,协助制定扩容方案
  • ● 学历与经验: 本科及以上学历,3年以上Linux系统运维经验,1年以上GPU集群或HPC环境运维背景
  • ● 硬件技能: 熟悉GPU服务器架构,具备NVIDIA GPU或国产AI芯片运维经验,能独立处理GPU故障
  • ● 网络技术: 熟练掌握RDMA网络(InfiniBand或RoCEv2),熟练进行网络健康检查;理解Spine-Leaf架构,具备拥塞排查能力
  • ● 存储系统: 熟悉大规模并行文件系统的运维调优
  • ● 云原生与自动化: 熟练使用Kubernetes,掌握Ansible等自动化配置管理,具备Python/Shell脚本开发能力(能独立完成运维工具开发)
  • ● 故障应急能力: 具备高强度On-Call抗压素质,能在大规模训练任务场景下快速定位故障层级,执行紧急恢复操作
  • ● 跨团队协作: 具备与SRE团队、硬件厂商及云平台团队的高效沟通能力,能准确描述技术现象并推动解决

This is an external listing. JobSpring does not represent or verify the employer. Report this listing