Skip to content
← Back to job listings

2027校招-Ai Infra工程师

UCloud · 上海市

External listingfull-timeabout 2 hours ago

About The Role

  • 我们致力于构建UCloud公有云的计算基础设施,打造支持大规模 AI 训练与推理的 GPU 集群底座。团队聚焦下一代计算平台的稳定性与性能优化,深入软硬件协同、虚拟化、网络通信、高性能调度等核心方向,构建极致性能与稳定性的基础架构。
  • 本岗位将聚焦于GPU相关的故障定位、性能调优与系统优化,包括但不限于以下方向:
  1. 面向大模型推理与训练场景,深入分析 GPU 性能瓶颈,探索 GPU 层级(如CUDA、NCCL、硬件接口)异常信号的检测、归因与优化手段;
  2. 构建 GPU 故障监测体系,提升 GPU 使用过程中对于应用层错误(OOM、Kernel Error 等)和底层资源异常的可观测性与定位能力;
  3. 优化 NCCL 通信链路性能,研究其在性能建模、故障预测与资源调度中的应用;
  4. 探索GPU 池化、虚拟化与资源共享机制,提升集群资源利用率与可靠性;
  5. 参与构建 GPU 性能调优工具链及故障回溯系统,服务云上内外部客户高稳定性与高吞吐需求。
  6. 本科及以上学历,计算机、电子工程等相关专业;
  7. 熟悉 GPU 基本架构与工作原理(NVIDIA/AMD/Intel),了解 CUDA 编程模型;
  8. 有NCCL 使用经验,熟悉主流训练框架(如 PyTorch、TensorFlow)及并行训练方法;
  9. 具备良好的性能分析能力,熟练使用 profiling 工具(如 Nsight、nvprof、perf 等);
  10. 熟练掌握 C/C++ 或 Python,具备良好的系统排查与调优能力;
  11. 有 RDMA、NVLink、PCIe 等高速互联协议经验者优先;
  12. 有 DPU、GPU 虚拟化或池化相关背景者优先。

This is an external listing. JobSpring does not represent or verify the employer. Report this listing