Skip to content
← Back to job listings

GPU高性能通信软件工程师(J10844)

Moore Threads · 上海市, 四川省·成都市, 浙江省·杭州市

External listingfull-timeabout 1 month ago

About The Role

  • 工作职责
  • 参与自主可控的GPU集合通信库(对标NCCL/RCCL)的研发,支撑AI大模型与科学计算的分布式训练
  • 协助优化RDMA网络(InfiniBand/RoCE)及GPU Direct通信路径,
  • 提升多节点训练性能与软硬件团队协作,了解下一代GPU互联架构设计
  • 将通信库集成到PyTorch等深度学习框架,完善AI基础设施(AI Infra)能力
  • 任职要求(基础+专业)
  • 基础要求
  • 本科及以上学历,计算机、电子、通信等相关专业
  • 精通C/C++,熟悉Python,掌握常用数据结构和算法
  • 熟悉Linux开发环境,了解Git、CMake等工具
  • 专业需求(以下至少熟悉2~3项)
  • RDMA网络:理解RDMA基本概念(IB/RoCE)、关键操作(Send/Recv/Read/Write),有相关课程实验或小型项目经验
  • GPU体系结构与CUDA:熟悉GPU基本架构(SM、内存模型),能编写简单的CUDA Kernel,了解CUDA流、事件同步机制
  • 集合通信:了解AllReduce、AllGather等通信原语,知道环形(Ring)、双二叉树(Double Binary Tree)等常见算法原理
  • 分布式训练框架:使用过PyTorch的DDP或FSDP,理解其通信流程(如梯度AllReduce的触发时机)
  • 性能优化基础:了解PCIe、NUMA等系统拓扑对通信性能的影响,有初步的性能测试与分析思路
  • 加分项
  • 参与过并行计算/高性能计算相关竞赛(ASC、ISC等)
  • 对NCCL、OpenMPI、UCX等开源项目有过阅读或小贡献
  • 有网络协议(TCP/IP)或DPDK基础
  • 优秀的学术英语阅读能力,能阅读顶会论文(如SC、HPCA、ISCA)

This is an external listing. JobSpring does not represent or verify the employer. Report this listing