← Back to job listings
MT
GPU高性能通信软件工程师(J10844)
Moore Threads · 上海市, 四川省·成都市, 浙江省·杭州市
About The Role
- 工作职责
- 参与自主可控的GPU集合通信库(对标NCCL/RCCL)的研发,支撑AI大模型与科学计算的分布式训练
- 协助优化RDMA网络(InfiniBand/RoCE)及GPU Direct通信路径,
- 提升多节点训练性能与软硬件团队协作,了解下一代GPU互联架构设计
- 将通信库集成到PyTorch等深度学习框架,完善AI基础设施(AI Infra)能力
- 任职要求(基础+专业)
- 基础要求
- 本科及以上学历,计算机、电子、通信等相关专业
- 精通C/C++,熟悉Python,掌握常用数据结构和算法
- 熟悉Linux开发环境,了解Git、CMake等工具
- 专业需求(以下至少熟悉2~3项)
- RDMA网络:理解RDMA基本概念(IB/RoCE)、关键操作(Send/Recv/Read/Write),有相关课程实验或小型项目经验
- GPU体系结构与CUDA:熟悉GPU基本架构(SM、内存模型),能编写简单的CUDA Kernel,了解CUDA流、事件同步机制
- 集合通信:了解AllReduce、AllGather等通信原语,知道环形(Ring)、双二叉树(Double Binary Tree)等常见算法原理
- 分布式训练框架:使用过PyTorch的DDP或FSDP,理解其通信流程(如梯度AllReduce的触发时机)
- 性能优化基础:了解PCIe、NUMA等系统拓扑对通信性能的影响,有初步的性能测试与分析思路
- 加分项
- 参与过并行计算/高性能计算相关竞赛(ASC、ISC等)
- 对NCCL、OpenMPI、UCX等开源项目有过阅读或小贡献
- 有网络协议(TCP/IP)或DPDK基础
- 优秀的学术英语阅读能力,能阅读顶会论文(如SC、HPCA、ISCA)
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring