← Back to job listings
MT
GPU高性能网络通信库研发工程师(J10845)
Moore Threads · 上海市, 四川省·成都市, 浙江省·杭州市
About The Role
- 工作职责
- 负责设计和实现基于摩尔线程GPU的高性能通信库(如类NCCL架构),支持多GPU间及跨节点的高效通信,满足AI训练、科学计算、数字孪生等场景的极致性能需求。
- 参与GPU硬件架构协同设计,定义片上网络(NoC)、片间互联(如MUSA Link)及对外RDMA网络接口,推动软硬件一体化优化,影响未来产品路线。
- 与AI框架团队深度协作,将通信库无缝集成至PyTorch、TensorFlow等主流框架,优化分布式训练(DDP、Horovod等)的通信瓶颈,支撑超大规模集群扩展。
- 深入研究和应用RDMA技术(InfiniBand、RoCEv2),利用GPUDirect RDMA、GPU Direct Async等机制实现零拷贝通信,最大限度降低延迟、提升带宽利用率。
- 探索和实现新型集合通信算法(AllReduce、AllGather、点对点通信等)的软件与硬件协同优化,提升大规模并行计算的扩展性和可靠性。
- 跟踪高性能计算、AI基础设施(AI Infra)前沿技术,主导学术论文阅读与技术分享,推动通信库在自动并行、编译优化等方向持续创新。
- 任职资格
- 计算机科学、电子工程、数学等相关专业本科及以上学历,硕士博士优先。
- 扎实的计算机基础知识,深刻理解计算机体系结构、操作系统、网络协议栈,熟悉Linux内核网络子系统。
- 精通C/C++编程,具备优秀的代码设计和调试能力,熟悉常用数据结构和算法,有良好的工程习惯。
- 熟悉并行编程模型,具备CUDA、HIP或OpenCL等GPU编程经验,了解GPU硬件架构(流多处理器、显存层次、PCIe/NVLink等)。
- 深入理解RDMA技术,熟悉InfiniBand、RoCEv2等协议,有实际RDMA编程经验(如ibverbs、libfabric、UCX、Verbs API)。
- 有高性能通信库开发经验,参与过NCCL、RCCL、MPI、NVSHMEM、GLEX等类似项目,或具备通信中间件研发背景。
- 熟悉主流AI框架(PyTorch、TensorFlow、JAX)的分布式训练原理,了解Horovod、DDP、FSDP等并行策略,能够进行性能分析与调优。
- 熟悉Linux开发环境,熟练使用Git、CMake、Bazel等工具,具备良好的Python/Bash脚本能力。
- 积极乐观,责任心强,善于跨团队沟通与协作,具备出色的分析和解决问题能力。
- 加分项
- 在顶尖会议或期刊(如SC、HPCA、ISCA、MICRO、PPOPP、OSDI、SOSP等)发表过论文。
- 在高性能计算竞赛(ISC/SC Student Cluster Competition)或编程竞赛(ACM/ICPC、NOI)中获奖。
- 深入了解NVIDIA/AMD GPU硬件架构,特别是NVLink、NVSwitch、InfiniBand、GPUDirect等技术的实现细节。
- 有汇编级优化经验,熟悉GPU汇编指令(如SASS)或CPU汇编优化。
- 对AI框架底层实现有深入理解,参与过PyTorch/TensorFlow通信层的开发或优化。
- 有自动代码生成、编译优化(如TVM、XLA、MLIR)相关经验。
- 优秀的英语听说读写能力,能够流畅阅读英文技术文档和学术论文,参与国际技术交流。
- 具备出色的文档撰写能力和技术分享能力,能够清晰表达复杂技术方案。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring