← Back to job listings
MT
智算网络通信工程师/专家(J10741)
Moore Threads · 上海市, 浙江省·杭州市
About The Role
- 负责设计和实现基于摩尔线程GPU的高性能通信库(如类NCCL架构),支持多GPU间及跨节点的高效通信,满足AI训练、科学计算、数字孪生等场景的极致性能需求。
- 参与GPU硬件架构协同设计,定义片上网络(NoC)、片间互联(如MUSA Link)及对外RDMA网络接口,推动软硬件一体化优化,影响未来产品路线。
- 与AI框架团队深度协作,将通信库无缝集成至PyTorch、TensorFlow等主流框架,优化分布式训练(DDP、Horovod等)的通信瓶颈,支撑超大规模集群扩展。
- 深入研究和应用RDMA技术(InfiniBand、RoCEv2),利用GPUDirect RDMA、GPU Direct Async等机制实现零拷贝通信,最大限度降低延迟、提升带宽利用率。
- 探索和实现新型集合通信算法(AllReduce、AllGather、点对点通信等)的软件与硬件协同优化,提升大规模并行计算的扩展性和可靠性。
- 跟踪高性能计算、AI基础设施(AI Infra)前沿技术,主导学术论文阅读与技术分享,推动通信库在自动并行、编译优化等方向持续创新。
- 计算机科学、电子工程、数学等相关专业本科及以上学历,硕士博士优先。
- 扎实的计算机基础知识,深刻理解计算机体系结构、操作系统、网络协议栈,熟悉Linux内核网络子系统。
- 精通C/C++编程,具备优秀的代码设计和调试能力,熟悉常用数据结构和算法,有良好的工程习惯。
- 熟悉并行编程模型,具备CUDA、HIP或OpenCL等GPU编程经验,了解GPU硬件架构(流多处理器、显存层次、PCIe/NVLink等)。
- 深入理解RDMA技术,熟悉InfiniBand、RoCEv2等协议,有实际RDMA编程经验(如ibverbs、libfabric、UCX、Verbs API)。
- 有高性能通信库开发经验,参与过NCCL、RCCL、MPI、NVSHMEM、GLEX等类似项目,或具备通信中间件研发背景。
- 熟悉主流AI框架(PyTorch、TensorFlow、JAX)的分布式训练原理,了解Horovod、DDP、FSDP等并行策略,能够进行性能分析与调优。
- 熟悉Linux开发环境,熟练使用Git、CMake、Bazel等工具,具备良好的Python/Bash脚本能力。
- 积极乐观,责任心强,善于跨团队沟通与协作,具备出色的分析和解决问题能力。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring