Skip to content
← Back to job listings

AI全栈工程师 - 智算基础设施高性能网络方向(J10873)

Moore Threads · 北京市

External listingfull-time3 months ago

About The Role

  • 1)负责超大规模集群在训练、推理、数据传输等核心场景下的高性能网络系统的运维、设计和研发;
  • 2)参与 RDMA、RoCEv2、DPDK 等高性能网络技术的落地与优化,构建极致低延迟、高带宽的通信能力;
  • 3)深入开展大规模训练下的通信性能分析工作,运用先进分析与诊断工具,精准定位并优化性能瓶颈;
  • 4)开发与优化基础网络服务系统,包括但不限于网络地址分配、负载均衡等,同时建设管控平台,实现大模型训练集群网络的自动化管理;
  • 5)支持网络协议分析、性能调优、故障排查等系统级问题解决,提升系统整体稳定性与可观测性;
  • 6)推进高性能网络与平台系统(如训练框架、Kubernetes、RPC 框架)之间的深度融合;
  • 1)精通网络编程,熟练掌握 C/C++、Rust、Python、GO等至少一种编程语言,能够编写高效的网络通信代码;
  • 2)有能力设计和实现分布式系统中的负载均衡、故障恢复等机制,保障系统的可靠性;
  • 3)熟悉 Linux 网络子系统,能够进行网络协议栈相关调优、profiling 和调试分析;
  • 4)对高性能分布式计算或大规模 AI 系统有理解,熟悉分布式训练、AllReduce 等通信模式优先;
  • 5)熟悉 SmartNIC 编程(如 P4、eBPF)、PCIe 流控、多队列调度等底层原理;
  • 6)拥有高性能网络研发工作经验,有实际的大规模集群网络项目开发经验,熟悉 Kubernetes 网络架构、Service Mesh 或网络可观测性工具建设;
  • 7)有在超大规模集群中推进网络性能提升 / 压测 / 治理的经验;
  • 8)深入理解 RDMA/NCCL/MPI 等通信协议和原理,能够运用这些技术进行高性能网络开发和方案设计;
  • 9)有能力设计和实现分布式系统中的负载均衡、故障恢复等机制,保障系统的可靠性.

This is an external listing. JobSpring does not represent or verify the employer. Report this listing