Skip to content
← Back to job listings

【2027】大模型分布式优化工程师(J14436)

Sugon · 北京市, 山东省·青岛市, 河南省·郑州市, 上海市, 广东省·深圳市, 江苏省·南京市, 四川省·成都市

Imported listingfull-time9 days ago

About The Role

岗位职责(满足以下任意一方向):

  1. 负责dense/moe/多模态/强化学习等模型的大规模分布式优化,持续提高大规模分布式场景的算力利用率;
  2. 负责大模型训练框架及相关定制通信算子的开发、调试、优化与维护;
  3. 负责大规模训练容错库相关开发,优化在超大规模场景下的快速恢复;
  4. 负责超大规模集群下的训练性能建模;
  5. 跟踪分布式前沿优化技术和社区动态,持续改进产品性能;

岗位要求:

  1. 掌握现代c++,python编程,熟悉linux系统及程序调试分析方法,熟悉cuda编程模型,了解常见AI芯片架构及底层硬件原理,了解并行计算、异构计算、分布式系统等相关知识。
  2. 掌握pytorch高性能编程方法,熟悉Megatron、DeepSpeed、Transformer Engine、Verl、Slime、Vllm、SGlang等框架之一。
  3. 熟悉至少一种人工智能领域场景;
  • 4.加分项:
  • a. 熟悉mpi,nccl,分布式通信优化策略者优先。
  • b.具有多机多卡调试经验者优先。
  • c.具有大模型训练容错经验者优先。
  • d.具有nvshmem、mooncake、deepep等之一定制通信库使用开发经验者优先。
  • e.具有fp8/fp4训练经验者优先。
  • f.具有训练框架、算子融合开发优化经验者优先。
  • g. 具有强化学习框架使用开发优化经验者优先。
  • h.熟悉常用数学建模及验证方法者优先。

This is an external listing. JobSpring does not represent or verify the employer. Report this listing