分布式训练工程师(J10983)
Moore Threads · 北京市, 浙江省·杭州市, 广东省·深圳市, 上海市, 江苏省·无锡市
About The Role
欢迎加入摩尔线程!我们团队专注于语言 / 多模态 / 多模态生成模型的训练和后训练(包括精调和强化学习)的训练性能极致优化和算法稳定性调优,开展软硬件算法全流程 coDesign,拥有大量万卡以上大集群万亿以上参数大模型的训练调优实践经验,欢迎对大模型基础架构 / 强化学习 / 多模态 / 视频生成、超大规模 GPU 集群训推优化和软硬协同设计感兴趣的同学加入!
岗位职责
1、超大规模 GPU 集群分布式训练技术的研究与实现,提升 MOE 大模型和强化学习的训练吞吐。
2、开展大模型前沿算法调研和实现,服务分布式训练性能与稳定性优化。
3、负责大模型训练框架研发与性能调优。
任职资格:
1、计算机、人工智能、软件工程等相关专业,具备扎实的算法与计算机基础,欢迎基础扎实的在读同学投递。
2、掌握 Python 或 C++,具备良好编程风格,能够熟练使用 PyTorch/Jax/Paddle 等深度学习框架。
3、熟悉深度学习及大模型训练相关算法。
4、具备较强的责任心、学习能力、沟通能力与自驱力,工作细致有规划,善于透过现象挖掘问题本质。
【加分项】
有大规模 GPU 集群调优、参数服务器、多维并行、显存交换、MPI 相关实践
有 Megatron/DeepSpeed/ColossalAI/TransformerEngine/torchtitan/sglang/vllm 框架实践经验
有大模型算法研究、CUDA/triton/tilelang 开发、算法‑infra coDesign 相关经历
拥有顶会论文或者竞赛经历
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring