Skip to content
← Back to job listings

大模型infra训练实习生(J10908)

Moore Threads · 北京市, 广东省·深圳市

External listingfull-timeabout 2 months ago

About The Role

  • 团队介绍
  • 团队面对千卡以上的集群探索大模型训练。 如果对大模型基础架构/强化学习/多模态/视频生成,超大规模GPU集群训推优化感兴趣,欢迎投递简历。
  1. 超大规模GPU集群分布式训练技术的研究与实现,提高MOE大模型和强化学习的训练吞吐
  2. 大模型前沿算法调研和实现
  3. 大模型训练框架和推理框架研发与性能调优
  4. 熟悉Python或C++,具备扎实的算法和计算机基础、良好的编程风格;
  5. 熟悉深度学习和大模型训练相关算法;
  6. 熟练使用深度学习框架,包括不限于pytorch/jax/paddle等;
  7. 有强烈的工作责任心,较好的学习能力、沟通能力和自驱力;

加分项:

  1. 有大规模GPU集群性能优化和训练经验优先;
  2. 熟悉大模型训练框架和推理框架,包括不限于Megatron/DeepSpeed/ColossalAI/torchtitan/sglang/vllm等;
  3. 熟悉大模型算法,如大模型基础架构/强化学习/多模态/视频生成等;
  4. 在顶级会议发表论文或有竞赛经验优先考虑;
  5. 熟悉cuda相关开发

This is an external listing. JobSpring does not represent or verify the employer. Report this listing