← Back to job listings
MT
计算集群系统工程师(J10990)
Moore Threads · 北京市
About The Role
- 欢迎加入摩尔线程!我们搭建面向 AI 训练与推理的大规模计算基础设施,涵盖 GPU 集群资源管理、分布式训练平台、高性能推理框架与服务、调度及可观测性等方向。期待计算机基础扎实、愿意深耕系统底层、热衷于攻克大规模工程难题的同学加入!
- 岗位职责
- 1、参与大规模 GPU 集群的规划、设计和开发,支持并参与 AI 训练平台和高性能 AI 推理系统的研发,优化大规模系统中 AI 训练、推理的性能和稳定性。
- 2、参与分布式系统、存储、网络、计算等基础能力建设,解决大规模场景下的性能与可靠性问题。
- 3、与算法、模型、业务及基础设施团队协作,将前沿模型能力稳定、高效地落地到生产环境。
- 任职资格:
- 1、计算机科学、软件工程、人工智能、电子工程或相关专业本科及以上学历。
- 2、扎实的计算机基础,理解操作系统、计算机网络、数据结构与算法等核心知识。
- 3、熟悉至少一种编程语言,如 C++、Go、Python、Rust 或 Java,具备良好的代码质量意识。
- 4、对并发编程、Linux 系统、分布式系统、性能优化等至少一个方向有兴趣或实践。
- 5、具备较强的学习能力、分析与解决问题的能力,能够主动推进事情落地。
- 6、有良好的沟通协作能力,对工程质量和系统稳定性有责任心。
- 【加分项】
- 有 Kubernetes、Docker、Slurm、Ray 等集群调度或云原生相关实践
- 了解 GPU、CUDA、NCCL、RDMA、高性能网络或异构计算
- 参与过 PyTorch、TensorFlow 等训练框架,或 vLLM、TensorRT、SGLang 等推理框架相关项目
- 有分布式系统、数据库、存储系统、编译器、网络协议栈等课程设计、科研或开源贡献
- 在竞赛、开源社区、个人项目中展现出较强的工程实现或问题解决能力
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring