【星火X计划】面向超大尺寸MoE的大EP推理工程优化(J13801)
iFLYTEK · 安徽省·合肥市, 北京市
About The Role
【课题介绍】
本课题聚焦超大规模 MoE 大模型超大专家并行(EP128 以上) 场景下的核心瓶颈,围绕跨节点高带宽通信优化、动态专家负载均衡、多并行维度协同调度三大主线,构建低通信开销、高资源利用率、低尾部延迟的 MoE 分布式推理体系。 针对 EP 规模扩张带来的 all-to-all 通信拥塞、专家访问热度倾斜、跨机通信时延激增、调度与路由开销放大等核心痛点开展研究;打通路由策略、通信算法、分布式调度器、底层通信库的协同优化,建立从专家路由、流量调度、动态负载重平衡到框架层落地的完整技术方案;支撑百专家乃至上千专家规模 MoE 大模型在大规模 GPU 集群高效部署,建立面向线上业务 MoE 分布式推理性能评测体系。
【课题挑战】
1、EP128 及以上超大专家并行场景,All-to-All 通信流量爆炸、跨节点通信冲突与时延抖动问题,设计轻量化通信压缩、流量规整与通信调度策略;
2、MoE 请求路由不均衡引发专家负载倾斜、长尾延迟显著,研究无侵入 / 低开销动态负载均衡、专家路由优化、冷热专家自适应调度机制;
3、张量并行 TP、专家并行 EP、流水线并行 PP 多维度并行策略协同寻优,解决并行扩展过程中的资源碎片化、通信叠加问题;
4、适配 Prefill/Decode 两阶段差异化流量特征,针对长序列推理、高并发在线业务设计动态路由与弹性调度方案;
5、搭建自动化分布式仿真与实测评测平台,可复现大规模集群下通信拥塞、负载失衡现象,完成方案有效性验证。
【课题价值】
1、有效抑制 EP 横向扩展带来的通信开销增长,提升超大集群 MoE 推理吞吐,降低尾部延迟,支撑更高并发业务承载;
2、突破现有 MoE 专家并行扩展瓶颈,形成适配 EP128 + 规格的自研分布式 MoE 推理方案,支撑更大规模稀疏大模型工程落地;
3、大幅提升 GPU 集群有效利用率,缓解专家负载不均衡造成的算力浪费,降低 MoE 业务部署成本;
4、输出高质量学术论文、分布式 MoE 推理工具模块,夯实公司在超大规模稀疏模型分布式推理方向的核心技术竞争力。
1、24-27届硕士及以上学历,人工智能、计算机科学、高性能计算、数学、电子信息等相关专业,其他专业但具备突出工程能力者同样欢迎;
2、扎实深度学习、并行计算、分布式系统基础,精通 Transformer 与 MoE 混合专家模型原理,熟悉大模型训练 / 推理分布式并行范式;熟练 C/C++ 或 Python,熟悉 PyTorch、vLLM、TensorRT-LLM 等推理框架优先;
3、熟悉 MoE 路由机制、专家并行 EP、All-to-All 通信、分布式通信原语(NCCL 等);有 MoE 分布式优化、负载均衡、高性能通信相关研究经历优先;
4、具备分布式系统、高性能网络、调度算法相关背景,有大规模 GPU 集群调试经验者优先;在 ICLR/NeurIPS/ICML 等顶会发表 MoE、分布式推理、并行优化相关论文优先;
5、拥有独立问题建模、理论推导、仿真与大规模实验验证能力,能够搭建分布式评测基线,对标业界前沿并行方案并提出创新解法;
6、良好跨团队协作能力,能够协同模型、推理框架、硬件、业务团队推进技术落地;具备较强抗压能力,擅长解决工业大规模集群场景下复杂技术瓶颈;
7、拥有 MoE 开源项目贡献、分布式推理框架二次开发经验优先。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring