Skip to content
← Back to job listings

【星火X计划】面向超大尺寸MoE的大EP推理工程优化(J13983)

iFLYTEK · 安徽省·合肥市, 北京市

External listingfull-time5 days ago

About The Role

【课题介绍】

本课题聚焦超大规模 MoE 大模型超大专家并行(EP128 以上) 场景下的核心瓶颈,围绕跨节点高带宽通信优化、动态专家负载均衡、多并行维度协同调度三大主线,构建低通信开销、高资源利用率、低尾部延迟的 MoE 分布式推理体系。 针对 EP 规模扩张带来的 all-to-all 通信拥塞、专家访问热度倾斜、跨机通信时延激增、调度与路由开销放大等核心痛点开展研究;打通路由策略、通信算法、分布式调度器、底层通信库的协同优化,建立从专家路由、流量调度、动态负载重平衡到框架层落地的完整技术方案;支撑百专家乃至上千专家规模 MoE 大模型在大规模 GPU 集群高效部署,建立面向线上业务 MoE 分布式推理性能评测体系。

【课题挑战】

1、EP128 及以上超大专家并行场景,All-to-All 通信流量爆炸、跨节点通信冲突与时延抖动问题,设计轻量化通信压缩、流量规整与通信调度策略;

2、MoE 请求路由不均衡引发专家负载倾斜、长尾延迟显著,研究无侵入 / 低开销动态负载均衡、专家路由优化、冷热专家自适应调度机制;

3、张量并行 TP、专家并行 EP、流水线并行 PP 多维度并行策略协同寻优,解决并行扩展过程中的资源碎片化、通信叠加问题;

4、适配 Prefill/Decode 两阶段差异化流量特征,针对长序列推理、高并发在线业务设计动态路由与弹性调度方案;

5、搭建自动化分布式仿真与实测评测平台,可复现大规模集群下通信拥塞、负载失衡现象,完成方案有效性验证。

【课题价值】

1、有效抑制 EP 横向扩展带来的通信开销增长,提升超大集群 MoE 推理吞吐,降低尾部延迟,支撑更高并发业务承载;

2、突破现有 MoE 专家并行扩展瓶颈,形成适配 EP128 + 规格的自研分布式 MoE 推理方案,支撑更大规模稀疏大模型工程落地;

3、大幅提升 GPU 集群有效利用率,缓解专家负载不均衡造成的算力浪费,降低 MoE 业务部署成本;

4、输出高质量学术论文、分布式 MoE 推理工具模块,夯实公司在超大规模稀疏模型分布式推理方向的核心技术竞争力。

1、28届及以后在读硕士及以上学历,人工智能、计算机科学、高性能计算、数学、电子信息等相关专业,其他专业但具备突出工程能力者同样欢迎;

2、扎实深度学习、并行计算、分布式系统基础,精通 Transformer 与 MoE 混合专家模型原理,熟悉大模型训练 / 推理分布式并行范式;熟练 C/C++ 或 Python,熟悉 PyTorch、vLLM、TensorRT-LLM 等推理框架优先;

3、熟悉 MoE 路由机制、专家并行 EP、All-to-All 通信、分布式通信原语(NCCL 等);有 MoE 分布式优化、负载均衡、高性能通信相关研究经历优先;

4、具备分布式系统、高性能网络、调度算法相关背景,有大规模 GPU 集群调试经验者优先;在 ICLR/NeurIPS/ICML 等顶会发表 MoE、分布式推理、并行优化相关论文优先;

5、拥有独立问题建模、理论推导、仿真与大规模实验验证能力,能够搭建分布式评测基线,对标业界前沿并行方案并提出创新解法;

6、良好跨团队协作能力,能够协同模型、推理框架、硬件、业务团队推进技术落地;具备较强抗压能力,擅长解决工业大规模集群场景下复杂技术瓶颈;

7、拥有 MoE 开源项目贡献、分布式推理框架二次开发经验优先。

This is an external listing. JobSpring does not represent or verify the employer. Report this listing