Skip to content
← Back to job listings

【星火X计划】面向超大尺寸通用LLM的预训练Infra工程(J13799)

iFLYTEK · 安徽省·合肥市, 北京市

External listingfull-time5 days ago

About The Role

【课题介绍】

通用大模型预训练在LLM训练周期中占比最高,预训练效果优劣很大程度上依赖底层训练基础设施的规模、稳定性和效率。当模型尺寸迈向千亿和万亿级别,集群规模从千卡扩展到万卡甚至更大规模时,预训练框架变成一项系统工程:如何在框架层实现效率、显存和通信的均衡。研究与训练调度平台协同实现超大集群在数周乃至数月中保持稳定高效训练;研究在硬件故障频发情况下保证训练任务不中断等。本课题聚焦于构建和优化面向大模型预训练的高性能、高可用训练基础设施,为模型团队提供稳定、高效可扩展的训练工程底座。

【课题挑战】

1、结合具体结构的规模化并行方案设计:针对万亿参数模型结构信息结合训练集群体系结构,设计多维的混合并行策略,平衡计算效率、显存占用和通信开销,达到系统利用率最高;

2、训练稳定性保障:大规模长周期的训练任务,芯片、存储、通信的稳定性以及训练过程中的Loss Spike无法避免,如何联合平台对软硬件进行监测,实现高效故障恢复,静默数据损坏识别等,是长时训练的难题。

【课题价值】

1、参与大规模分布式训练框架的设计、迭代与优化,适配预训练以及后训练完整流程,联合平台保障千卡/万卡量级集群实现高效稳定训练;

2、落地多维度并行策略优化,涵盖数据并行、张量并行、流水线并行、专家并行,完成通信、显存、计算在特定集群和结构下的优化,充分挖掘芯片硬件性能上限;

3、定位并解决训练环节的各类性能瓶颈、抖动故障,联动平台侧完善运维策略,保障超大算力集群训练任务平稳运行;

4、对接算法研发团队,跟进全新模型架构的特性,从框架层面完成定制适配,匹配算法迭代的底层诉求;

5、跟踪训练Infra领域前沿技术进展,参考业界成熟方案迭代自有框架,持续压低训练开销、提升运行效率与系统稳定性。

1、24-27届硕士及以上学历,计算机、软件工程、高性能计算、电子信息、数学等相关专业,计算机体系结构、深度学习相关理论功底扎实,学业排名、科研成果、硬核竞赛表现突出者优先;

2、编程基础牢靠,熟练掌握Python,同时精通C++、CUDA二者其一,能够产出规范、高性能的工程代码;

3、掌握如下技术/知识一种:主流LLM深度学习训练框架、GPU/国产芯片高性能算子编程、编译优化;

4、掌握GPU架构特性以及CUDA开发手段,了解昇腾NPU、海光DCU等国产加速硬件配套软件栈,熟悉算子优化方法与FP16/BF16/FP8混合精度训练方案;

5、良好的沟通协作能力,自驱力和责任心足够强,可以和团队共同攻坚并落地新技术。

This is an external listing. JobSpring does not represent or verify the employer. Report this listing