【星火X计划】面向大模型高效训推的算子研发与极致优化(J13802)
iFLYTEK · 安徽省·合肥市, 北京市
About The Role
【课题介绍】
算子是释放硬件算力的关键,大模型训练推理效率优化关键在于算子效率,算子效率直接决定了训推框架的整体效率。但实际训练推理中观测到的算力利用率往往远低于硬件峰值,算子效率成为制约上层大模型框架发挥硬件极限能力的关键瓶颈。如何深度挖掘硬件特性,实现算子和通信原语的高效实现与极致优化,直接决定了AI基础设施的效能。本课题专注于对大模型训推过程中的关键算子进行极致效率优化,在充分理解硬件架构基础上,通过工程师的"心灵手巧"设计、研发高效算子、优化关键算子效率,解决算力、通信、访存等关键算子瓶颈。
【课题挑战】
算子开发面临的主要挑战在于如何贴近硬件微架构,实现接近理论算力与通信带宽极限的性能。当前大模型的计算模式日趋复杂,传统的通用算子库实现难以兼顾大模型的最优调度需求,需要根据硬件特性进行精细的Kernel设计与调优;同时分布式并行策略的多层嵌套带来通信、访存复杂性,如何设计和实现高效的通算融合,减少全链路端到端延迟,是需要重点攻克的难点。
【课题价值】
1、关键算子极致优化:针对大模型核心算子,结合硬件微架构特征(向量单元、矩阵单元、缓存层次、张量切分等),实现高算力利用率的高性能Kernel开发;
2、通算融合:结合超节点等互联架构,实现计算与通信高效融合,降低分布式整体并行开销;
3、算子自动调优与编译优化:研发面向大模型的算子自动调优框架,融合Tiling策略搜索、内存层次优化与指令调度,减少算子实现的人工调优成本,提升跨模型架构的算子复用性。
1、24-27届硕士及以上学历,人工智能、计算机科学、高性能计算、数学、电子信息等相关专业,其他专业但具备突出工程能力者同样欢迎;
2、具备扎实的计算机架构基础,熟练使用linux操作系统;
3、熟练使用Git、VSCode等,熟练使用Pytorch、numpy等框架;
4、对GPU/NPU等AI加速芯片的体系结构有深入理解,熟悉CUDA/Ascend C/Triton/TileLang等至少一种编程模型,有实际的Kernel开发调优经验;
5、较强的编程实现能力,熟练掌握C/C++,Python等语言,有底层性能优化项目经验;
6、具备较强的独立思考能力,具备追求卓越,不断突破创新精神,不断通过效率分析提升算子效率。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring