← Back to job listings
MT
AI应用推理引擎研发工程师(J10989)
Moore Threads · 北京市
About The Role
- 欢迎加入摩尔线程!你将参与端侧推理框架性能加速、多类模型部署适配,协同算子与编译器团队定位性能瓶颈,输出系统级优化方案,保障推理框架在真实业务场景高效稳定交付。
- 岗位职责:
- 1、负责端侧大模型推理框架(如 vLLM、llama.cpp、MNN 等)的性能优化与加速,提升吞吐与降低延迟。
- 2、负责端侧语音、Embedding、OCR、AIGC、自动驾驶等模型在推理框架(如 ONNXRuntime、MNN 等)中的性能调优与部署适配。
- 3、与算子团队、编译器团队紧密协作,共同完成端侧高性能推理框架的集成、验证与交付。
- 4、深入分析推理链路性能瓶颈,设计并实现系统级优化方案,推动框架在真实场景中的高效稳定运行。
- 任职资格
- 1、计算机、电子信息等相关专业,本科及以上学历,欢迎基础扎实的在读同学投递。
- 2、了解 vLLM、llama.cpp、ONNXRuntime 至少一种推理框架的架构与工作机制,有阅读源码经历优先。
- 3、了解大模型推理主流加速技术(Flash Attention、Paged Attention、Speculative Decoding、Continuous Batching 等),有实践复现经历优先。
- 4、了解 GPU 并行编程,会使用 Triton/Cutlass 完成 Kernel 开发调优,理解 CUDA 内存管理与性能优化思路。
- 5、会使用 Nsight 等性能剖析工具,了解 CUDA Graph、Torch AOT 等优化技术。
- 【加分项】
- 深入掌握算子优化、编译器优化(MLIR、TVM)或 GPU 硬件架构知识
- 有端侧量化(W4A16、W4A8)调优、模型部署相关项目实践
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring