← Back to job listings
云天
LLM模型性能分析优化岗(J10852)
云天励飞 · 上海市, 广东省·深圳市, 江苏省·南京市
About The Role
- 职位概述
- 负责大语言模型在训练与推理全链路中的性能瓶颈定位、分析与优化,涵盖模型架构改进、计算图优化、显存管理、分布式训练/推理策略调优等方向,推动模型在给定硬件约束下达到最优的吞吐、延迟与资源利用效率。
- 核心职责
- 1性能分析与瓶颈定位:对LLM训练及推理过程进行系统性Profiling,利用工具(如PyTorch Profiler、Nsight Systems、DCGM等)定位计算、通信、显存等维度的性能瓶颈,输出可量化的分析报告。
- 2推理优化:设计并落地推理加速方案,包括但不限于 KV Cache 管理策略、算子融合、量化(GPTQ/AWQ/FP8)、投机解码(Speculative Decoding)、连续批处理(Continuous Batching)、PagedAttention 等技术,优化首Token延迟(TTFT)与生成吞吐(tokens/s)。
- 3训练效率优化:针对大规模分布式训练场景,优化并行策略(TP/PP/DP/EP及混合并行),改善通信与计算的Overlap,调优梯度累积、混合精度、激活重计算等策略,提升集群MFU(Model FLOPs Utilization)。
- 4模型架构协同优化:与研究团队协作,从工程性能视角评估架构选型(如MoE路由策略、GQA/MLA注意力变体、Sparse Attention等),推动hardware-aware的架构设计决策。
- 5基础设施与工具链建设:搭建自动化性能回归测试框架,建设性能监控看板与预警机制,维护内部性能优化工具库,沉淀最佳实践文档。
- 6前沿技术跟踪:持续关注学术与工业界最新进展(如FlashAttention系列、Ring Attention、DeepSeek系列架构创新、vLLM/TensorRT-LLM/SGLang等推理框架演进),评估并引入适用技术。
- 必备条件:
- 1计算机科学、电子工程或相关领域本科及以上学历,3年以上相关工作经验;
- 2精通 Python,熟练掌握 C++/CUDA,具备算子级性能调优经验;
- 3深入理解 Transformer 架构及主流LLM的实现细节(Attention机制变体、Normalization策略、位置编码等);
- 4熟悉至少一种主流训练框架的底层机制(Megatron-LM、DeepSpeed、FSDP);
- 5熟悉至少一种主流推理框架(vLLM、TensorRT-LLM、SGLang、llama.cpp);
- 6具备 GPU 体系结构知识(SM、Warp调度、显存层级、Tensor Core工作原理);
- 7良好的分析思维,能从系统层面理解端到端性能特征.
- 加分项
- 有千卡以上集群训练优化经验,熟悉 InfiniBand/RoCE 网络拓扑对通信性能的影响
- 有 Triton 算子编写经验,或参与过 FlashAttention 等高性能算子的开发/适配
- 熟悉 MoE 模型的 Expert Parallelism 调度与负载均衡优化
- 有模型量化部署的端到端落地经验(校准、精度评估、服务化)
- 具备编译器优化背景(XLA、TorchInductor、MLIR等)
- 在相关领域有开源贡献或技术博客输出。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring