Skip to content
← Back to job listings

GPU 架构工程师- AI Workload 分析(J11005)

Moore Threads · 北京市, 上海市

External listingfull-time6 days ago

About The Role

  • AI workload 正在快速分化:LLM 的训练与推理范式仍在演进(long context、MoE、reasoning、speculative decoding),同时具身智能(VLA、diffusion policy)、自动驾驶(BEV、端到端、world model)、搜索广告推荐(大规模稀疏模型 + 生成式重排)各自形成了差异明显的计算特征。
  • 本岗位的核心价值在于:把这些不断变化的 workload 翻译成可量化、可比较、可用于系统与架构决策的语言。你的分析结论会直接影响我们对硬件选型、系统设计与优化方向的判断。
  • 我们不要求你已经是专家,但希望你有扎实的体系结构直觉、动手能力,以及在一个快速变化的领域里持续自我更新的意愿。
  • 岗位职责
  • 1.Workload 建模与特征刻画:对典型模型进行算子级与图级 profiling,量化 compute intensity、memory bandwidth / capacity 占用、KV cache footprint、通信量与通信模式,产出 roofline 分析与瓶颈定位。
  • 2.Benchmark 体系建设:构建并维护覆盖 LLM、具身智能、自动驾驶、搜推等领域的代表性 workload 集合,保证其可复现、可版本化、能反映真实业务场景而非仅是 micro-benchmark。
  • 3.趋势跟踪与快速评估:跟踪新模型、新算法、新推理技术,在其出现后短时间内给出对系统资源需求的影响评估。
  • 4.工具与流程自动化:开发自动化的 profiling、数据采集与分析 pipeline,降低重复劳动,让分析结论可持续复现。
  • 5.结论输出:撰写清晰的分析报告,把复杂的实验数据收敛为少数几个可执行的结论,并与算法、系统、硬件团队协作验证。
  • 岗位要求
  • 1.计算机体系结构、计算机科学、电子工程、应用数学或相关专业硕士/博士,应届毕业。
  • 2.理解现代计算系统的基本原理:memory hierarchy、并行与调度、interconnect、roofline model。
  • 3.熟练使用 Python,熟悉 PyTorch,能读懂并修改主流模型的实现代码。
  • 4.有使用 profiling 工具的经验(Nsight Systems/Compute、PyTorch Profiler、perf 等任一类均可)。
  • 5.具备基本的数据分析与可视化能力,能从噪声数据中提取可靠结论。
  • 6.能把分析过程讲清楚:数据怎么来的、结论怎么推的、哪里存在不确定性。
  • 7.至少满足其中一项
  • a.对 LLM 训练或推理系统有实际动手经验(分布式训练、推理引擎、量化、并行策略等)。
  • b.在具身智能、自动驾驶或搜索推荐中任一领域有过模型开发或系统优化经历。
  • c.有性能建模、模拟器开发或体系结构研究背景。
  • 加分项
  • 1.CUDA / Triton 或其他 kernel 编程经验。
  • 2.熟悉 vLLM、SGLang、TensorRT-LLM、Megatron-LM、DeepSpeed 等开源项目,有阅读源码或贡献记录。
  • 3.有 MLPerf 或类似 benchmark 工作经验。
  • 4.有系统或体系结构方向的论文发表(MLSys、ASPLOS、ISCA、OSDI、SOSP 等),或高质量的开源项目。
  • 我们看重的特质
  • 1.对数字的怀疑精神:看到一个反常的测量结果,第一反应是找原因,而不是直接接受它。
  • 2.能收敛结论:面对一批彼此矛盾的实验数据,能判断哪几条真正重要、哪个是测量 artifact、哪些结论还不够支撑。
  • 3.能在模糊问题中定义问题:很多任务开始时只有一个方向,没有明确指标。
  • 4.跨层次思考:能同时理解算法在做什么、框架如何执行、硬件如何响应。
  • 我们提供
  • 1.接触多个前沿领域真实 workload 的机会,视野覆盖从算法到硬件的完整链路。
  • 2.与算法、系统、硬件团队直接协作,分析结论有明确的下游影响。
  • 3.明确的技术成长路径与导师带教。

This is an external listing. JobSpring does not represent or verify the employer. Report this listing