Skip to content
← Back to job listings

CUDA专家(J14609)

YMTC (Yangtze Memory) · 上海市, 湖北省·武汉市

External listingfull-time11 days ago

About The Role

  1. 跟踪 GPU 直访存储(GPU-Initiated Storage)领域前沿进展,包括 BaM、SwarmIO、GIDS、GustANN、GPUDirect Storage 等开源系统与学术论文,以及 厂商 KV SSD 技术演进。
  2. 深入研究 GPU 发起 I/O 的完整链路:NVMe SQ/CQ 队列模型、Doorbell 批量提交、CQ 轮询与自旋等待优化、GPU 线程并发模型与队列映射策略,定位并消除端到端性能瓶颈。
  3. 负责 GPU 页缓存(Page Cache)机制的分析与参数调优,包括缓存容量与命中率关系、页槽位并发约束、缓存替换开销,建立与真实业务(KV Cache 卸载、向量检索)对应的访问模型。
  4. 开展多平台性能评测与交叉验证:在 RTX 6000 Pro / H200 等 GPU 平台及多 DSA 服务器上,使用 nvm-block-bench、fio 等工具对标真实企业级 SSD,输出定量性能分析报告与瓶颈定位结论。
  5. 研究 GPU + SSD 协同的十亿级向量检索(GustANN / DiskANN / CAGRA),评估高 IOPS 盘在 ANNS 场景下的查询效率,推动存储侧与检索侧协同优化。
  6. 推动 GPU 直访存储能力与推理栈(vLLM / SGLang / Mooncake / LMCache)对接,参与 KV Cache 分层卸载链路的架构设计与验证,推导存储产品核心需求并制定技术路线图。
  7. 学习 BaM / SwarmIO / GustANN 开源代码,沉淀内部技术文档、测试报告与培训材料,支撑团队能力建设。

基本要求

  1. 计算机、电子工程、软件工程、存储系统等相关专业本科及以上学历,3 年以上系统软件开发经验。
  2. CUDA 与 GPU 编程:精通 CUDA C/C++,具备 3 年以上 GPU kernel 开发经验:
  3. 并发与同步:深刻理解 GPU 上的原子操作、内存序、自旋锁;能运用 Little's Law 等模型分析 I/O 并发度,从队列深度、在飞命令数反推系统瓶颈。
  4. 存储协议:熟悉 NVMe 协议(1.4+):SQ/CQ 队列对、Doorbell 机制、PRP/SGL 地址描述、中断与轮询完成模式;了解 NVMe KV Command Set 者优先。
  5. 系统功底:具备扎实的 Linux 内核与驱动开发能力,能够阅读和修改内核模块(如 libnvm),理解 DMA、PCIe TLP、MMIO/BAR、IOMMU 等底层机制。
  6. 熟练使用 Nsight Systems / Nsight Compute / perf 等性能分析工具,具备端到端延迟拆解(submit → dispatch → DSA → completion)的问题定位能力。
  7. 理解大模型推理基本概念:Transformer、Attention、KV Cache、Prefill/Decode 分离、长上下文。

加分项

  1. BaM / GIDS / cuFile 经验

2.SwarmIO / NVMeVirt仿真器开发经验

  1. SSD、Flash、存储等相关经验

This is an external listing. JobSpring does not represent or verify the employer. Report this listing