← Back to job listings
Y(
CUDA专家(J14609)
YMTC (Yangtze Memory) · 上海市, 湖北省·武汉市
About The Role
- 跟踪 GPU 直访存储(GPU-Initiated Storage)领域前沿进展,包括 BaM、SwarmIO、GIDS、GustANN、GPUDirect Storage 等开源系统与学术论文,以及 厂商 KV SSD 技术演进。
- 深入研究 GPU 发起 I/O 的完整链路:NVMe SQ/CQ 队列模型、Doorbell 批量提交、CQ 轮询与自旋等待优化、GPU 线程并发模型与队列映射策略,定位并消除端到端性能瓶颈。
- 负责 GPU 页缓存(Page Cache)机制的分析与参数调优,包括缓存容量与命中率关系、页槽位并发约束、缓存替换开销,建立与真实业务(KV Cache 卸载、向量检索)对应的访问模型。
- 开展多平台性能评测与交叉验证:在 RTX 6000 Pro / H200 等 GPU 平台及多 DSA 服务器上,使用 nvm-block-bench、fio 等工具对标真实企业级 SSD,输出定量性能分析报告与瓶颈定位结论。
- 研究 GPU + SSD 协同的十亿级向量检索(GustANN / DiskANN / CAGRA),评估高 IOPS 盘在 ANNS 场景下的查询效率,推动存储侧与检索侧协同优化。
- 推动 GPU 直访存储能力与推理栈(vLLM / SGLang / Mooncake / LMCache)对接,参与 KV Cache 分层卸载链路的架构设计与验证,推导存储产品核心需求并制定技术路线图。
- 学习 BaM / SwarmIO / GustANN 开源代码,沉淀内部技术文档、测试报告与培训材料,支撑团队能力建设。
基本要求
- 计算机、电子工程、软件工程、存储系统等相关专业本科及以上学历,3 年以上系统软件开发经验。
- CUDA 与 GPU 编程:精通 CUDA C/C++,具备 3 年以上 GPU kernel 开发经验:
- 并发与同步:深刻理解 GPU 上的原子操作、内存序、自旋锁;能运用 Little's Law 等模型分析 I/O 并发度,从队列深度、在飞命令数反推系统瓶颈。
- 存储协议:熟悉 NVMe 协议(1.4+):SQ/CQ 队列对、Doorbell 机制、PRP/SGL 地址描述、中断与轮询完成模式;了解 NVMe KV Command Set 者优先。
- 系统功底:具备扎实的 Linux 内核与驱动开发能力,能够阅读和修改内核模块(如 libnvm),理解 DMA、PCIe TLP、MMIO/BAR、IOMMU 等底层机制。
- 熟练使用 Nsight Systems / Nsight Compute / perf 等性能分析工具,具备端到端延迟拆解(submit → dispatch → DSA → completion)的问题定位能力。
- 理解大模型推理基本概念:Transformer、Attention、KV Cache、Prefill/Decode 分离、长上下文。
加分项
- BaM / GIDS / cuFile 经验
2.SwarmIO / NVMeVirt仿真器开发经验
- SSD、Flash、存储等相关经验
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring