Skip to content
← Back to job listings

【星火X计划】大规模集群下超大尺寸模型推理性能极致优化(J13985)

iFLYTEK · 安徽省·合肥市, 北京市

External listingfull-time4 days ago

About The Role

  • 【课题介绍】
  • 本课面向超大尺寸通用大模型规模化的 API 服务场景,基于国产异构算力芯片构建大规模、高性能的分布式推理集群。围绕多级 KVCache、实时动态计算调度、弹性异构基础设施等核心任务,通过工程技术的持续创新,不断追求用户延迟体验、服务成本以及可靠性工程等方面的极致优化,构建高性价比的大模型 API 服务能力,加速形成普惠的token经济。
  • 【课题挑战】
  • 1、大规模发散流量场景下,用户请求动态变化、业务负载高度随机、异构算力瓶颈差异显著、云际异构集群间流量峰谷波动大,在保障用户体验的同时需实现跨集群、跨资源池的全局负载最优分配与潮汐弹性调度,逼近集群吞吐与资源利用率极限;
  • 2、长上下文、高并发推理场景,KVCache增长导致显存、存储及传输成本急剧上升,分布式异构集群下缓存路径、路由策略与资源调度高度耦合,在保证首响时延和效果的前提下,突破KV压缩、跨节点复用和分级缓存效率瓶颈,KV利用率与成本的全局最优。
  • 【课题价值】
  • 1、突破大规模分布式推理在异构算力、高速缓存复用、动态调度等方向的关键技术瓶颈,KVCache成本、性能及集群利用率等关键技术指标形成显著竞争优势;
  • 2、面向十万卡级异构算力,打造行业领先的国产推理算力集群,显著提升推理集群整体吞吐,对token成本实现极致摊销,支撑下一代高吞吐、低成本、普惠化的大模型服务基础设施建设。
  • 1、28届及以后毕业的硕士及以上学历,计算机、软件工程、数学及相关专业优先;具备扎实系统基础、优秀学习能力或突出工程实践能力者同样欢迎;
  • 2、熟练掌握C++、Python、Go等至少一种语言,具备大型工程项目开发能力,能够完成良好实现与性能优化;
  • 3、对KVCache系统有深入理解,具备KV存储、压缩、传输、缓存复用等性能优化实践;熟悉RDMA、SSD/HDD存储体系,熟悉Mooncake或同类型项目;
  • 4、熟悉云原生及分布式系统架构,掌握容器编排、服务治理、负载均衡、分布式故障定位及系统性能优化方法;
  • 5、具备优秀的工程意识和系统设计能力,能够针对复杂技术问题从第一性原理出发进行分析,建立体系化解决方案,并推动端到端闭环。
  • 【加分项】
  • 1、对分布式推理集群的设计、研发有比较深入的理解,具有大规模高性能系统设计或研发经验;
  • 2、在大型开源软件中有深度贡献,或有优秀个人开源项目。

This is an external listing. JobSpring does not represent or verify the employer. Report this listing