Skip to content
← Back to job listings

【星火X计划】面向通用大模型智能体强化学习的Infra工程(J13988)

iFLYTEK · 安徽省·合肥市, 北京市

External listingfull-time5 days ago

About The Role

【课题介绍】

当前大模型 RL 后训练面临多模型(策略/价值/参考/奖励/验证器)并存带来的显存压力、生成回滚与梯度更新的同步等待、海量轨迹数据的传输存储开销等核心痛点;而 AgentRL 场景中,智能体需与十万级并发环境实例进行数十至上百轮交互,长程上下文累积、环境状态异构性与故障频发、推理与训练速度失配等问题进一步加剧系统复杂度。两类场景在分布式通信拓扑优化、经验流数据管道、显存感知调度、容错恢复与资源弹性等层面具有高度一致的系统挑战。本课题将针对上述瓶颈,设计统一的异步流水线架构与动态资源调度器,突破多模型混合训练与大规模环境并行的扩展限制,大幅缩短 RL 迭代周期,显著提升 GPU 集群利用率,并形成自研工程方案与开源贡献,提升公司在 RL Infra 领域的技术影响力。

【课题挑战】

1、高吞吐生成与多轮推理加速

设计异步流水线生成服务,使推理与训练过程解耦匹配,降低生成等待时延;针对 AgentRL 多轮交互,实现 KV Cache 增量复用、跨轮注意力掩码管理及长上下文显存换入换出,显著降低推理延迟,支持长期决策与复杂工具调用链调用。

2、多模型混合部署与显存管理

制定动态换入换出、参数分片与共享、显存感知调度策略,在有限显存下承载策略/价值/参考/奖励/验证器及环境编码器等组件,避免显存溢出与碎片化;实现多组件协同下的显存弹性分配,兼顾计算效率与模型规模。

3、大规模环境并行与状态管理

支持十万级并发环境实例(浏览器沙箱、代码解释器等)的编排、生命周期管理、状态快照/恢复,设计轻量化环境抽象层、环境池预热与弹性扩缩容策略;解决异构状态(文本、结构化、工具结果)的序列化、压缩传输与版本管理,降低 I/O 与存储开销。

4、分布式 RL 算法系统化与通信优化

将 PPO/GRPO 的优势计算、重要性采样、KL 惩罚等环节映射到张量/数据并行策略,设计 All-Reduce 与 All-Gather 协同的异构通信拓扑,降低多模型同步开销;在 Actor-Rollout 解耦架构下构建异步消息队列与键值状态同步机制,应对网络分区与积压,保障系统可观测性。

5、经验流系统与分级存储数据管道

研发内存优先 + 分级存储(内存/SSD/远端)的经验回放缓冲系统,支持海量轨迹(含状态、动作、奖励、优势值、工具调用结果等)的实时持久化、优先级采样与流式回放,应对数据倾斜与 I/O 瓶颈;针对多模态异构数据设计压缩传输与零拷贝序列化方案。

6、混合负载调度与资源弹性

设计在线弹性扩缩容与资源池动态切分调度器,实现推理生成、环境交互与梯度更新的异步并行与资源错峰复用,最大化集群整体利用率;支持 CPU 密集型环境模拟与 GPU 密集型推理/训练的资源隔离与超卖控制,降低硬件成本。

7、沙箱安全、容错与长稳运行

构建轻量级执行沙箱,实现动作白名单、越权拦截、资源配额与超时控制,防范系统风险;嵌入端到端加密、访问令牌与审计日志,保障数据安全。设计自动 Checkpoint、异常恢复、节点与环境实例热迁移、部分故障降级机制,保障数天至数周训练任务的持续收敛与数据一致性。

【课题价值】

1、大幅提升 RLVR/AgentRL 后训练效率:通过异步流水线与动态调度,缩短 PPO/GRPO 迭代周期,同时提升异步AgentRL 多轮交互训练吞吐,加速智能体策略研发与验证;

2、突破系统扩展瓶颈:支撑千亿级主模型与多辅助模型协同后训练,同时支持十万级环境实例与千亿参数策略网络的 AgentRL 任务,形成适配超大规模混合集群的自研 RL 工程方案,赋能公司智能体产品线规模化部署;

3、显著降低硬件成本:利用推理-训练-环境三者的资源错峰与弹性复用,提升 GPU 集群有效利用率 ,大幅降低大模型对齐与智能体部署的综合运行开销;

4、输出学术论文、开源模块与最佳实践:为开源社区贡献核心系统优化,推动 RL 工程化标准演进,提升公司在 RL Infra 方向的行业影响力。

1、28届及以后在读硕士及以上学历,人工智能、计算机科学、分布式系统、数学、高性能计算等相关专业;其他专业但具备突出工程能力者同样欢迎;

2、扎实的深度学习与强化学习基础,熟悉 PPO、GRPO、DPO、REINFORCE 等后训练算法及在线/多智能体 RL 范式,深入理解 Transformer/MoE 架构与分布式并行范式;精通 C/C++ 或 Python,熟练 PyTorch,有 DeepSpeed/Megatron-LM/vLLM/sglang 二次开发经验者优先;

3、熟悉分布式通信与集合通信拓扑优化,具备大规模 GPU 集群调优经验;有 RLHF/RLVR/AgentRL 全链路工程落地经验者优先;

4、具备分布式系统、高性能网络、存储或资源调度背景,有 Kubernetes/Slurm 集群编排经验者优先;在 ICLR/NeurIPS/ICML 等顶会发表分布式训练、系统优化、RL 或智能体相关论文者优先;

5、拥有独立建模、系统架构设计与大规模实验能力,能搭建端到端 RL 评测基线,对标前沿方案并提出创新解法;

6、良好跨团队协作能力,能协同算法、模型、推理、环境模拟与业务团队推进落地,具备解决工业集群复杂工程瓶颈的抗压能力;

7、拥有开源 RL 训练框架(verl/slime/OpenRLHF)或 AgentRL 框架贡献经验,推理引擎深度集成或沙箱技术贡献者优先。

This is an external listing. JobSpring does not represent or verify the employer. Report this listing