RL/真机后训练实习生
joyson · 上海市, 上海市, 中国
About The Role
我们是专注于具身智能的硬科技公司。这里没有繁杂的PPT文化,只有真机、真数据、真场景。你将直接接触下一代AI与物理世界的交互边界。 职责内容: • 参与基于SFT、BC、DAgger、离线RL(IQL/CQL)、在线RL(PPO/SAC)、偏好优化(DPO/GRPO)等方法进行策略后训练与迭代; • 参与负责数据策略设计,包括轨迹筛选、成功/失败样本分析、正负样本构造、hard case mining、数据重加权与课程学习; • 参与设计奖励函数与偏好对齐机制(任务完成奖励/过程奖励/安全约束/接触质量/动作平滑性/碰撞惩罚等); • 参与真机数据采集、策略部署与Bad Case闭环迭代,多维拆解任务失败原因(数据/模型/动作空间/感知/控制/sim-to-real gap/场景分布/评测定义); • 参与建立策略评测体系,定义成功率、稳定性、动作质量、安全性、恢复能力等指标,建立回归评测流程。 任职要求: • 招募对象:大三大四本科生、研一研究生、直博一年级至三年级博士生。 • 专业方向:计算机、人工智能、机器人等相关理工科专业。 • 工程能力: 精通Python/C++;熟悉至少一种RL/模仿学习框架; 理解PPO/SAC/IQL/CQL/DPO 等算法基本原理,能根据任务特点判断方法适用边界; 具备真机/仿真联调经验,能处理仿真与真机间的物理不匹配问题; 具备系统实验设计能力,能围绕任务设计训练方案、对照实验与失败归因。 加分项:如有实验室项目、开源贡献、竞赛(ACM/ROBOCUP/RoboMaster)还是个人Github 仓库,请附上对应链接。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring