← Back to job listings
IF
【星火X计划】面向自主持续学习的基础大模型训练技术研究(J13797)
iFLYTEK · 安徽省·合肥市, 北京市
About The Role
- 【课题介绍】
- 我们认为未来的通用大模型不仅需要根据人类提供的数据和奖励进行训练,还需要能够主动探索环境、发现知识与技能缺口、从交互反馈中持续学习,并逐步形成自我改进和自主进化能力。
- 本课题围绕Reasoning RL、Agentic RL、自主持续学习与递归式自我改进等关键技术方向开展研究,探索从离线训练、在线强化学习、环境交互学习到模型自主生成目标、自主构造训练数据、自主验证和持续更新的完整技术体系,构建具备深度推理、复杂决策、长期探索和持续自我提升的下一代大模型。
- 你将研究从奖励建模、可验证强化学习、策略优化、过程监督,到智能体环境交互、在线学习的完整技术验证;构建面向推理、代码、工具使用和开放环境任务的强化学习基础设施与评测体系,探索通向自主持续学习和递归式自我改进的技术路径。
- 【课题挑战】
- 1、Agentic RL与长时程Credit Assignment:面向代码智能体、复杂工具调用智能体,任务通常包含数百至数千步环境交互,且反馈稀疏、延迟并带有较强噪声。需要研究层次化策略学习、轨迹级与步骤级价值估计、反事实信用分配、失败恢复和探索策略,使模型能够从长程交互轨迹中有效学习规划、推理、工具选择和环境操作能力;
- 2、开放环境中的探索与自主学习:自主智能模型需要主动发现未知问题、识别能力短板并生成具有适当难度的训练任务。需要探索模型的能力边界探测、开放式探索、内在奖励和自博弈机制,形成“发现问题—尝试解决—验证结果—更新能力”的自主学习循环;
- 3、递归式自我改进的稳定性与可控性:模型自主改进可能带来能力快速增长,也可能产生目标漂移、评估失效和累积性错误。需要探索模型生成训练数据、改进算法、优化智能体框架乃至辅助研究流程的技术路径,建立稳定、可解释和可控制的实验范式。
- 【课题价值】
- 1、突破大模型推理与决策能力上限:建立面向数学、代码、科学推理和复杂开放问题的通用强化学习方法,使模型从模仿已有答案迈向主动搜索、验证和发现更优解决方案;
- 2、推动智能体从任务执行走向环境学习:使智能体能够在复杂软件工程、深度研究、数据分析和企业工作流中,根据真实执行反馈持续优化策略;
- 3、建立模型自主持续学习能力:构建模型发现能力缺口、自主生成任务、自主采集反馈、自主验证结果并持续更新的技术闭环,使模型能够适应不断变化的知识、工具和环境;
- 4、探索下一代模型自我进化路径:系统研究从强化学习、在线学习、自博弈和自动课程学习到递归式自我改进的关键技术,为具有持续成长能力的下一代大模型提供理论、算法和系统基础。
- 1、24-27届硕士及以上学历,计算机科学、人工智能、自动化、电子信息、数学、物理等相关专业;其他专业但具备突出研究和动手能力者同样欢迎;
- 2、对强化学习、大模型推理、智能体和自主学习具有强烈兴趣,具备扎实的大模型强化学习算法和训练基础,熟悉PPO、GRPO、OPD等常见的大模型后训练和强化学习算法,拥有大语言模型强化学习相关实习或项目经历;
- 3、具有扎实的编程和计算机系统基础,精通Python等语言,熟悉PyTorch及主流分布式训练框架,具备优秀的工程实现能力。熟悉Linux、Git、推理引擎、分布式训练系统和大规模数据处理流程;
- 4、对自主持续学习、开放式学习、模型自我验证或递归式自我改进等前沿方向具有深入思考,能够在缺少成熟范式和标准答案的开放问题中开展探索性研究,愿意持续解决开放性、高不确定性的技术问题;
- 5、具备良好的沟通协作能力、自驱力和责任意识,能够独立负责重要研究方向,并推动算法、数据、系统和业务团队之间的协同落地;
- 6、在 NeurIPS/ICML/ICLR/ACL/EMNLP/AAAI/IJCAI等相关会议或期刊发表高质量论文者优先。在ACM等高水平算法编程竞赛、CMO/IMO等数学竞赛或其他比赛中取得过优异成绩者优先。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring