【星火X计划】高可信低幻觉大模型技术研究(J13811)
iFLYTEK · 安徽省·合肥市
About The Role
【课题介绍】
本课题聚焦大模型在复杂推理任务(如数学推导、代码生成、步骤批改等)中准确度不足、存在幻觉与逻辑跳跃的核心难题。针对当前大模型强化学习中基于结果监督(ORM)存在的奖励稀疏、信用分配困难等技术瓶颈,围绕基于Harness的生成策略优化、过程监督奖励模型(PRM)强化学习、以及推理期算力扩展三大核心主线,开展高可靠、强逻辑推理能力的融合优化建模研究。
当前主流的ORM范式虽然易于获取数据,但在长链路推理中极易出现“过程错误但结果碰巧正确”的虚假关联,且无法为模型提供细粒度的纠错引导,导致强化学习陷入奖励稀疏陷阱;传统的推理生成(如贪婪解码、基础束搜索)缺乏自我校验与探索机制,难以突破模型单次前向推理的能力上限。
课题针对上述痛点,突破传统后训练与推理生成的局限,设计“Harness套件+过程监督强化学习”联合增强架构:在训练端,探索并构建高精度的PRM,实现对复杂推理中间步骤的精准粒度评估,彻底解决强化学习奖励稀疏问题;在推理端,基于Harness框架设计动态反馈与自适应搜索机制(如结合PRM的MCTS蒙特卡洛树搜索等),实现推理步骤的自我验证与回溯。最终形成一套兼顾训练效率、推理准确度与结果可信度的统一大模型强化推理方案,支撑公司在复杂任务场景下的高阶逻辑大模型研发与落地。
【课题挑战】
1、长程推理的隐式信用分配与过程建模难题:在长链路推理场景下,关键步骤的信用分配极具挑战。需打破传统PRM重度依赖Step-by-step显式人工标注的技术桎梏,探索隐式信用分配与过程建模机制。通过挖掘推理轨迹内部的状态特性,自适应定位对最终结果起决定性作用的关键Token或节点,实现稀疏全局奖励向局部核心步骤的精准映射,建立更具本质泛化能力的细粒度奖励范式;
2、强化学习中的奖励稀疏与Reward Hacking冲突:在长链路推理中,探索如何利用PRM提供密集且稳定的奖励信号,优化PPO/GRPO等RL算法的价值估计与策略更新机制,同时规避模型在细粒度奖励下产生的捷径优化与奖励破解问题;
3、高可靠Harness架构设计与全维度评测缺失难题:现有评测往往仅关注最终结果的静态匹配,难以支撑长程推理中的过程干预与状态追踪。需从算法与架构底层设计具备强扩展性的自动化推理验证基座;并以此为基础,构建覆盖逻辑连贯性、错误探知率及输出可信度的全维度评测体系,为大模型推理能力的迭代验证提供严谨的闭环支撑;
4、推理期算力扩展的效能平衡难题:在复杂推理任务中,通过扩展推理期算力以提升生成质量,极易引发计算与显存开销的急剧膨胀,并伴随边际效用递减。需深入探索动态算力分配、自适应剪枝与提前终止等机制,解决不同任务复杂度下算力投入与推理准确度之间的有效性转化问题,实现“生成效率与推理精度”的最优平衡。
【课题价值】
1、技术创新价值:突破传统结果监督RLHF的技术瓶颈,首创适配复杂逻辑任务的PRM过程监督与Harness推理搜索融合范式,有效化解强化学习奖励稀疏难题,填补行业在高可靠长链路推理机制上的技术空白;
2、工程落地价值:打通“PRM训练 - RL策略优化 - 复杂推理搜索加速”的全链路工程栈,构建适配生产环境的高效Harness推理工具链,支撑自研大模型在数学、代码、Agent决策等核心场景的规模化部署;
3、业务赋能价值:显著提升大模型在严肃商业场景中的可信度与准确率,解决逻辑断层、过程幻觉、无法自我纠错的业务痛点,大幅扩展大模型在金融推理、自动编程、复杂科研助手等高壁垒场景的业务边界;
4、技术壁垒价值:形成完整的过程监督奖励建模、推理期搜索强化技术体系,产出ICLR、NeurIPS等高水平顶会论文,沉淀高质量逻辑推理数据集与专利,夯实公司在AGI复杂推理领域的行业技术壁垒与学术影响力。
1、24-27届博士毕业生,人工智能、计算机科学、强化学习、深度学习、自然语言处理、应用数学等相关专业,具备良好的科研素养与前沿研究视野;
2、理论功底扎实,精通大模型基础理论,深入理解强化学习(GRPO、PPO等)与奖励模型(RM)核心机制;对过程监督(PRM)、搜索解码(MCTS等)及解决强化学习奖励稀疏问题有深入研究者优先;
3、具备优秀的独立科研攻关与复杂问题拆解能力,能够精准挖掘大模型推理准确度与可信度提升过程中的技术瓶颈,独立完成原创算法方案设计、数据合成管线搭建与大规模强化学习实验验证,具备较强的技术问题复盘思维;
4、拥有扎实的数理推导、算法建模与实验设计能力,有ICLR、NeurIPS、ICML、ACL等顶会在强化学习、大模型推理、对齐技术、Harness相关论文发表或录用经历优先;
5、具备良好的工程实操能力,熟练使用PyTorch及主流大模型训练/推理框架(如Megatron、vLLM、DeepSpeed、VeRL或OpenRLHF等),熟悉RL分布式训练、显存优化及推理加速方案,具备大模型后训练或复杂Harness框架开发经验者优先;
6、具备良好的跨团队协作能力,可协同预训练、工程加速及业务落地团队推进推理优化技术的迭代,抗压能力强,能够紧跟工业级前沿算法研发节奏。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring