【星火X计划】基于多模态大模型的类人辅学系统研发(J13982)
iFLYTEK · 安徽省·合肥市
About The Role
【课题介绍】
本课题聚焦多模态大模型(MLLM)在K12教育场景(如复杂图文答题、辅学讲题、步骤批改等)中,端到端推理能力不足、多模题型效果普遍低于单模题、数形结合的多模讲解尚未规模应用的核心难题。在K12辅学场景中,业务对模型输出的逻辑严密性与准确率有着极高的要求(必须达到97%以上的可用精度)。然而,现有大模型在处理复杂几何图解、超多小物体计数等任务时,常因局部的“视觉感知误差”引发后续的“推理逻辑错误”,导致严重的模型幻觉。
课题针对上述痛点,突破传统多模态模型“粗粒度感知”的技术局限,设计端到端的多模态感知与推理增强架构。在感知端,攻克视觉编码器在处理复杂图表时高频信息丢失的难题,构建适配动态高分辨率的精准视觉感知体系;在推理端,探索视觉感知与大模型多步思维链(Multimodal CoT)的深度对齐机制,引入过程监督与推理期自我校验。最终形成一套兼顾感知精度、推理稳定性和生成效率的统一多模态辅学方案,彻底打通“看清、看懂、做对、讲透”的全链路,支撑公司多模态大模型在教育等复杂场景下的落地应用。
【课题挑战】
1、复杂图文的细粒度感知与特征提取难题:在K12场景中,遗漏微小的几何辅助线或目标均不可接受。需打破常规多模态架构的表征瓶颈,探索动态分辨率、视觉Token自适应筛选与无损压缩机制;实现对复杂几何结构、密集微小目标的高精度感知,并完成视觉特征与文本逻辑的精细对齐;
2、多模态多步推理与幻觉抑制难题:在长思维链推理中,需解决因感知模糊引发的逻辑错误蔓延问题。探索多模态思维链(Multimodal CoT)与跨模态溯源(Grounding)机制,保障大模型推理的每一步推导都能准确对应到视觉输入,从机制上减少由感知误差导致的推理幻觉;
3、语言先验偏见与“视觉忽视”难题:在多模态答题中,大模型常受限于强大的文本先验,表现出“不看图”、直接依赖纯文本经验推理的偏好,极易引发脱离图像的幻觉。需研究跨模态特征的均衡融合与去偏策略,建立强制视觉依赖机制,确保模型在推理过程中真实、有效地利用图像信息;
4、多模态过程监督难题:高精度多模态辅学不仅要求最终答案正确,更要求中间推理步骤和视觉依据完全匹配。这类多模态Step-by-step过程标注数据极度稀缺且成本高昂。需探索代码化图文生成、模型自动化标注等数据合成方法,并构建多模态过程奖励模型,解决多模态推理强化学习中的细粒度奖励分配问题;
5、多模题图片准确复刻难题:几何、函数等题型需要图形化讲解,业内大模型普遍多模细节感知能力不强的情况下,如何确保多模题中的图片准确复刻,以实现围绕图片进行图形化易理解讲解,需要探索基于coding能力的绘图模型,实现题干中的图形被准确复刻,从而提升多模题图形化讲解的准确性。
【课题价值】
1、技术创新价值:突破现有通用大模型“粗感知、弱推理”的技术瓶颈,构建融合细粒度视觉理解与多步逻辑推理的多模态辅学大模型框架,填补行业在高精度多模态教育推理技术上的空白;
2、工程落地价值:打通“高清视觉感知优化 - 多模态联合训练 - 复杂推理搜索加速”的全链路工程栈,构建适配生产环境的多模态推理工具链,支撑自研大模型在多模答题、AI辅学、智能批改等核心场景的规模化部署;
3、业务赋能价值:跨越97%的业务可用精度门槛,解决大模型在严肃教育场景中“看不清、数不对、理不顺、讲不懂”的痛点,扩展多模态大模型在理科复杂推导、跨模态知识检索、科研助手等高门槛场景的应用边界;
4、技术壁垒价值:形成完整的高分辨率视觉编码、多模态逻辑对齐、过程监督推理强化技术体系,产出CVPR、ICLR、NeurIPS等高水平顶会论文,沉淀高质量多模态辅学数据集与专利,夯实公司在多模态复杂推理领域的技术壁垒。
1、24-27届博士毕业生,人工智能、计算机科学、计算机视觉、自然语言处理、多模态学习、深度学习等相关专业,具备良好的科研素养与前沿研究视野;
2、理论功底扎实,精通多模态大模型(MLLM)与大语言模型基础理论,熟悉主流视觉模型与多模态架构(如LLaVA、Qwen-VL等);对多模态复杂推理(Visual Reasoning)、图片思维链(Multimodal CoT)、细粒度感知及多模态强化学习有深入研究者优先;
3、具备优秀的独立科研攻关与复杂问题拆解能力,能够准确挖掘多模态大模型在高精度场景下“感知-推理”协同受限的技术瓶颈,独立完成原创算法方案设计、数据合成管线搭建与大规模模型训练验证;
4、拥有扎实的数理推导、算法建模与实验设计能力,有CVPR、ICLR、NeurIPS、ACL、ICCV等顶会在多模态大模型、视觉推理、强化学习对齐等相关方向论文发表或录用经历优先;
5、具备良好的工程实操能力,熟练使用PyTorch及主流大模型训练/推理框架(如Megatron、DeepSpeed、vLLM等),熟悉多模态分布式训练、显存优化及推理加速方案,具备多模态基座模型预训练或SFT微调经验者优先;
6、具备良好的跨团队协作能力,可协同预训练、数据构建、工程加速及业务落地团队推进多模态推理优化技术的迭代,抗压能力强,能够紧跟工业级前沿算法研发节奏。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring