【星火X计划】原生多模态通用大模型算法研究(J13980)
iFLYTEK · 安徽省·合肥市, 北京市
About The Role
【课题介绍】
本课题聚焦通用原生多模态大模型研发中的核心技术瓶颈,围绕原生多模态模型架构、多模态数据智能治理、高效预训练与对齐、多模态理解与推理、高分辨率图像和长视频建模、大规模分布式训练优化及模型评测等核心方向,构建具备统一感知、深度理解、复杂推理和可靠生成能力的通用多模态模型体系。
针对多模态模型训练过程中存在的模态表征差异大、图文语义对齐困难、视觉信息压缩损失、多模态数据质量参差、不同模态与任务训练失衡、高分辨率及长视频计算成本高、细粒度感知能力不足、多模态幻觉突出等问题,开展系统性研究。通过协同优化模型架构、视觉编码器、模态连接模块、预训练目标、数据配比、损失权重、课程学习及分布式训练策略,建立覆盖数据治理、模型训练、能力评测和工业级落地的完整技术方案。
课题将支撑通用多模态基座模型的高效、稳定训练,建设标准化、自动化、可迭代的多模态能力评测体系,形成“数据构建—模型训练—能力评测—问题归因—算法迭代”的完整闭环,持续提升模型在通用视觉理解、视频理解、文档解析、视觉推理、内容生成及多模态智能体等方向的能力。
【课题挑战】
1、原生多模态模型架构研究挑战
不同模态在信息密度、时空结构、序列长度及语义粒度方面存在显著差异,传统的“视觉编码器+连接模块+语言模型”架构容易出现视觉信息压缩过度、模态交互不足及细粒度信息丢失等问题。
需要研究高效视觉与音频编码器、模态连接机制、统一自注意力架构、多模态位置编码、动态分辨率建模及统一理解生成架构,探索模型深度、宽度、视觉词元数量与语言模型规模之间的最优配置,构建兼顾模型能力、训练效率和推理成本的原生多模态模型架构。
2、多模态数据构建与智能治理挑战
互联网多模态数据普遍存在图文错配、描述信息不足、内容重复、噪声较多、领域分布不均、时效性不足及版权安全风险等问题。视频、文档、图表、OCR 和专业领域数据还面临高质量标注稀缺、语义粒度不一致及自动化处理成本高等挑战。
需要研究多模态数据过滤、去重、语义匹配、质量评估、知识增强、难例挖掘及合成数据生成方法,建设覆盖图文对、交错图文、视频文本、文档图表及多轮视觉对话等数据形态的自动化治理体系,从数据源头提升模型训练效率与能力上限。
3、多模态预训练与模态均衡挑战
多模态预训练同时包含视觉识别、图文对齐、语言建模、视觉问答、定位、生成及多轮交互等多类目标。不同任务的数据规模、序列长度、损失量级和学习难度差异较大,容易出现语言模态占据主导、视觉能力学习不足、部分任务梯度冲突及模型能力相互干扰等问题。
需要研究统一多模态预训练目标、任务采样、课程学习、梯度平衡及损失归一化方法,合理设计词元级、样本级和任务级权重,解决长短样本、不同模态及不同任务之间的训练失衡问题,实现多模态能力的协调学习与稳定提升。
4、多模态理解、推理与幻觉抑制挑战
多模态模型在细粒度目标识别、空间关系理解、时序事件分析、文档图表解析及复杂视觉推理等任务中,容易出现感知错误、推理链断裂、视觉证据利用不足及生成内容与输入不一致等问题。
需要研究细粒度视觉表征、目标定位与指代消解、空间和时序建模、证据约束推理、视觉思维链及事实一致性校验方法,提升模型基于视觉证据进行复杂推理的能力,降低对象、属性、数量、位置和事件关系等方面的多模态幻觉。
5、多模态能力评测与迭代闭环挑战
建设覆盖通用视觉理解、OCR、文档与图表解析、空间关系、视觉定位、视频理解、复杂推理、内容生成及多模态智能体等方向的综合评测体系。
通过训练过程监控、阶段性能力评测、数据污染检测、错误样本聚类及模型行为归因,准确区分感知错误、知识缺失、推理错误和语言表达错误,定位模型能力短板,支撑多模态数据、模型架构和训练算法持续迭代。
【课题价值】
1、提升通用多模态理解与推理能力
推动模型从基础图像识别和图文问答,向细粒度感知、复杂视觉推理、长视频理解及真实环境交互演进,持续提升模型理解和处理现实世界多模态信息的能力。
2、构建高质量多模态数据与算法体系
形成标准化、可复用、可扩展的多模态数据治理方案、训练范式与评测体系,缓解图文错配、数据噪声、任务失衡和视觉信息利用不足等问题,为通用多模态基座模型持续迭代提供核心支撑。
3、降低多模态模型训练与推理成本
通过视觉词元压缩、动态分辨率、数据流水线优化及多维并行训练等技术,降低高分辨率图像和长视频带来的计算、显存、通信及存储开销,提高 GPU 集群有效利用率和模型推理效率。
4、支撑多模态模型规模化应用
提升模型在文档理解、图表分析、内容创作、视频分析、视觉搜索、人机交互及多模态智能体等场景中的可用性和可靠性,为多模态模型的规模化落地提供技术基础。
5、构建核心技术竞争力与学术影响力
形成自主可控的多模态大模型技术体系,产出高水平学术论文、原创算法模块、评测基准及开源工具,提升公司在通用多模态模型领域的技术影响力,支撑下一代多模态基座模型持续演进。
1、28届及以后在读硕士及以上学历,人工智能、计算机科学与技术、计算机视觉、电子信息、自动化、应用数学等相关专业,其他专业但具备突出研究和动手能力者同样欢迎;
2、具备扎实的机器学习、深度学习和大模型基础,熟悉 Transformer、Vision Transformer、视觉语言模型等基本架构,了解多模态模型的主要训练流程与技术范式;
3、熟练掌握 Python,具备良好的 C/C++ 编程能力,熟悉 PyTorch 框架;具有 Transformers、Megatron-LM、DeepSpeed、Colossal-AI 等框架使用或二次开发经验者优先;
4、熟悉多模态模型相关技术,包括但不限于视觉编码器、模态连接器、图文对比学习、多模态位置编码、动态分辨率、视觉指令微调、多模态偏好对齐及强化学习等;具有相关科研或项目经历者优先;
5、具有多模态数据构建与治理经验,熟悉图文数据过滤、去重、质量评估、数据合成、任务配比或动态采样等方法者优先;
6、具备良好的沟通协作能力,能够与数据、预训练、工程、推理及业务团队协同完成算法落地、模型迭代和应用适配;具有较强的责任心、执行力和复杂问题解决能力;
7、在 NeurIPS、ICLR、ICML、CVPR、ICCV、ECCV等顶级会议或相关高水平期刊发表过多模态学习、计算机视觉、自然语言处理或大模型相关论文者优先。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring