Skip to content
← Back to job listings

国家智能语音创新中心-大模型算法工程师-合肥(J14403)

iFLYTEK · 安徽省·合肥市

Imported listingfull-time3 days ago

About The Role

  • 1.负责文本、图像、视频和音频的多模态表征学习、特征融合及联合建模。
  • 2.研究跨模态语义对齐算法,解决视觉、语音、文本及终端状态信息之间的表示差异。
  • 3.研究基于交叉注意力、对比学习和共享表征空间的多模态特征融合方法。
  • 4.负责视觉语言模型、音视频语言模型及全模态模型的算法设计、训练和效果优化。
  • 5.研究图像及视频中的视觉指代、目标定位、区域语义理解和细粒度视觉问答算法。
  • 6.研究视频时序建模算法,识别操作前后页面状态变化、界面跳转和动态响应过程。
  • 7.研究音视频联合建模算法,提升模型对提示音、语音反馈、界面变化和设备状态的综合理解能力。
  • 8.建设多模态结果断言模型,将测试意图、操作过程、状态变化和最终结果纳入统一模型进行判断。
  • 9.研究多模态因果推理和状态转移建模,判断终端状态变化是否由指定操作触发。
  • 10.研究复杂场景下的多模态异常识别算法,区分无响应、错误响应、状态异常和识别不确定等情况。
  • 11.基于视觉检测、OCR和UI识别结果,研究界面结构编码、控件关系建模和页面语义图构建算法。
  • 12.研究GUI Agent的状态表示、动作空间建模、策略生成和操作轨迹预测算法。
  • 13.跟踪多模态大模型、GUI Agent、VLA、世界模型、模仿学习和强化学习等前沿方向,并完成算法复现与改进。
  • 1.硕士及以上学历,计算机、人工智能、模式识别、计算机视觉或相关专业。
  • 2.具备3年以上多模态、计算机视觉、视频理解或大模型算法研发经验。
  • 3.熟练使用Py thon和PyTorch,能够独立完成模型结构开发、训练、调试和实验分析。
  • 4.熟悉Transformer、注意力机制、视觉编码器、语言模型和跨模态交互模块。
  • 5.熟悉对比学习、跨模态对齐、多模态融合、多任务学习等算法。
  • 6.熟悉视觉语言模型或全模态模型的训练流程,具备真实模型训练经验,不限于接口调用。
  • 7.熟悉监督微调、视觉指令微调、偏好优化或强化学习中的一种以上。
  • 8.熟悉图像分类、目标检测、视觉指代、视频理解或音视频联合建模中的两类以上。
  • 9.具备视频时序建模经验,熟悉时序注意力、状态转移识别或动作识别方法。
  • 10.具备多模态数据集建设经验,能够设计样本组织方式、正负样本和任务标签。
  • 11.具备独立设计损失函数、训练策略和评测指标的能力。
  • 12.能够通过消融实验、错误样本分析和数据分布分析定位模型问题。
  • 13.具备较强的论文阅读和算法复现能力,能够将前沿方法迁移到实际任务。
  • 14.能够独立完成从任务定义、数据构建、模型设计到算法验证的完整研发过程。
  • 【加分项】
  • 1.具备视觉语言模型、音视频大模型或全模态模型训练经验。
  • 2.具备多模态断言、视觉问答、视觉指代或视频时序推理项目经验。
  • 3.具备GUI Agent、Computer Use Agent或智能终端操作模型研发经验。
  • 4.熟悉模仿学习、强化学习、世界模型或智能体策略学习。
  • 5.具备多模态自学习、主动学习或不确定性估计相关经验。
  • 6.在多模态、计算机视觉、大模型或智能体方向发表过论文或拥有开源项目。

This is an external listing. JobSpring does not represent or verify the employer. Report this listing