Skip to content
← Back to job listings

多模态应⽤研发⼯程师(J13457)

2345 Network · 上海市·浦东新区

External listingfull-time3 months ago

About The Role

  1. 多模态能⼒集成:封装⽂⽣图、⽂⽣视频、语⾳合成/识别、视觉理解等模型能⼒,统⼀抽象为标

准化API/SDK,⽀撑上层业务快速调⽤。

  1. 跨模态流程编排:设计模态转换Pipeline(如⽂→图→视频→语⾳的串并联编排),实现多模态内

容的协同⽣成与⼀致性控制。

  1. 产品⼯程落地:将多模态能⼒转化为可交付的场景模板(AI视频、数字⼈、智能剪辑、多模态客

服),完成从模型到⽤⼾界⾯的全链路交付。

  1. 体验与性能优化:优化⾸帧/⾸包延迟、流式输出、增量渲染、断点续传,保障⽣成式应⽤在消费

级⽹络下的流畅体验。

  1. 内容质量管控:建⽴多模态内容安全过滤(鉴⻩/鉴暴/版权)、⽣成⼀致性校验、美学质量评分机
  • 制。
  • 1、精通Python,熟悉Node.js/Go⾄少⼀⻔;有全栈⼯程能⼒,熟悉React/Vue前端框架加分
  • 2、熟悉主流多模态模型⽣态:Stable Diffusion/Flux、可灵/Sora API、TTS/ASR、GPT-4V/Claude3
  • 视觉能⼒等
  • 3、熟悉⾳视频编解码(FFmpeg)、图像处理(Pillow/OpenCV)、流式传输(WebSocket/SSE)技术栈
  • 4、了解Diffusion/DiT/Flow Matching等多模态⽣成原理,能根据场景做模型选型与参数调优
  • 5、熟悉ComfyUI/SD WebUI等⼯作流引擎,能将其转化为程序化Pipeline
  • 6、具备"模型能⼒产品化"思维,能将⿊盒⽣成模型转化为⽩盒可控的⼯程组件
  • 7、理解多模态数据的时空对⻬问题,能解决跨模态⽣成中的⻛格/内容⼀致性难题
  • 8、对⽣成内容的延迟、稳定性、成本敏感,能在效果与资源消耗间做⼯程权衡
  • 加分项
  • 1、有AI视频、数字⼈、智能剪辑、AIGC⼯具链等落地产品经验
  • 2、具备GPU推理优化经验(TensorRT/ONNX/量化加速)

This is an external listing. JobSpring does not represent or verify the employer. Report this listing