← Back to job listings
2N
多模态应⽤研发⼯程师(J13457)
2345 Network · 上海市·浦东新区
About The Role
- 多模态能⼒集成:封装⽂⽣图、⽂⽣视频、语⾳合成/识别、视觉理解等模型能⼒,统⼀抽象为标
准化API/SDK,⽀撑上层业务快速调⽤。
- 跨模态流程编排:设计模态转换Pipeline(如⽂→图→视频→语⾳的串并联编排),实现多模态内
容的协同⽣成与⼀致性控制。
- 产品⼯程落地:将多模态能⼒转化为可交付的场景模板(AI视频、数字⼈、智能剪辑、多模态客
服),完成从模型到⽤⼾界⾯的全链路交付。
- 体验与性能优化:优化⾸帧/⾸包延迟、流式输出、增量渲染、断点续传,保障⽣成式应⽤在消费
级⽹络下的流畅体验。
- 内容质量管控:建⽴多模态内容安全过滤(鉴⻩/鉴暴/版权)、⽣成⼀致性校验、美学质量评分机
- 制。
- 1、精通Python,熟悉Node.js/Go⾄少⼀⻔;有全栈⼯程能⼒,熟悉React/Vue前端框架加分
- 2、熟悉主流多模态模型⽣态:Stable Diffusion/Flux、可灵/Sora API、TTS/ASR、GPT-4V/Claude3
- 视觉能⼒等
- 3、熟悉⾳视频编解码(FFmpeg)、图像处理(Pillow/OpenCV)、流式传输(WebSocket/SSE)技术栈
- 4、了解Diffusion/DiT/Flow Matching等多模态⽣成原理,能根据场景做模型选型与参数调优
- 5、熟悉ComfyUI/SD WebUI等⼯作流引擎,能将其转化为程序化Pipeline
- 6、具备"模型能⼒产品化"思维,能将⿊盒⽣成模型转化为⽩盒可控的⼯程组件
- 7、理解多模态数据的时空对⻬问题,能解决跨模态⽣成中的⻛格/内容⼀致性难题
- 8、对⽣成内容的延迟、稳定性、成本敏感,能在效果与资源消耗间做⼯程权衡
- 加分项
- 1、有AI视频、数字⼈、智能剪辑、AIGC⼯具链等落地产品经验
- 2、具备GPU推理优化经验(TensorRT/ONNX/量化加速)
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring