【星火X计划】实时音视频一体化生成关键技术研究(J13902)
iFLYTEK · 安徽省·合肥市
About The Role
【课题介绍】
本课题面向实时交互场景的音视频一体化数字人生成技术,围绕数字人的语音、表情动作、声场环境和视频画面进行统一建模,构建具备高拟人度、高可控性、高音频质量、长时一致性和低延迟流式生成能力的数字人生成基座。
当前数字人生成多采用“文本/语义理解、TTS、唇驱、表情动作驱动、视频渲染”级联链路,工程上易落地,但在真实交互中容易出现多模态割裂问题:语音与口型同步但情绪、表情和动作不一致;人物与背景画面的光照、空间和运动关系不稳定;声场、背景音、环境氛围与视频画面缺乏统一建模;长时生成中人物身份、音色、动作风格和画面细节逐步漂移;同时级联链路带来较高端到端延迟,难以支撑自然连续的实时交互体验。
课题拟研究音频与视频原生联合生成模型,探索纯 DiT 或类 DiT 统一生成架构下的语音、人物动作与视频画面协同建模方法。重点提升一体化生成中的语音自然度、音色稳定性、韵律情绪表达、背景音画一致性和声场空间一致性,解决统一音视频生成架构下语音合成稳定性不足、音频细节易退化的问题;突破长时生成中的人物身份保持、动作风格延续、背景画面稳定、音画空间一致和跨片段无缝衔接难题;面向在线交互场景,研究流式生成、因果建模、低延迟推理、后训练对齐、蒸馏压缩和端侧/云侧协同部署等关键技术,并为后续与交互理解模型端到端融合奠定基础。
【课题挑战】
1、音视频一体化架构下的高一致性生成问题
数字人生成不仅需要语音和口型同步,还需要语音韵律、表情动作、人物姿态、镜头运动、背景画面、环境声和空间声场在统一时空内保持一致。如何在统一生成架构中同时建模人物表达、画面动态、背景环境和声音空间关系,避免“音频像后贴、画面像拼接、动作像模板”的割裂感,是课题的核心挑战。
2、纯 DiT/类DiT框架下的高质量语音生成稳定性问题
在音视频一体化生成模型中,语音不应只是视频生成的附属条件,而应作为核心生成目标之一。纯 DiT 或类 DiT 统一架构在建模视觉动态方面具备优势,但在语音音色保持、韵律自然度、细粒度音频纹理、情绪表达、背景音融合和长时稳定性方面仍存在挑战。需要研究适配统一音视频模型的音频表征、音频 tokenizer / codec、跨模态注意力机制、损失设计和训练策略,提升一体化模型中的语音合成质量与稳定性。
3、长时流式生成中的身份、音色、动作与背景一致性问题
实时数字人需要连续生成较长时间内容,模型容易在分钟级生成中出现人物身份漂移、音色变化、表情风格不连续、动作循环、背景闪烁、光照变化、声场跳变、片段边界不平滑等问题。课题需要研究长时记忆、状态缓存、跨 chunk 一致性约束、音画同步校正和流式生成状态管理,实现长时连续输出下的人物、声音、动作和环境高一致性。
4、视频生成后训练、蒸馏压缩与低延迟部署问题
交互场景对首帧延迟、持续生成速度、音画同步和响应自然度要求极高,单纯依赖大模型离线生成难以满足线上部署需求。课题需研究面向数字人生成的后训练技术,包括偏好对齐、质量奖励模型、同步性奖励、人物一致性奖励、交互自然度评测与优化;同时探索低步数采样、模型蒸馏、结构剪枝、量化压缩、缓存复用和推理调度等方法,在保证音频质量、画面质量和长时一致性的前提下,实现低延迟流式生成。
【课题价值】
1、技术创新价值
突破传统数字人级联链路在音视频一致性、语音质量、人物拟人度和长时稳定性上的瓶颈,形成面向交互式数字人的音视频原生联合生成技术体系。
2、工程落地价值
支撑公司构建可在线服务的数字人生成引擎,实现高质量、可控、长时稳定、低延迟的流式音视频生成能力,满足实时交互场景的部署要求。
3、业务赋能价值
提升数字人在智能客服、教育陪练、直播导购、内容生产、虚拟陪伴、企业导览等场景中的自然表达和连续交互体验,使数字人从“离线播报视频”升级为“可实时交流的具身 Agent”。
4、技术壁垒价值
沉淀统一音视频生成模型、数字人数据管线、长时一致性建模、后训练对齐、蒸馏压缩、流式推理和评测体系,形成公司在交互式数字人生成方向的核心算法资产。
1、24-27届博士毕业生,人工智能、计算机视觉、语音信号处理、机器学习、计算机图形学、多媒体、电子信息等相关专业,具备良好的科研能力和前沿技术敏感度;
2、熟悉视频生成、音频生成、多模态生成、扩散模型、DiT/mmDiT、Flow Matching、VAE/Codec、Transformer 等技术;有数字人、talking-head、portrait animation、human video generation 或音视频联合生成经验者优先;
3、熟悉语音合成、Audio Codec、声学建模、韵律建模、音色克隆、语音情绪控制、空间音频或背景音生成等方向;具备语音和视觉生成交叉背景者优先;
4、具备长时序建模和流式推理经验,了解 causal attention、chunk-based generation、状态缓存复用、跨片段一致性建模、低步数采样、实时音视频系统者优先;
5、具备后训练和生成模型优化经验,熟悉偏好对齐、奖励模型、DPO/RLHF、模型蒸馏、量化压缩、推理加速等方法,能够围绕数字人生成效果进行系统性优化;
6、熟悉视频生成模型训练工具链,掌握 PyTorch 及 Diffuser 等扩散/DiT 视频生成训练框架;熟悉DeepSpeed、FSDP等大规模分布式训练框架者优先;
7、具备扎实的实验设计和评测能力,能够围绕音频质量、唇形同步、表情自然度、动作真实感、身份一致性、声场一致性、背景稳定性、长时稳定性和端到端延迟建立评测体系;
8、有 CVPR、ICCV、ECCV、NeurIPS、ICLR、ICASSP、INTERSPEECH、SIGGRAPH 等论文或高质量开源经验者优先。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring