Skip to content
← Back to job listings

【星火X计划】音频生成大模型研究(J13901)

iFLYTEK · 安徽省·合肥市, 上海市

External listingfull-time4 days ago

About The Role

【课题介绍】

本课题聚焦"端到端语音生成大模型"这一语音合成范式变革的核心方向,突破传统 TTS 在音质自然度、音色/韵律/情感可控性、零样本泛化、多说话人多轮交互生成上的固有瓶颈,构建以大语言模型为语义骨架、以扩散/多 token预测为声学生成引擎的端到端高保真语音生成体系。课题围绕LLM + DiT/MTP 端到端语音生成框架、通用音频生成 tokenizer、多人多轮细粒度指令语音生成三大核心主线,打造高保真、强可控、广泛化的通用语音生成大模型。本课题聚焦"发声之口",为课题“端到端语音底座大模型研究”提供高质量语音输出能力,二者合力构成完整的端到端语音交互链路。

当前语音生成技术面临三重挑战:一是自回归离散 token 方案生成效率高但音质与稳定性受限,扩散方案音质高但生成慢、可控性弱,如何融合两者优势尚无成熟范式;二是音频 tokenizer 作为生成大模型的"词表",其重建保真度、语义—声学信息解耦、码本利用率直接决定生成上限,通用性不足;三是真实交互场景需要多说话人、多轮对话、细粒度指令控制(音色、情感、语速、风格、副语言)的生成能力,现有方案难以同时满足可控性与自然度。本课题面向这三重挑战开展端到端建模创新。

方向一:端到端语音生成模型框架

以大语言模型完成文本/语义到声学表征的映射,以扩散模型(DiT)或多 token 预测(MTP, Multi-Token Prediction)完成高保真声学生成,构建语义骨架与声学引擎协同的端到端框架。重点研究 LLM 与 DiT/MTP 的耦合方式、语义条件注入机制、生成质量与推理效率的平衡、流式低延迟生成(支撑课题一实时交互)等问题。

方向二:通用音频生成 tokenizer

研究面向生成大模型的通用音频离散化表征,覆盖语音、音乐、音效等多类音频。重点攻坚高压缩率下的重建保真度、语义信息与声学细节的分层解耦、码本利用率与稳定性、tokenizer 与下游生成模型的联合优化,构建可作为通用"音频词表"的高质量 tokenizer。

方向三:多人多轮细粒度指令语音生成技术

面向真实对话与内容生成场景,攻坚多说话人、多轮对话、细粒度指令控制的语音生成。重点研究零样本音色复刻与说话人解耦、情感/语速/风格/副语言的细粒度指令控制、多轮对话中的音色一致性与韵律连贯、长音频生成的稳定性与一致性等问题。

【课题挑战】

1、LLM 语义骨架与 DiT/MTP 声学引擎的耦合建模难题。 自回归 LLM 与非自回归扩散/多 token 预测在建模范式、训练目标、推理机制上存在本质差异,如何设计语义条件的高效注入、两阶段的联合或协同训练、避免误差在语义—声学接口累积,是端到端框架的核心挑战;同时需兼顾生成质量与推理效率,支撑实时流式生成;

2、通用音频生成 tokenizer 的保真—压缩—解耦三难平衡。 tokenizer 需在高压缩率下保持高重建保真度,同时实现语义信息与声学细节的分层解耦、维持高码本利用率与训练稳定性;面向语音、音乐、音效等异质音频构建统一表征,并与下游生成模型联合优化,是决定生成上限的底层难题;

3、细粒度指令可控生成与自然度的冲突。 音色、情感、语速、风格、副语言等多维属性的独立可控往往以牺牲自然度为代价;需设计属性解耦与精准控制机制,在零样本条件下实现属性可控的同时保持高自然度与高保真,规避可控性与音质的此消彼长;

4、多说话人多轮场景的一致性与稳定性难题。 多轮对话要求音色、韵律、风格的跨轮一致,长音频生成需避免音色漂移、韵律断裂、重复与跳读;零样本复刻需在极少参考音频下完成说话人解耦与高保真复刻,需研究说话人一致性约束、长序列生成稳定性、多说话人切换的自然衔接;

5、端到端语音生成的评测体系缺失。 现有评测多依赖主观 MOS 与单一客观指标,难以量化零样本复刻相似度、细粒度指令遵循度、情感/风格控制精度、多轮一致性等维度;需搭建覆盖音质、相似度、可控性、一致性、生成效率的全维度自动化评测平台,支撑算法有效性与稳定性验证。

【课题价值】

1、技术创新价值:突破自回归离散方案与扩散方案各自的局限,首创 LLM + DiT/MTP 协同的端到端高保真语音生成范式,兼顾音质、可控性、零样本泛化与生成效率,并构建通用音频 tokenizer,填补通用语音生成大模型在保真度、可控性、通用表征方向的技术空白;

2、工程落地价值:解决传统 TTS 音质不够自然、可控性弱、零样本泛化差、多轮一致性缺失的工业痛点,支撑公司语音合成、声音复刻、虚拟人、有声内容生成等自研产品的端到端升级,并为课题”音频生成大模型研究“实时交互提供低延迟高保真语音输出;

3、业务赋能价值:大幅提升个性化声音复刻、情感化语音交互、多角色有声内容、多语种语音生成等复杂场景的效果与体验,解决音色不像、情感僵硬、多轮漂移等问题,拓展语音生成的业务边界;

4、技术壁垒价值:形成完整的端到端语音生成建模、通用音频 tokenizer、细粒度可控生成技术体系,产出高水平顶会论文、自研语音生成大模型与优化工具链,夯实公司在下一代语音生成领域的行业技术壁垒与学术影响力。

1、24-27届博士毕业生,人工智能、计算机科学、深度学习、信号处理、自然语言处理、电子信息等相关专业,具备良好的科研素养与前沿研究视野;

2、理论功底扎实,掌握深度学习与大模型核心基础理论,熟悉语音合成、音频生成、扩散模型、离散音频表征或语音—语言多模态建模的核心原理与前沿进展,了解大模型预训练、微调、推理全链路技术体系;具备端到端语音生成、DiT/流匹配、音频 tokenizer 相关研究经验者优先;

3、具备优秀的独立科研攻关与复杂问题拆解能力,能够精准定位端到端语音生成建模中的核心技术瓶颈,独立完成原创算法方案设计、原理迭代与大规模实验验证,具备较强的问题复盘与技术优化思维;

4、拥有扎实的数理推导、算法建模与实验设计能力,可独立完成语音生成框架设计、音频表征学习、可控生成、扩散/多 token 预测建模等方向的算法创新与消融实验;有 ICASSP、INTERSPEECH、ACL、ICLR、NeurIPS、ICML 等顶会/顶刊语音、音频、生成模型相关论文发表或录用经历优先;

5、具备良好的工程实操能力,熟练使用 PyTorch 及主流大模型/扩散模型训练框架,熟悉大模型分布式训练、显存优化、推理加速等工程落地技术,具备大规模语音/音频/多模态模型训练经验者优先;

6、具备良好的跨团队协作能力,可协同模型训练、推理加速、业务落地团队推进技术迭代,抗压能力强,能够适配工业级前沿算法研发节奏。

This is an external listing. JobSpring does not represent or verify the employer. Report this listing