Skip to content
← Back to job listings

【星火X计划】端到端语音底座大模型研究(J13899)

iFLYTEK · 安徽省·合肥市, 上海市, 陕西省·西安市

External listingfull-time4 days ago

About The Role

【课题介绍】

本课题聚焦"端到端语音大模型"这一下一代人机语音交互的核心底座,突破当前"识别—理解—对话"级联架构在延迟、误差累积、副语言信息丢失上的固有瓶颈,构建以语音为中心、直接从声学信号完成语义理解与交互决策的统一大模型体系。课题以端到端实时语音交互大模型框架为统一建模底座,向下支撑端到端语音同传翻译与长上下文语音识别两大专项能力攻坚,形成"一个底座 + 两项深水区能力"的技术布局。

传统语音交互采用 ASR → LLM → TTS 的级联管线,存在三大结构性缺陷:一是多模块串行带来的高首包延迟与误差逐级放大;二是识别环节将语音压缩为文本,副语言信息(情感、语气、说话人身份、环境声)在入口即被丢弃,下游无法感知;三是半双工的"一问一答"范式无法支持人类对话中的自然打断、抢话、边听边想。本课题面向端到端范式,让大模型直接在语音表征上完成理解与决策,在保留副语言信息的同时,实现低延迟、全双工、可打断的类人交互体验,并在此底座上攻坚同传翻译与超长音频识别两个具备独立技术难度的任务方向。

方向一:端到端实时语音交互大模型框架(统一底座)

构建语音输入直达语义理解的端到端大模型,覆盖实时流式建模、全双工交互控制、端到端语音—语义联合表征三大技术点。重点解决多模态统一底座降智问题、流式增量编码与低延迟响应、全双工场景下的双讲(double-talk)/打断/回声处理、说话节奏与轮次控制、副语言信息(情感/语气/环境)的显式建模与利用等问题。语音输出能力可参考:音频生成大模型研究课题,本方向聚焦"理解与决策之脑"。

方向二:端到端语音同传翻译技术

面向流式同声传译(streaming simultaneous translation)场景,以语音到文本翻译(S2TT)为核心,攻坚"边听边译"的读写决策(read/write policy)——在译文质量与翻译延迟之间寻找最优平衡;解决跨语言语义在不完整上下文下的增量对齐、语序差异语言(如中英、中日)的等待策略、专有名词与领域术语的流式一致性等难题。

方向三:长上下文与鸡尾酒会语音识别技术

面向小时级、会议级超长音频的识别场景,突破传统 ASR 以短句为单位、缺乏长程记忆的局限。重点研究超长音频的上下文一致性建模、跨轮次的记忆与指代消解、说话人日志(speaker diarization)与识别的联合建模、超长序列下的流式增量解码不退化、多说话人语音识别等问题,在长音频、多说话人、强噪声等复杂场景下保持识别精度与语义连贯性。

【课题挑战】

1、端到端语音—语义联合表征与预训练难题。 语音信号相比文本存在采样率高、序列长、信息稀疏的特点,如何设计既保留副语言信息、又与语言模型语义空间对齐的语音表征,并在有限的语音—文本配对数据下完成大规模预训练,避免灾难性遗忘文本大模型的通用智能,是端到端范式的核心底层挑战;

2、低延迟流式建模与全双工交互控制。 全双工要求模型在持续听的同时持续决策"说/停/让",需在流式增量编码约束下实现低首包延迟;同时要在真实声学环境中鲁棒处理双讲、打断、回声与背景噪声,设计稳定的轮次控制与打断检测机制,规避响应抖动与语义截断;

3、同传翻译的读写决策与质量—延迟平衡。 流式同传需在信息不完整时决策"再等还是先译",语序差异大的语言尤为困难;需设计自适应的等待/输出策略,在保证译文准确性、术语一致性的前提下将翻译延迟压至最低,并解决增量解码中的译文回退与修正问题;

4、超长音频的上下文一致性与流式增量解码退化难题。 小时级音频带来长程依赖、说话人切换、跨轮指代等复杂性,传统缓存与解码机制随长度膨胀且精度衰减;需研究超长序列的记忆压缩与复用、识别与说话人日志的联合建模,保证长时流式解码不退化、语义连贯不断裂;

5、端到端语音模型的评测体系缺失。 现有评测多针对单一任务(ASR词错率、翻译BLEU),缺乏对交互延迟、全双工自然度、打断处理、副语言理解、超长上下文一致性的统一量化标准;需搭建覆盖理解精度、交互体验、延迟开销、鲁棒性的全维度自动化评测平台,支撑算法有效性与稳定性验证。

【课题价值】

1、技术创新价值:突破级联语音交互架构的延迟、误差累积与信息丢失瓶颈,构建以语音为中心的端到端理解大模型统一范式,兼顾通用智能、实时全双工交互与副语言理解,填补端到端语音在实时性、长上下文、同传决策等方向的技术空白;

2、工程落地价值:彻底解决级联管线首包延迟高、副语言信息不可用、半双工体验僵硬三大工业痛点,支撑公司下一代实时语音交互、智能同传、长音频转写等自研产品的端到端升级,显著降低系统复杂度与端到端延迟;

3、业务赋能价值:大幅提升实时语音助手、会议同传、超长会议记录、多说话人转写等复杂场景的交互体验与识别效果,解决传统方案不能打断、无法感知情感语气、长音频遗忘错乱等问题,拓展语音交互的业务边界;

4、技术壁垒价值:形成完整的端到端语音建模、全双工交互控制、流式同传决策、超长音频识别技术体系,产出高水平顶会论文、自研端到端语音大模型与优化工具链,夯实公司在下一代语音交互领域的行业技术壁垒与学术影响力。

1、24-27届博士毕业生,人工智能、计算机科学、深度学习、信号处理、自然语言处理、电子信息等相关专业,具备良好的科研素养与前沿研究视野;

2、理论功底扎实,掌握深度学习与大模型核心基础理论,熟悉语音识别、语音翻译、语音交互或语音—语言多模态建模的核心原理与前沿进展,了解大模型预训练、微调、推理全链路技术体系;具备端到端语音大模型、流式建模、全双工交互相关研究经验者优先;

3、具备优秀的独立科研攻关与复杂问题拆解能力,能够精准定位端到端语音建模中的核心技术瓶颈,独立完成原创算法方案设计、原理迭代与大规模实验验证,具备较强的问题复盘与技术优化思维;

4、拥有扎实的数理推导、算法建模与实验设计能力,可独立完成语音表征学习、流式/全双工建模、同传决策、超长序列建模等方向的算法创新与消融实验;有 ICASSP、INTERSPEECH、ACL、ICLR、NeurIPS、ICML 等顶会/顶刊语音、多模态、大模型相关论文发表或录用经历优先;

5、具备良好的工程实操能力,熟练使用 PyTorch 及主流大模型训练框架(如 Megatron、DeepSpeed 等),熟悉大模型分布式训练、显存优化、推理加速等工程落地技术,具备大规模语音/多模态模型训练经验者优先;

6、具备良好的跨团队协作能力,可协同模型训练、推理加速、业务落地团队推进技术迭代,抗压能力强,能够适配工业级前沿算法研发节奏。

This is an external listing. JobSpring does not represent or verify the employer. Report this listing