【星火X计划】面向复杂场景的全双工多模态交互系统研发(J13806)
iFLYTEK · 安徽省·合肥市
About The Role
【课题介绍】
本课题致力于研发一套面向复杂场景(智能座舱、机器人等)的全双工多模态交互系统,针对当前交互系统在多人、高噪声环境下误触发率高、对话无法自然打断、异常插话、交互体验生硬等关键问题,围绕“多模态与多通道音频流式融合”、“复杂动态声学环境鲁棒性”、“‘人人/人机’交互毫秒级判定”以及“端侧受限算力下的极低时延部署”等核心技术难题展开创新性研发。通过深度整合视觉视线、唇动特征与声纹语义等多维信息,打破传统单向唤醒机制的束缚,实现“边看边听边说、极速响应、无感打断、不乱接话”的拟人化自然交互体验。
【课题挑战】
1、端到端多模态流式数据融合与极致低时延的冲突:全双工交互要求响应时延低于 500ms(甚至达到 200-300ms 的人类自然反应水平)。然而,多模态(视觉眼动、唇语、多通道音频)流式数据的输入与对齐需要极高的计算开销。如何在保障多模态特征深度融合的前提下,实现极低延迟的流式推理与决策,是首要挑战;
2、多人复杂场景下“人-人”与“人-机”意图边界的精准判定:在无唤醒词的连续双工状态下,存在大量的“人-人闲聊”、“讲电话”与“人-机对话”交织的场景。系统需利用视觉(视线朝向、唇动)与声学(声纹、语气、语义)的多维信息,在毫秒级内精准断定用户是在与旁人说话还是在对系统下达指令,避免“误唤醒”和“乱接话”;
3、复杂动态声学环境下的声学鲁棒性:针对座舱非平稳噪声环境(风噪、胎噪、雨打车顶声、车内音乐回声及后排儿童嘈杂声)以及机器人移动场景各类周边环境噪声,在全双工过程中,不仅要实现高质量的噪声消除,还要考虑大音量播放音乐或多人同时发声时,能够精准提取并识别目标用户的语音、声纹、语义特征,实现高噪场景的精准交互;
4、端侧受限算力下的多模态大模型部署与优化:多模态大模型参数量大(太小可能效果不行)、计算复杂度高。而在端侧芯片算力、内存受限且需兼顾系统稳定性的环境下,如何进行模型裁剪、量化压缩以及异构算力的高效调度,以极低功耗实现端侧常驻运行,是工程落地上面临的巨大挑战。
【课题价值】
1、用户体验价值:重塑人机交互,打造“免唤醒式”自然交互体验。彻底告别机械、死板的“一问一答”及频繁唤醒的传统模式。通过实现边看边听边说、自然打断、智能插话,使语音助手真正具备类人般的自然交流体验,极大地降低用户的学习和交互成本,实现真正无负担的交互;
2、技术引领价值:实现全双工多模态交互大模型在汽车等行业的率先落地,抢占下一代交互技术研发落地制高点。本课题的研究成果将攻克多模态大模型在端侧算力平台落地的行业难题,沉淀出轻量化多模态融合算法、流式多模态全双工交互大模型架构等前沿技术成果,抢占下一代交互技术制高点;
3、商业竞争价值:构筑差异化卖点,实现市占和品牌突破。本课题研发的全双工多模态交互系统,将为汽车、机器人等行业树立全新的人机交互标杆,成为极具科技代差的独特卖点。通过实现“边看边听边说、极速响应、无感打断、智能插话”的拟人化交互,能够彻底打破当前交互体验同质化的瓶颈,显著提升座舱、机器人等产品的科技感与品牌溢价。
1、24-27届博士毕业生,人工智能、计算机科学、深度学习、应用数学、自然语言处理、电子信息等相关专业,具备良好的科研素养与前沿研究视野;
2、理论功底扎实,精通深度学习与大模型核心基础理论,熟悉线性注意力、稀疏注意力的核心原理与技术优劣,掌握大模型预训练、微调、推理全链路技术体系,了解大规模模型训练的各类并行调度优化方案;具备多模态大模型预训练及相关前沿研究经验者优先;
3、具备优秀的独立科研攻关与复杂问题拆解能力,能够精准挖掘多模态大模型预训练过程中的核心技术瓶颈,独立完成原创算法方案设计、原理迭代与大规模集群实验验证,具备较强的问题复盘与技术优化思维;
4、拥有扎实的数理推导、算法建模与实验设计能力,可独立完成超长序列建模、注意力机制创新、消融实验设计与多维度性能对标分析;有ICLR、NeurIPS、ICML等顶会长序列建模、注意力机制相关论文发表或录用经历优先;
5、具备良好的工程实操能力,熟练使用PyTorch、Megatron、TorchTitan等主流深度学习及大模型训练工具与框架,熟悉大模型分布式训练、显存优化、算力调度等工程落地技术;
6、具备良好的跨团队协作能力,可协同模型训练、推理加速、业务落地团队推进技术迭代,抗压能力强,能够适配工业级前沿算法研发节奏。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring