【星火X计划】面向复杂任务的下一代Agent Harness 关键技术研发(J13986)
iFLYTEK · 安徽省·合肥市, 北京市
About The Role
【课题介绍】
随着基础大模型能力持续提升,Agent 的核心瓶颈正在从“模型能不能做”转向“系统能不能让模型稳定、安全、低成本地完成复杂任务”。本课题,重点研究长程任务执行、上下文与记忆、可靠工具调用、状态恢复、端云协同、安全控制和 Trace/Eval,建设可扩展、可恢复、安全可控、成本可度量的 Agent 运行系统。课题将以 Coding Agent 为重点验证场景,并覆盖深度研究、数据分析、浏览器操作和企业流程自动化等真实任务,打通“理解目标—获取信息—制定计划—调用工具—验证结果—修正错误—交付成果”的完整闭环。岗位以工程研发和真实系统落地为牵引,围绕关键技术难题开展前沿探索,推动研究成果在真实任务中验证、迭代与应用。
【课题挑战】
1、长程执行与上下文管理:研究任务规划与动态调整、上下文压缩和记忆机制,减少长任务中的目标漂移、错误累积和关键信息丢失,提升复杂任务的持续执行能力;
2、可靠工具执行与外部信息获取:研究Agent如何从海量工具中快速选择、组合并验证结果,减少无效和重复调用,解决调用失败、结果未知和高风险操作等问题;
3、状态恢复与安全控制:区分模型、Harness和外部环境状态,通过检查点、事件日志和执行回放支持任务中断恢复;建设权限控制、沙箱隔离、敏感操作确认和审计机制;
4、真实场景任务交付:以 Coding Agent 为重点场景,打通需求理解、代码检索、修改执行、测试回归和成果交付,提升 Agent 在复杂任务中的持续执行和错误修复能力;
5、端云协同与智能调度:研究端侧发起、云端执行和跨设备接续机制,并根据任务质量、时延、成本和风险进行模型路由、推理预算分配与多 Agent 调度;
6、Trace/Eval 与持续进化:建设可回放、可诊断的 Agent Trace 与评测体系,准确区分模型、上下文、搜索、工具和 Harness 问题,将真实任务轨迹转化为评测与优化数据。
【课题价值】
1、推动 Agent 从功能交互走向任务交付,在代码研发、深度研究、数据分析、Computer Use 和企业流程等场景中交付可验证成果;
2、打造统一的 Agent Runtime 与 Harness 技术底座,持续提升任务完成率、运行稳定性和成本效率;
3、通过标准化 API、SDK、MCP、Skills 和工具生态,降低 Agent 开发与部署门槛,服务百万开发者构建 Agent 应用;
4、建立真实任务、轨迹评测、失败归因和模型—Harness 优化闭环,沉淀核心系统、评测基准、论文、专利和开源成果。
1、28届及以后在读硕士及以上学历,计算机、软件工程、人工智能及相关专业优先,其他专业但具备突出工程能力者同样欢迎;
2、具备扎实的计算机基础和软件工程能力,熟练掌握 Rust、Python、TypeScript、Go、Java 或 C++ 中至少一种语言;
3、有真实项目经历,课程、竞赛、科研、个人或开源项目均可,能够清楚说明设计思路、技术取舍和问题解决过程;
4、了解 LLM 和 Agent 基本原理,熟悉 Agent Loop、Tool Use、Context、Memory、Planning、Skills、MCP 等基本概念,并使用过 AI Coding 工具或 Agent 产品;
5、具备较强的学习、动手和问题分析能力,能够通过测试、日志和执行轨迹定位问题,完成原型开发与实验验证;
6、具备良好的技术表达和协作能力,关注任务是否真正完成、结果是否经过验证以及系统能否稳定运行。
【加分项】
1、开发或深度改造过 Agent Framework、Agent Runtime、MCP Server、Coding Agent 或多 Agent 系统,具备上下文管理、记忆系统或 Token 优化相关实践;
2、具备 AI Search、RAG、分布式系统、云端执行、安全沙箱、可观测性或端云协同等相关经验;
3、具备 Agent Evaluation、数据合成、强化学习或过程监督相关实践;拥有高质量开源项目、论文、专利或竞赛成果者优先。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring