Skip to content
← Back to job listings

Coding评测工程师

step · 徐汇区, 上海市, 中国; 海淀区, 北京市, 中国

External listingfull-time14 days ago

About The Role

一句话定义 负责大模型代码能力的评测体系建设与持续演进。定义模型在软件工程场景下的能力发展方向、质量标准,并构建可抵御刷分的评测体系,要求兼具一线工程判断力与AI评测方法论 工作范围 评测环境构建 为模型在特定方向上构建完整的任务完成环境,将真实软件开发流程抽象为可复现、可扩展的评测用例 设计模拟真实软件工程场景的评测环境,包含需求分析、架构设计、多文件编辑、Debug、测试覆盖等完整链路 评测标准制定 制定覆盖多语言的代码能力评测标准(正确性、代码质量、复杂度处理、工程规范等),建立能力基线并持续追踪 设计超越简单Pass/Fail的多维度评估维度,涵盖正确性、安全性、鲁棒性、可读性、执行效率等指标 基于评测结果进行结构化分析,持续迭代优化Rubric标准 评测数据工程 完成评测数据的全流程处理,包括数据清洗、过滤、去重与质量校验,构建高质量评测数据集 负责评测数据、评测样本与Benchmark的建设与治理,保障评测结果的客观性与可复现性 建立评测-训练闭环迭代机制,使能力提升可量化 人才画像 技术背景:计算机科学、人工智能、软件工程等相关专业,本科及以上学历 编程能力:精通Python,熟练掌握至少一种其他编程语言(Java/Go/C++/TypeScript等),有跨语言工程实践经验 工程经验: 具备复杂系统或产品的核心研发经验,能清晰阐述关键设计决策与权衡 评测经验:熟悉评测集、指标体系、Rubric设计及自动化评测流程,有评测平台、数据流水线或实验系统建设经验 LLM认知:对主流大模型的原理、能力边界及典型应用场景有较深入理解,熟悉大模型与Agent的常见评测方法 工具链:熟悉Linux、容器技术(Docker)及编排工具;熟悉主流LLM评测基准与方法论(HumanEval、SWE-bench等) 加分项 有安全、隔离的代码执行沙箱环境构建经验 有桌面沙盒与虚拟机环境相关构建经验,支持桌面端代码编译打包、应用启动、进程健康、UI渲染、跨平台一致性等验证环节 熟悉容器技术及编排工具,支持大规模并发调度的评测执行 有Broswer Use、自动化测试等相关项目经验

This is an external listing. JobSpring does not represent or verify the employer. Report this listing