← Back to job listings
CM
大模型数据主任工程师 LLM Data Staff Engineer(J21151)
ChangXin Memory (CXMT) · 北京市, 安徽省·合肥市
About The Role
- 训练数据体系构建:主导半导体领域大模型训练数据体系建设,包括领域语料(芯片设计、工艺、测试、失效分析文档、专利、行业报告)的采集、清洗、去重、质量评估与分级管控;
- 文档解析与数据生产Pipeline构建:设计并实现针对PDF、PPT、图表(wafer map、时序图、参数表)等非结构化文档的解析、结构化抽取与入库,持续优化解析准确率与吞吐能力;
- 术语库与知识库建设:主导半导体专业术语与缩写的归一化与对齐工作,支撑知识图谱构建及检索增强生成(RAG)语料准备;
- 指令数据与评测集运营:设计并运营有监督微调(SFT)指令数据与领域评测集,协同工艺、设计、测试专家制定标注规范,构建术语问答、参数查询、故障诊断类评测数据,跟踪模型幻觉问题并迭代优化;
- 大规模分布式数据处理平台搭建:基于Spark/Ray等框架搭建分布式数据处理任务,建立数据元信息、血缘与版本管理体系,保障敏感数据的合规流转与脱敏。
- 教育背景与专业知识:硕士及以上学历,计算机、数据科学、AI或相关专业,能区分预训练、有监督微调、检索增强生成各阶段对数据质量与格式的不同要求;
- 专业技能与资格:能使用Python开发并维护数据Pipeline,能使用Spark、Flink或Ray等分布式框架完成TB级以上数据处理与性能调优;能使用非结构化文档解析工具(如PyMuPDF、OCR)完成PDF、图表、表格的结构化抽取;能通过Git、CI/CD进行版本管理与持续集成;
- 行业与专业经验:2年以上数据工程或大语言模型(LLM)数据处理相关全职工作经验,具有半导体电子行业文档处理经验者优先考虑;
- 项目/任务成果:主导完成至少一个大规模离线数据Pipeline从开发到上线的完整交付;主导完成至少一个LLM语料治理或非结构化文档解析项目,涵盖需求分析、方案设计、落地迭代全阶段;
- 其他要求:具有数据安全与合规意识,能设计敏感数据脱敏与分级保护方案;具有跨团队协作能力,能与领域专家及算法工程师对齐需求并主动推动问题闭环;有HuggingFace生态或开源语料项目贡献者优先考虑。
Similar roles you might like
See all →Q(
Sales Executive, Injectable Aesthetics
QMED (CN)
Salary not disclosedPosted today
CZ
PE Engineer
Carl Zeiss Vision Guangzhou Ltd.
Salary not disclosedPosted today
6S
Para Staff, Converting Operation
6929 Sateri (China) Fiber Co., Ltd.
Salary not disclosedPosted today
1-
Site Coordinator
13 - CP International, LLC
Salary not disclosedPosted today
D
(Senior) Optical Engineer Pipeline
danaher
Salary not disclosedPosted today
D(
Associated Manager
Dentsu (Shanghai) Investment Co., Ltd Guangzhou Branch
Salary not disclosedPosted today
D(
AI Production (AIGC) Talent Pool
Dentsu (Shanghai) Investment Co., Ltd.
Salary not disclosedPosted today
D(
Performance Marketing Talent Pool
Dentsu (Shanghai) Investment Co., Ltd.
Salary not disclosedPosted today
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
