Skip to content
← Back to job listings

大模型数据主任工程师 LLM Data Staff Engineer(J21151)

ChangXin Memory (CXMT) · 北京市, 安徽省·合肥市

Imported listingfull-time7 days ago

About The Role

  1. 训练数据体系构建:主导半导体领域大模型训练数据体系建设,包括领域语料(芯片设计、工艺、测试、失效分析文档、专利、行业报告)的采集、清洗、去重、质量评估与分级管控;
  2. 文档解析与数据生产Pipeline构建:设计并实现针对PDF、PPT、图表(wafer map、时序图、参数表)等非结构化文档的解析、结构化抽取与入库,持续优化解析准确率与吞吐能力;
  3. 术语库与知识库建设:主导半导体专业术语与缩写的归一化与对齐工作,支撑知识图谱构建及检索增强生成(RAG)语料准备;
  4. 指令数据与评测集运营:设计并运营有监督微调(SFT)指令数据与领域评测集,协同工艺、设计、测试专家制定标注规范,构建术语问答、参数查询、故障诊断类评测数据,跟踪模型幻觉问题并迭代优化;
  5. 大规模分布式数据处理平台搭建:基于Spark/Ray等框架搭建分布式数据处理任务,建立数据元信息、血缘与版本管理体系,保障敏感数据的合规流转与脱敏。
  6. 教育背景与专业知识:硕士及以上学历,计算机、数据科学、AI或相关专业,能区分预训练、有监督微调、检索增强生成各阶段对数据质量与格式的不同要求;
  7. 专业技能与资格:能使用Python开发并维护数据Pipeline,能使用Spark、Flink或Ray等分布式框架完成TB级以上数据处理与性能调优;能使用非结构化文档解析工具(如PyMuPDF、OCR)完成PDF、图表、表格的结构化抽取;能通过Git、CI/CD进行版本管理与持续集成;
  8. 行业与专业经验:2年以上数据工程或大语言模型(LLM)数据处理相关全职工作经验,具有半导体电子行业文档处理经验者优先考虑;
  9. 项目/任务成果:主导完成至少一个大规模离线数据Pipeline从开发到上线的完整交付;主导完成至少一个LLM语料治理或非结构化文档解析项目,涵盖需求分析、方案设计、落地迭代全阶段;
  10. 其他要求:具有数据安全与合规意识,能设计敏感数据脱敏与分级保护方案;具有跨团队协作能力,能与领域专家及算法工程师对齐需求并主动推动问题闭环;有HuggingFace生态或开源语料项目贡献者优先考虑。

This is an external listing. JobSpring does not represent or verify the employer. Report this listing