GPU 片上互联架构师(J10922)
Moore Threads · 北京市, 四川省·成都市
About The Role
我们正在研发面向AI训练与推理场景的GPU/AI加速器芯片,面向大规模并行计算、高带宽存储访问和复杂片上数据流构建高性能片上互联系统。该岗位将负责GPU片上互联/NoC/fabric的架构定义、功能规格制定、性能目标拆
解、建模分析和跨模块协同设计。
候选人需要深入理解GPU内部computecluster、cachehierarchy、memory subsystem、DMA/copyengine、hostinterface等模块之间的数据流和访问模式,能够通过C++/SystemC/Python等工具进行架构级或性能级建模,并基于workload、trafficpattern和性能数据推动片上互联架构设计决策。
核心职责:
1.负责GPU/AI加速器芯片内部片上互联、NoC、fabric、crossbar、memory fabric等模块的架构定义和功能规格编写。
2.定义片上互联的transactionmodel、packetformat、request/response flow、routing、arbitration、QoS、virtualchannel、ordering、flow control、backpressure、deadlock/livelockavoidance等关键机制。
3.分析GPU内部SM/computecluster、L1/L2cache、memorycontroller、HBM/DRAMinterface、DMA、copyengine、hostinterface、coherent/non-coherentagent等模块之间的数据流、控制流和带宽需求。
4.评估片上互联在不同workload和trafficpattern下的性能瓶颈,包括带宽、延迟、拥塞、hotspot、incast、head-of-lineblocking、buffer occupancy、backpressurepropagation等问题。
5.进行NoC/fabric微架构trade-off分析,包括topology、router pipeline、crossbar结构、buffersizing、VC数量、arbiter策略、credit-basedflowcontrol、QoSpolicy、clock/powerdomaincrossing等。
6.搭建、维护或扩展C++/SystemC/Python架构模型和性能模型,用于早期架构评估、参数搜索、性能瓶颈定位和设计方案对比。
7.与RTL、验证、性能建模、软件、编译器、驱动、物理设计、DFT等团队协作,推动互联架构规格落地为可实现、可验证、可收敛的芯片设计。
8.支持benchmark、trafficgenerator、stresspattern、cornercase、QoSscenario和性能验证用例定义,为架构模型、RTL仿真和emulation提供输入。
9.参与片上互联与cachecoherence、memoryconsistency、atomic、barrier、DMA、addressmapping、partitioning、IOMMU/addresstranslation等机制的协同设计。
10.输出并维护架构规格文档、接口协议文档、性能分析报告、设计决策记录、配置参数说明和跨团队对齐材料。
1.计算机体系结构、微电子、电子工程、计算机科学或相关专业背景。
2.熟悉GPU、AIaccelerator、high-performanceSoC、CPU、DPU、networkprocessor等复杂芯片架构中的至少一种。
3.熟悉片上互联NoC、busfabric、crossbar、router、cachefabric、memorysubsystem中至少一种关键模块或子系统。
4.理解常见片上互联机制,包括但不限于routing、arbitration、flow
control、QoS、virtualchannel、credit-basedflowcontrol、ordering、deadlock/livelockavoidance、backpressure等。
5.具备较强的C++建模能力,能够编写结构清晰、可维护、可扩展的架构级或性能级模型。
6.能够基于workloadtrafficpattern分析片上互联的带宽、延迟、拥塞、buffer占用和资源瓶颈。
7.具备良好的系统分析能力,能够在性能、面积、功耗、复杂度、可验证性和可实现性之间进行工程trade-off。
8.具备良好的跨团队沟通能力,能够与RTL、验证、软件、性能、物理设计等团队协同推进架构方案落地。
9.能够阅读和编写英文技术文档,具备清晰的技术文档表达能力。
加分项:
1.有GPUNoC、AIacceleratorNoC、L2cachefabric、memoryfabric、coherentinterconnect或高性能SoCfabric相关设计经验。
2.熟悉SystemC/TLM、gem5、BookSim、GPGPU-Sim、Accel-Sim或自研性能模型。
3.熟悉AMBAAXI/ACE/CHI、TileLink、CXL、PCIe、NVLink、UCIe或其他片上/片间互联协议。
4.有RTL设计或验证经验,熟悉Verilog/SystemVerilog,能够理解RTL实现约束和验证复杂度。
5.熟悉cachecoherence、memoryconsistency、atomic、barrier、DMA、IOMMU、addresstranslation、memoryordering等机制。
6.有GPU、AI芯片、CPU、DPU、交换芯片、网络芯片或大规模SoCtapeout经验。
7.有性能分析、workloadcharacterization、benchmark建模、trafficgenerator设计或架构参数探索经验。
8.熟悉AI训练/推理workload的典型数据流,例如GEMM、attention、MoE、collectivecommunication、KVcache、activation/weightmovement等。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring