GPU 集群架构技术专家 30-60k
北京 10年以上 统招本科 招1人 8月7日更新
收藏
avator
王女士 1天前在线 已认证
管理层 · 猎金未来(青岛)企业管理咨询有限公司
聊一聊
职位介绍
【我们在做什么】 我们正在构建"算力+能源+AI"融合的新一代智算集群基础设施体系,聚焦千卡/万卡级 GPU/NPU 集群的架构设计与性能优化,打造行业头部的智算集群技术能力。 【你将负责】 1、GPU 集群架构设计:主导千卡/万卡级 GPU/NPU 集群的架构设计,包括网络拓扑(Fat-Tree/Dragonfly+)、节点配置、存储架构等,确保集群高性能、高可用。 2、集群部署方案设计:设计 GPU 集群部署方案,包括硬件上架规划、GPU 驱动/CUDA/cuDNN/NCCL 等软件栈配置、集群初始化与联调。 3、算力调度与优化:设计并实现 GPU 算力调度系统,优化 GPU 资源分配策略,提升集群整体利用率和训练/推理效率。 4、分布式训练环境搭建:搭建大规模分布式训练环境,配置数据并行、模型并行、流水线并行等训练策略,优化通信效率。 5、性能调优与问题攻关:对 GPU 集群进行性能调优,定位并解决训练/推理过程中的性能瓶颈,处理 GPU 故障、显存溢出等技术问题。 6、技术标准化与知识沉淀:推进 GPU 集群技术标准演进,建立技术知识库,开展技术培训,提升团队 GPU 技术能力。 7、前沿技术跟踪:跟踪 GPU 前沿技术(NVIDIA Hopper/Blackwell 架构、HBM3e、NVLink5 等),推动新技术在集群中的应用落地。 【任职资格】 1、8 年以上 GPU 集群/高性能计算技术经验,其中 3 年以上千卡级集群架构设计经验 2、必须 AI/高性能计算行业 / 优先有 GPU 集群架构或大规模 AI 训练平台经验 / 拒绝纯传统 IT 无 GPU/AI 经验 3、本科及以上学历,硕士优先 4、优先计算机科学、人工智能、电子信息工程、并行计算等相关专业 【技能要求】 技能 1(GPU 架构):精通 NVIDIA GPU 架构(A100/H100/H200/B100 等),深入理解 CUDA 编程模型、GPU 内存层次结构、Tensor Core 加速原理。 技能 2(分布式训练):精通 PyTorch/TensorFlow 分布式训练框架,熟悉 DeepSpeed/Megatron-LM/Colossal-AI 等大模型训练框架,有千卡级集群训练经验。 技能 3(集群部署):熟悉 GPU 集群部署全流程,有千卡级 GPU 集群从 0 到 1 建设经验优先。
其他信息
语言要求:不限
行业要求:IT服务

猎聘温馨提示:

1. 如您发现平台内招聘方存在以下违规行为的,请立即举报
  • · 扣押您的身份证件或者其他证件;
  • · 要求您提供担保人、担保金或者以其他名义向您收取财物( 如培训费、体检费、资料费、置装费、押金等);
  • · 强迫您入股或者向您集资;
  • · 以招聘名义牟取不正当利益;
  • · 发布虚假招聘广告信息;
  • · 工作时长违反劳动法规定;
  • · 存在其他损害您的合法权益的行为。
2. 如您应聘的岗位属于涉外劳务合作/海外岗位的,请务必核实招聘方对外劳务合作资质取得情况,同时注意自身资金安全,防范招聘欺诈。
3. 本平台招聘方不向求职者提供任何收费服务。
查看全部

猜你喜欢

(Sr) Cloud & Data Engineer
北京-昌平区
50-70k
某北京大型制药公司
制药 融资未公开 10000人以上
郭先生
Recruiting Specialis
AI 系统工程师|大模型私有化部署方向(阿里云)
北京-朝阳区
24-40k
某美资企业
电子/半导体/集成电路 融资未公开 1000-2000人
陈先生
高级业务合伙人
1 2 3 4
更新时间:2026-08-15