智算集群运维专家
45-70k
西安
10年以上
硕士
招1人
8月12日更新
人力资源经理
· 西安蓝页人力资源服务有限公司
简历处理快
聊一聊
- 职位介绍
- 岗位职责:
1. 智算集群独立运维与稳定性保障(核心职责)
负责大规模异构算力集群(包括GPU/NPU服务器、InfiniBand/RoCE高速网络、并行存储系统)的7×24小时日常运维、巡检与容量管理,对集群整体可用性(SLA)负责。
独立处理集群层面的复杂故障,快速响应并解决GPU掉卡、节点宕机、集群瘫痪、网络拥塞导致训练中断等重大问题,具备独立进行硬件级故障诊断与固件升级的能力。
2. 风险预防与深度优化
主导制定并完善集群的应急预案、风险排查机制和标准操作流程(SOP),通过巡检数据分析和主动运维,提前发现并消除潜在的系统性风险。
持续优化智算监控体系(如Prometheus+Grafana),对GPU利用率、温度、功耗、网络流量等全链路指标进行深度分析,编制专业分析报告并提出落地优化方案。
3. 自动化运维体系建设
利用Shell、Python或Go等语言开发自动化运维工具与脚本,实现集群批量部署、配置管理、故障自愈、日志分析等日常运维工作的平台化与自动化,提升运维效率。
参与算力调度系统(Slurm、Kubernetes)的运维与调优,优化资源调度策略,提升算力利用率和任务吞吐量。
4. 技术攻坚与协同
在重大故障处理中,作为甲方或业务侧的技术主导,与硬件厂商、IDC机房及研发团队高效协同,精准划定故障边界,推动问题根因修复,而非临时规避。
负责GPU服务器驱动、CUDA环境、NCCL通信库以及容器化环境(Docker/K8s)的配置、调优与版本管理。
任职要求:
1. 基本条件
全日制本科及以上学历,计算机、网络工程、电子信息、自动化等相关专业。
8年以上大型数据中心或云计算平台运维经验,其中至少最近2年以上大规模GPU智算集群或HPC集群的一线运维经验。
2. 核心技术能力
硬件与系统: 精通Linux系统管理与内核调优,熟悉主流GPU服务器(如NVIDIA DGX、浪潮、华为等)硬件架构,能独立诊断处理服务器主板、内存、GPU卡(含显存错误、NVLINK降级)、PCIe链路等硬件故障。
网络与存储: 深入理解InfiniBand或RoCEv2高速网络协议,具备处理网络拥塞、丢包等问题的实战经验。熟悉分布式存储(如Ceph、Lustre)的运维与调优。
调度与容器: 精通Kubernetes或Slurm算力调度平台的部署、运维与策略配置。熟悉容器化技术,能解决GPU透传、RDMA网络插件等容器化部署难题。
自动化与脚本: 熟练掌握Shell、Python或Go,具备独立开发自动化运维脚本及工具的能力。
3. 综合素质
独立作战与问题解决能力: 具备极强的责任心与抗压能力,能在高压环境下快速响应并独立解决复杂技术问题。
风险意识与文档能力: 具备敏锐的风险预判意识,擅长编写故障处理报告、应急预案及运维SOP规范文档。
沟通与协作: 具备与厂商进行技术博弈的能力,能基于底层日志输出清晰的故障证据链,推动外部资源高效解决问题。
4. 加分项
持有NVIDIA(如NCA)、华为、红帽等厂商相关认证证书者优先。
拥有万卡级AI集群建设或运维经验者优先。
熟悉国产GPU(如华为昇腾、摩尔线程)生态与运维者优先。
具备AI大模型训练框架(PyTorch/TensorFlow)分布式训练调优经验者优先。
- 其他信息
- 语言要求:不限
- 行业要求:网络/信息安全,通信设备
猎聘温馨提示:
- 1. 如您发现平台内招聘方存在以下违规行为的,请立即举报
-
- · 扣押您的身份证件或者其他证件;
- · 要求您提供担保人、担保金或者以其他名义向您收取财物( 如培训费、体检费、资料费、置装费、押金等);
- · 强迫您入股或者向您集资;
- · 以招聘名义牟取不正当利益;
- · 发布虚假招聘广告信息;
- · 工作时长违反劳动法规定;
- · 存在其他损害您的合法权益的行为。
- 2. 如您应聘的岗位属于涉外劳务合作/海外岗位的,请务必核实招聘方对外劳务合作资质取得情况,同时注意自身资金安全,防范招聘欺诈。
- 了解更多安全防范知识>
- 3. 本平台招聘方不向求职者提供任何收费服务。
查看全部