智算集群运维专家 45-70k
西安 10年以上 硕士 招1人 8月12日更新
收藏
avator
陈女士 8小时前在线 已认证
人力资源经理 · 西安蓝页人力资源服务有限公司
简历处理快
聊一聊
职位介绍
岗位职责: 1. 智算集群独立运维与稳定性保障(核心职责) 负责大规模异构算力集群(包括GPU/NPU服务器、InfiniBand/RoCE高速网络、并行存储系统)的7×24小时日常运维、巡检与容量管理,对集群整体可用性(SLA)负责。 独立处理集群层面的复杂故障,快速响应并解决GPU掉卡、节点宕机、集群瘫痪、网络拥塞导致训练中断等重大问题,具备独立进行硬件级故障诊断与固件升级的能力。 2. 风险预防与深度优化 主导制定并完善集群的应急预案、风险排查机制和标准操作流程(SOP),通过巡检数据分析和主动运维,提前发现并消除潜在的系统性风险。 持续优化智算监控体系(如Prometheus+Grafana),对GPU利用率、温度、功耗、网络流量等全链路指标进行深度分析,编制专业分析报告并提出落地优化方案。 3. 自动化运维体系建设 利用Shell、Python或Go等语言开发自动化运维工具与脚本,实现集群批量部署、配置管理、故障自愈、日志分析等日常运维工作的平台化与自动化,提升运维效率。 参与算力调度系统(Slurm、Kubernetes)的运维与调优,优化资源调度策略,提升算力利用率和任务吞吐量。 4. 技术攻坚与协同 在重大故障处理中,作为甲方或业务侧的技术主导,与硬件厂商、IDC机房及研发团队高效协同,精准划定故障边界,推动问题根因修复,而非临时规避。 负责GPU服务器驱动、CUDA环境、NCCL通信库以及容器化环境(Docker/K8s)的配置、调优与版本管理。 任职要求: 1. 基本条件 全日制本科及以上学历,计算机、网络工程、电子信息、自动化等相关专业。 8年以上大型数据中心或云计算平台运维经验,其中至少最近2年以上大规模GPU智算集群或HPC集群的一线运维经验。 2. 核心技术能力 硬件与系统: 精通Linux系统管理与内核调优,熟悉主流GPU服务器(如NVIDIA DGX、浪潮、华为等)硬件架构,能独立诊断处理服务器主板、内存、GPU卡(含显存错误、NVLINK降级)、PCIe链路等硬件故障。 网络与存储: 深入理解InfiniBand或RoCEv2高速网络协议,具备处理网络拥塞、丢包等问题的实战经验。熟悉分布式存储(如Ceph、Lustre)的运维与调优。 调度与容器: 精通Kubernetes或Slurm算力调度平台的部署、运维与策略配置。熟悉容器化技术,能解决GPU透传、RDMA网络插件等容器化部署难题。 自动化与脚本: 熟练掌握Shell、Python或Go,具备独立开发自动化运维脚本及工具的能力。 3. 综合素质 独立作战与问题解决能力: 具备极强的责任心与抗压能力,能在高压环境下快速响应并独立解决复杂技术问题。 风险意识与文档能力: 具备敏锐的风险预判意识,擅长编写故障处理报告、应急预案及运维SOP规范文档。 沟通与协作: 具备与厂商进行技术博弈的能力,能基于底层日志输出清晰的故障证据链,推动外部资源高效解决问题。 4. 加分项 持有NVIDIA(如NCA)、华为、红帽等厂商相关认证证书者优先。 拥有万卡级AI集群建设或运维经验者优先。 熟悉国产GPU(如华为昇腾、摩尔线程)生态与运维者优先。 具备AI大模型训练框架(PyTorch/TensorFlow)分布式训练调优经验者优先。
其他信息
语言要求:不限
行业要求:网络/信息安全,通信设备

猎聘温馨提示:

1. 如您发现平台内招聘方存在以下违规行为的,请立即举报
  • · 扣押您的身份证件或者其他证件;
  • · 要求您提供担保人、担保金或者以其他名义向您收取财物( 如培训费、体检费、资料费、置装费、押金等);
  • · 强迫您入股或者向您集资;
  • · 以招聘名义牟取不正当利益;
  • · 发布虚假招聘广告信息;
  • · 工作时长违反劳动法规定;
  • · 存在其他损害您的合法权益的行为。
2. 如您应聘的岗位属于涉外劳务合作/海外岗位的,请务必核实招聘方对外劳务合作资质取得情况,同时注意自身资金安全,防范招聘欺诈。
3. 本平台招聘方不向求职者提供任何收费服务。
查看全部
更新时间:2026-08-16