大模型训推平台技术专家 70-100k·15薪
上海 经验不限 学历不限 招1人 8月4日更新
收藏
avator
万女士 1天前在线 已认证
猎头顾问/助理 · 上海帕莱德人力资源有限公司
简历处理快 回复速度快
聊一聊
职位介绍
工作职责: 围绕自研大模型训推一体化平台,独立负责以下一个或多个方向的架构设计与落地: 1.大规模预训练资源调度 设计 GPU 万卡级集群调度系统,支持拓扑感知、跨机房调度与多租户配额;基于 K8s/Volcano 等构建调度内核,训练任务排队、抢占、弹性调度,持续提升集群 GPU 利用率;拓扑感知放置(NVLink/IB)与跨机房/跨可用区调度,最小化跨交换机通信开销;通信与存储 IO 路径优化,配合训练框架提升端到端通信效率 2.自动故障检测与恢复: 构建训练全链路健康监测与自愈闭环,最小化故障对训练进度的影响。训练全链路健康监测:NCCL hang、GPU Xid、网络抖动、存储异常的自动检测Checkpoint 自动管理 + 断点续训,故障迁移后快速恢复故障自愈闭环:检测 → 诊断 → 迁移 → 恢复,沉淀故障知识库与回溯能力 3.模型训推 DevOps 打通"代码→镜像→训练→产物→上线"全流程,构建训推一体化交付闭环。镜像与产物治理:训练/推理基础镜像标准化,模型权重与 Checkpoint 版本化 registry,统一 artifacts 生命周期管理 CI/CD 与发布:训练代码与推理服务持续集成(镜像构建/单测/自动评测),推理灰度发布、回滚、A-B 流量切换 可观测与稳定性:训练任务与推理服务的指标/日志/链路监控,SLI/SLO 与告警闭环,故障注入与应急演练 任职要求 1.本科及以上,5 年以上 Infra / 平台工程经验,能独立负责一个技术方向的架构与落地 2.精通 Go 或 Python,深入理解 K8s 生态与 Operator 模式 3.理解分布式训练(DDP/Pipeline/MoE)或大模型推理 Serving 架构 4.GPU 集群调度、训练框架、推理引擎至少其一有深度实战经验 5.熟悉 NCCL / IB / RDMA 等高性能网络
其他信息
语言要求:不限
行业要求:互联网

猎聘温馨提示:

1. 如您发现平台内招聘方存在以下违规行为的,请立即举报
  • · 扣押您的身份证件或者其他证件;
  • · 要求您提供担保人、担保金或者以其他名义向您收取财物( 如培训费、体检费、资料费、置装费、押金等);
  • · 强迫您入股或者向您集资;
  • · 以招聘名义牟取不正当利益;
  • · 发布虚假招聘广告信息;
  • · 工作时长违反劳动法规定;
  • · 存在其他损害您的合法权益的行为。
2. 如您应聘的岗位属于涉外劳务合作/海外岗位的,请务必核实招聘方对外劳务合作资质取得情况,同时注意自身资金安全,防范招聘欺诈。
3. 本平台招聘方不向求职者提供任何收费服务。
查看全部
更新时间:2026-08-15